SplitMoE يقدم توجيهًا دقيقًا للخبراء لتقليل ازدواجية المعلمات
SplitMoE هو بديل لهيكل Mixtures of Experts يكسر الطبقات العريضة للتغذية الأمامية إلى مكونات فرعية أصغر ومتخصصة لتحسين مرونة تمثيل الرموز والوحدة الحسابية.
SplitMoE هو بديل لهيكل Mixtures of Experts يكسر الطبقات العريضة للتغذية الأمامية إلى مكونات فرعية أصغر ومتخصصة لتحسين مرونة تمثيل الرموز والوحدة الحسابية.
مولد حالة العالم (WSG) هو نموذج يحافظ على مزامنة خطط وكلاء اللغة مع قواعد بيئة التنفيذ الخاصة بهم عن طريق إعادة كتابة الحالات بعد الفشل. تم تدريبه على 226K مسارًا مستخرجًا من سبعة مجالات اصطناعية حيث يفرض برنامج القواعد ويتحقق من إمكانية الوصول إلى الهدف.
يقدم المؤلفون Fathom-Vaidya، وهو نموذج بـ 30B معلمة يستخدم بيانات اصطناعية وتعلّم التعزيز القائم على المعايير لتعزيز الاستدلال التشخيصي والسريري في الرعاية الصحية. يطبق إطار التدريب أولاً RL الموجه بالقواعد على الأسئلة المستمدة من MedBullets للتشخيص، ثم يستخدم 5.3k سيناريوهات اصطناعية متعددة الأدوار بمعايير متعددة الأبعاد لمهام سريرية تفاعلية.
واجه جين وي دوامة موت معدل التعلم أثناء اختبار AdamW و Muon وأحدث تنفيذ لـ Dion3 داخل OLMo-core لمحاضرة قادمة في مؤتمر PyTorch.
يقدم المؤلفون Fathom-Vaidya، وهو نموذج بـ 30 مليار معلمة يستخدم بيانات اصطناعية وتعلّم التعزيز القائم على المعايير لتعزيز كل من الاستدلال التشخيصي والإكلينيكي في الرعاية الصحية. يستهدف إطار التدريب أولاً الدقة التشخيصية باستخدام أسئلة مستمدة من MedBullets ثم يتعامل مع التفاعلات الإكلينيكية متعددة الأدوار عبر 5.3 ألف سيناريو تم إنشاؤه بمعايير متعددة الأبعاد.
يقدم المؤلفون Fathom-Vaidya، وهو نموذج يحتوي على 30 مليار معلمة يستخدم بيانات اصطناعية وتعلّم التعزيز القائم على معايير التقييم لتعزيز كل من الاستدلال التشخيصي والسريري في الرعاية الصحية.
أطلقت تايب سيف آي جيف، وهو فئة جديدة من نماذج "النظام الأول" مصمّمة لبيئات الإنتاج. يجادل ديغو ألميدا، الرئيس التنفيذي للشركة والمؤلف المشارك لورقة إنستركت جي بي تي (InstructGPT)، بأن النماذج المتقدمة الحالية أولت الأولوية للمواءمة والرفض على حساب الموثوقية، ما أدى إلى مشكلات مثل الهلوسة والخضوع المفرط.
أصدرت MB-Bidram بنية عصبية تجريبية تُعرف باسم WideNDepth (WND) مصممة لفصل قدرات الاستدلال عن تخزين المعرفة. يتكون النموذج من "جزء واسع" يعمل كذاكرة و"جزء عميق" يعمل كمستدل.
تناقش اقتراح على Hugging Face مشكلتين مترابطتين في الذكاء الاصطناعي: الاعتماد على تدريب نماذج كبيرة منفصلة واعتماد النظام البيئي على وحدات معالجة الرسومات ذات الأغراض العامة.
يقترح مستخدم في منتديات Hugging Face تجربة في النقل المعرفي التدريجي، حيث يتعلم نموذج طالب ذو حجم ثابت (Qwen 4B) بشكل تسلسلي من نماذج معلمة أكبر فأكبر بدلاً من التعلم مباشرةً من الأكبر حجماً المتاح.
أعلنت OpenAI عن إطار عمل جديد لتتبع والتحقيق والإفصاح عن عدم التوافق في نماذجها، مصحوبًا بستة تقارير مفصلة حول الحوادث من تدريب التعلم بالتعزيز. يحدد النظام معايير ومواعيد نهائية محددة للإفصاح العام، وينطبق حتى عندما لا يكون السلوك موضحًا أو مخففًا بالكامل.
قام باحثو ByteLex ببناء فضاء إحداثيات من 11 مفردات للمُرمِّز للتنبؤ بالكلمات المصطنعة التي سيفشل فيها نموذج اللغة على مستوى البايت الخاص بهم. حققت الخريطة ارتباط سبيرمان بقيمة -0.98 مع دقة النموذج المقاسة لكل كلمة، متفوقةً على الإحصائيات المستمدة من المجموعة النصية.
أطلقت OpenAI نموذج Open-1B، وهو نموذج لغوي تم تدريبه في نظام حيث يمكن إعادة إنتاج كل عملية أثناء التدريب بشكل مستقل على عتاد تجاري متنوع بدقة بتية. يعالج هذا النهج مشكلات إمكانية إعادة الإنتاج الكامنة في النماذج مفتوحة المصدر من خلال فرض ترتيب محدد لمصادر عدم الحتمية، مثل اختزال نوى وحدة معالجة الرسومات وترتيب دفعات البيانات.
يقدم TRL v1.14 دعمًا لـ LoRA في AsyncGRPOTrainer، مما يتيح له تدريب محوّل Low-Rank Adaptation ومزامنة ذلك الملف الصغير فقط مع عملاء الاستدلال من vLLM. يفصل هذا الهيكل وظائف التدريب عن وظائف التوليد على آلات منفصلة باستخدام Storage Bucket مشترك كجسر لنظام الملفات، مما يلغي الحاجة إلى NCCL أو الاتصال المباشر بالشبكة بين العقد.
نشر المستخدم pop123-ux مستودع تعلم يحتوي على 38 دفتر ملاحظات قابلًا للتنفيذ مصممة لمساعدة المستخدمين على فهم مجموعة Hugging Face من خلال إزالة التجريدات عالية المستوى تدريجيًا. يغطي المجموعة مسارًا من المكونات الأساسية مثل transformers و tokenizers إلى الضبط الدقيق، PEFT، الاستدلال/RL، والعمل على المشاريع من البداية للنهاية.
قامت Together AI بتوسيع خدمة التدريب الدقيق لدعم مجموعة أوسع من النماذج مفتوحة الأوزان، بما في ذلك GLM-5.3 وKimi K2.7، مع تقديم تتبع التجارب المباشر وتحكم أدق في عملية التدريب.
قدم باحثون من جوجل وعدة جامعات يابانية إطار عمل ToolGrad، الذي يعكس خط الأنابيب التقليدي لتوليد مجموعات بيانات استخدام الأدوات من خلال بناء سلاسل واجهات برمجة التطبيقات (API) المُتحقق منها أولاً ثم كتابة استعلامات المستخدم المطابقة لها. تهدف هذه الطريقة إلى القضاء على عدم كفاءة الأساليب القائمة على الاستعلام أولاً والتي غالباً ما تفشل أثناء استكشاف الوكيل.
يقدم الباحثون إطار عمل ExecCritic، الذي يجمع بين هيكل اختبار-تحقق-مراجعة وتعزيز التعلم المحدد للدور لتعزيز وكلاء البرمجة. يفصل النظام بين بناء الاختبار وإصلاح الشفرة المصدرية، باستخدام وكيل اختبار لتوليد اختبارات أصلية للمستودع ووكيل إصلاح لمراجعة الكود استنادًا إلى ملاحظات التنفيذ.
memaudit هو أداة تدمج مع مكتبة TRL للتحقق مما إذا كان ضبط النماذج الدقيقة على بيانات خاصة قد أدى إلى التذكر. يعمل عن طريق حقن أسرار فخية معايرة في مجموعة البيانات ومراقبة الخسارة خلال عملية التدريب.
تُظهر دemonstration أن تجميد حالات المفتاح-القيمة (KV) من نص دليل يسمح لنموذج Qwen2.5-3B-Instruct بتطبيق تعليمات جديدة دون تضمين الدليل في الموجه المباشر. تتضمن الطريقة تشغيل دليل عبر النموذج مرة واحدة، وتجميد ذاكرة التخزين المؤقت KV الخاصة به، ثم توليد استجابات فوق هذا البادئ المخفي.