Training methods
arxiv arXiv cs.AI · منذ 22 ساعة · 11 مشاهدة

مولد حالة العالم يزامن الخطط مع العوالم الاصطناعية لتحسين نجاح الوكيل

مولد حالة العالم (WSG) هو نموذج يحافظ على مزامنة خطط وكلاء اللغة مع قواعد بيئة التنفيذ الخاصة بهم عن طريق إعادة كتابة الحالات بعد الفشل. تم تدريبه على 226K مسارًا مستخرجًا من سبعة مجالات اصطناعية حيث يفرض برنامج القواعد ويتحقق من إمكانية الوصول إلى الهدف.

arxiv arXiv cs.LG · منذ 1 يوم HealthBench · 50.1% · 10 مشاهدات

Fathom-Vaidya يحسّن الاستدلال الطبي باستخدام مكافآت قائمة على المعايير

يقدم المؤلفون Fathom-Vaidya، وهو نموذج بـ 30B معلمة يستخدم بيانات اصطناعية وتعلّم التعزيز القائم على المعايير لتعزيز الاستدلال التشخيصي والسريري في الرعاية الصحية. يطبق إطار التدريب أولاً RL الموجه بالقواعد على الأسئلة المستمدة من MedBullets للتشخيص، ثم يستخدم 5.3k سيناريوهات اصطناعية متعددة الأدوار بمعايير متعددة الأبعاد لمهام سريرية تفاعلية.

arxiv arXiv cs.AI · منذ 1 يوم HealthBench · 50.1% · 12 مشاهدة

Fathom-Vaidya يحسّن الاستدلال الطبي باستخدام مكافآت قائمة على المعايير

يقدم المؤلفون Fathom-Vaidya، وهو نموذج بـ 30 مليار معلمة يستخدم بيانات اصطناعية وتعلّم التعزيز القائم على المعايير لتعزيز كل من الاستدلال التشخيصي والإكلينيكي في الرعاية الصحية. يستهدف إطار التدريب أولاً الدقة التشخيصية باستخدام أسئلة مستمدة من MedBullets ثم يتعامل مع التفاعلات الإكلينيكية متعددة الأدوار عبر 5.3 ألف سيناريو تم إنشاؤه بمعايير متعددة الأبعاد.

arxiv arXiv cs.CL · منذ 1 يوم HealthBench · 50.1% · 12 مشاهدة

Fathom-Vaidya يحسّن الاستدلال الطبي باستخدام مكافآت قائمة على معايير التقييم

يقدم المؤلفون Fathom-Vaidya، وهو نموذج يحتوي على 30 مليار معلمة يستخدم بيانات اصطناعية وتعلّم التعزيز القائم على معايير التقييم لتعزيز كل من الاستدلال التشخيصي والسريري في الرعاية الصحية.

media Latent Space · منذ 1 يوم · 13 مشاهدة

تايب سيف آي تطرح جيف، نموذج من فئة "النظام الأول" مُدرَّب بتعلّم التعزيز لقرارات مُعايرة

أطلقت تايب سيف آي جيف، وهو فئة جديدة من نماذج "النظام الأول" مصمّمة لبيئات الإنتاج. يجادل ديغو ألميدا، الرئيس التنفيذي للشركة والمؤلف المشارك لورقة إنستركت جي بي تي (InstructGPT)، بأن النماذج المتقدمة الحالية أولت الأولوية للمواءمة والرفض على حساب الموثوقية، ما أدى إلى مشكلات مثل الهلوسة والخضوع المفرط.

media Hugging Face Forums · منذ 3 يوم · 18 مشاهدة

اقتراح: نقل معرفي تدريجي من Qwen 9B إلى 27B لنموذج ثابت الحجم 4B

يقترح مستخدم في منتديات Hugging Face تجربة في النقل المعرفي التدريجي، حيث يتعلم نموذج طالب ذو حجم ثابت (Qwen 4B) بشكل تسلسلي من نماذج معلمة أكبر فأكبر بدلاً من التعلم مباشرةً من الأكبر حجماً المتاح.

media MarkTechPost · منذ 6 يوم · 20 مشاهدة

OpenAI تُطلق إطار عمل للإفصاح عن عدم توافق النماذج بثلاث مسارات مراجعة

أعلنت OpenAI عن إطار عمل جديد لتتبع والتحقيق والإفصاح عن عدم التوافق في نماذجها، مصحوبًا بستة تقارير مفصلة حول الحوادث من تدريب التعلم بالتعزيز. يحدد النظام معايير ومواعيد نهائية محددة للإفصاح العام، وينطبق حتى عندما لا يكون السلوك موضحًا أو مخففًا بالكامل.

media Hugging Face Forums · منذ 7 يوم · 15 مشاهدة

ByteLex تستخدم خريطة المُرمِّز للتنبؤ وإصلاح أخطاء نموذج البايت

قام باحثو ByteLex ببناء فضاء إحداثيات من 11 مفردات للمُرمِّز للتنبؤ بالكلمات المصطنعة التي سيفشل فيها نموذج اللغة على مستوى البايت الخاص بهم. حققت الخريطة ارتباط سبيرمان بقيمة -0.98 مع دقة النموذج المقاسة لكل كلمة، متفوقةً على الإحصائيات المستمدة من المجموعة النصية.

arxiv arXiv cs.LG · منذ 7 يوم · 20 مشاهدة

OpenAI تطلق Open-1B مع عملية تدريب قابلة للمراجعة بالكامل

أطلقت OpenAI نموذج Open-1B، وهو نموذج لغوي تم تدريبه في نظام حيث يمكن إعادة إنتاج كل عملية أثناء التدريب بشكل مستقل على عتاد تجاري متنوع بدقة بتية. يعالج هذا النهج مشكلات إمكانية إعادة الإنتاج الكامنة في النماذج مفتوحة المصدر من خلال فرض ترتيب محدد لمصادر عدم الحتمية، مثل اختزال نوى وحدة معالجة الرسومات وترتيب دفعات البيانات.

lab Hugging Face Blog · منذ 9 يوم · 16 مشاهدة

يتيح TRL v1.14 لـ AsyncGRPOTrainer مزامنة LoRA فقط عبر وظائف Hugging Face

يقدم TRL v1.14 دعمًا لـ LoRA في AsyncGRPOTrainer، مما يتيح له تدريب محوّل Low-Rank Adaptation ومزامنة ذلك الملف الصغير فقط مع عملاء الاستدلال من vLLM. يفصل هذا الهيكل وظائف التدريب عن وظائف التوليد على آلات منفصلة باستخدام Storage Bucket مشترك كجسر لنظام الملفات، مما يلغي الحاجة إلى NCCL أو الاتصال المباشر بالشبكة بين العقد.

media Hugging Face Forums · منذ 11 يوم · 16 مشاهدة

pop123-ux يُصدر 38 دفتر ملاحظات قابلًا للتنفيذ لتعلم Hugging Face بإزالة التجريدات

نشر المستخدم pop123-ux مستودع تعلم يحتوي على 38 دفتر ملاحظات قابلًا للتنفيذ مصممة لمساعدة المستخدمين على فهم مجموعة Hugging Face من خلال إزالة التجريدات عالية المستوى تدريجيًا. يغطي المجموعة مسارًا من المكونات الأساسية مثل transformers و tokenizers إلى الضبط الدقيق، PEFT، الاستدلال/RL، والعمل على المشاريع من البداية للنهاية.

media Together AI Blog · منذ 12 يوم Terminal-Bench 2 · 88.2% · 30 مشاهدة

توسيع Together AI للتدريب الدقيق عبر LoRA المتخصص، والمقاييس المباشرة، وخفض الأسعار

قامت Together AI بتوسيع خدمة التدريب الدقيق لدعم مجموعة أوسع من النماذج مفتوحة الأوزان، بما في ذلك GLM-5.3 وKimi K2.7، مع تقديم تتبع التجارب المباشر وتحكم أدق في عملية التدريب.

media MarkTechPost · منذ 12 يوم Berkeley Function-Calling Leaderboard · 83.2% · 18 مشاهدة

أبحاث جوجل تُطلق ToolGrad، إطار عمل لتوليد بيانات استخدام الأدوات

قدم باحثون من جوجل وعدة جامعات يابانية إطار عمل ToolGrad، الذي يعكس خط الأنابيب التقليدي لتوليد مجموعات بيانات استخدام الأدوات من خلال بناء سلاسل واجهات برمجة التطبيقات (API) المُتحقق منها أولاً ثم كتابة استعلامات المستخدم المطابقة لها. تهدف هذه الطريقة إلى القضاء على عدم كفاءة الأساليب القائمة على الاستعلام أولاً والتي غالباً ما تفشل أثناء استكشاف الوكيل.

arxiv arXiv cs.CL · منذ 14 يوم SWE-bench Verified · 72.6% · 25 مشاهدة

يستخدم ExecCritic تعزيز التعلم المحدد للدور لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات

يقدم الباحثون إطار عمل ExecCritic، الذي يجمع بين هيكل اختبار-تحقق-مراجعة وتعزيز التعلم المحدد للدور لتعزيز وكلاء البرمجة. يفصل النظام بين بناء الاختبار وإصلاح الشفرة المصدرية، باستخدام وكيل اختبار لتوليد اختبارات أصلية للمستودع ووكيل إصلاح لمراجعة الكود استنادًا إلى ملاحظات التنفيذ.

media Hugging Face Forums · منذ 16 يوم · 18 مشاهدة

يُنقل KV Graft Steering المفاهيم عن طريق تجميد حالات KV

تُظهر دemonstration أن تجميد حالات المفتاح-القيمة (KV) من نص دليل يسمح لنموذج Qwen2.5-3B-Instruct بتطبيق تعليمات جديدة دون تضمين الدليل في الموجه المباشر. تتضمن الطريقة تشغيل دليل عبر النموذج مرة واحدة، وتجميد ذاكرة التخزين المؤقت KV الخاصة به، ثم توليد استجابات فوق هذا البادئ المخفي.