الموضوع · Training methods
lab Microsoft Research Blog · الآن مباشر

نظام أبحاث مايكروسوفت يتنبأ بمخاطر الطقس الفضاني لـ 66,935 محطة فرعية في الولايات المتحدة

يُنتج خط أنابيب التعلم الآلي المطور في أبحاث مايكروسوفت تقديرات للمخاطر الناتجة عن التيارات المغناطيسية الأرضية (GIC) الخاصة بكل موقع لـ 66,935 محطة فرعية في البر الرئيسي للولايات المتحدة. يجمع النظام بين توقعات الرياح الشمسية والبيانات الجيولوجية المحلية لتوفير تحذير مسبق لمدة تتراوح بين 30 إلى 60 دقيقة لمشغلي الشبكة قبل ظهور مخاطر محددة.

arxiv arXiv cs.CL · منذ 17 ساعة · مشاهدة واحدة

نماذج اللغة السياقية تدير السياق بشكل أصلي كملفات قابلة للتعديل

يقدم الباحثون نماذج اللغة السياقية (CLMs)، وهي بنية جديدة تعالج نافذة سياق النموذج كملف قابل للتعديل، مما يتيح للنموذج إجراء تحديثات غير مقيدة على ذاكرته الخاصة. ينقل هذا النهج إدارة السياق من التحكم الخارجي إلى سلوك النموذج الجوهري، مما يمكّن من تعلم استراتيجيات إدارة السياق في السياق وفي المعلمات.

arxiv arXiv cs.CL · منذ 2 يوم SWE-bench Verified · 49.2% · مشاهدة واحدة

يحسّن ROFT النماذج الوكيلية عن طريق الضبط الدقيق على الشروحات المولَّدة ذاتياً

يبحث الباحثون في ضبط الفروق الوحيد للاسترجاع (Retrospection-Only Fine-Tuning) (ROFT)، وهي إجراء عبر الإنترنت بسيط حيث يولد وكيل شروحات استرجاعية لتجاربه الخاصة ويتم ضبطه بدقة باستخدام خسارة التنبؤ بالرمز التالي فقط على رموز الشرح هذه. لا يتطلب هذا الأسلوب معلماً خارجياً أو تحديثاً للسياسة القائم على المكافأة.

arxiv arXiv cs.CL · منذ 7 يوم · 8 مشاهدات

VHD-Play يولّد بيئات تعلم معزز وكيلي من آليات محلولة

يُعد VHD-Play خط أنشطة يُنتج بيئات متنوعة للتعلم المعزز الوكيل عن طريق أخذ عينات وحل النماذج الرياضية قبل عرض عمليات اتخاذ القرار الخاصة بها كأدوات ذات حالة. يضمن هذا النهج أن الديناميكيات القابلة للتنفيذ ومراجع تقييم المسارات تُورث مباشرة من النموذج المحلول، مما يعالج مشكلات عدم التطابق الشائعة في خطوط الأنظمة الحالية.

arxiv arXiv cs.CL · منذ 7 يوم SWE-Lancer · 51.47% · 10 مشاهدات

تدمج SkillGym المهارات البشرية داخل النماذج اللغوية الكبيرة لحل المشكلات الواقعية

يقدم الباحثون إطار عمل SkillGym، الذي يحول مهارات الوكلاء المكتوبة يدوياً من قبل البشر إلى بيئات تدريب قابلة للتنفيذ وقابلة للتحقق لوكلاء النماذج اللغوية الكبيرة. يستخدم النظام خط أنابيب من المهارة إلى المهمة لتجسيد مهام ملموسة والتحقق من النتائج باستخدام فاحصات مبنية على الكود.

lab Hugging Face Blog · منذ 7 يوم · 16 مشاهدة

تمكّن NVIDIA Warp وMjWarp من محاكاة الروبوتات المتوازية المعجّزة بواسطة وحدة معالجة الرسومات

يتيح MuJoCo Warp (MJWarp)، المبنية على NVIDIA Warp، تشغيل نماذج MuJoCo المتوافقة على نطاق وحدة معالجة الرسومات، مما يمكّن من تطوير مئات أو آلاف بيئات المحاكاة المستقلة في استدعاء واحد. ينقل هذا الهيكل التركيز من تقليل زمن الاستجابة لبيئة واحدة إلى تحسين الإنتاجية الإجمالية، وهو ما يدعم التعلم التعزيزي وأخذ العينات واسعة النطاق.

arxiv arXiv cs.AI · منذ 8 يوم · 17 مشاهدة

مولد حالة العالم يزامن الخطط مع العوالم الاصطناعية لتحسين نجاح الوكيل

مولد حالة العالم (WSG) هو نموذج يحافظ على مزامنة خطط وكلاء اللغة مع قواعد بيئة التنفيذ الخاصة بهم عن طريق إعادة كتابة الحالات بعد الفشل. تم تدريبه على 226K مسارًا مستخرجًا من سبعة مجالات اصطناعية حيث يفرض برنامج القواعد ويتحقق من إمكانية الوصول إلى الهدف.

arxiv arXiv cs.LG · منذ 9 يوم HealthBench · 50.1% · 13 مشاهدة

Fathom-Vaidya يحسّن الاستدلال الطبي باستخدام مكافآت قائمة على المعايير

يقدم المؤلفون Fathom-Vaidya، وهو نموذج بـ 30B معلمة يستخدم بيانات اصطناعية وتعلّم التعزيز القائم على المعايير لتعزيز الاستدلال التشخيصي والسريري في الرعاية الصحية. يطبق إطار التدريب أولاً RL الموجه بالقواعد على الأسئلة المستمدة من MedBullets للتشخيص، ثم يستخدم 5.3k سيناريوهات اصطناعية متعددة الأدوار بمعايير متعددة الأبعاد لمهام سريرية تفاعلية.

arxiv arXiv cs.AI · منذ 9 يوم HealthBench · 50.1% · 16 مشاهدة

Fathom-Vaidya يحسّن الاستدلال الطبي باستخدام مكافآت قائمة على المعايير

يقدم المؤلفون Fathom-Vaidya، وهو نموذج بـ 30 مليار معلمة يستخدم بيانات اصطناعية وتعلّم التعزيز القائم على المعايير لتعزيز كل من الاستدلال التشخيصي والإكلينيكي في الرعاية الصحية. يستهدف إطار التدريب أولاً الدقة التشخيصية باستخدام أسئلة مستمدة من MedBullets ثم يتعامل مع التفاعلات الإكلينيكية متعددة الأدوار عبر 5.3 ألف سيناريو تم إنشاؤه بمعايير متعددة الأبعاد.

arxiv arXiv cs.CL · منذ 9 يوم HealthBench · 50.1% · 14 مشاهدة

Fathom-Vaidya يحسّن الاستدلال الطبي باستخدام مكافآت قائمة على معايير التقييم

يقدم المؤلفون Fathom-Vaidya، وهو نموذج يحتوي على 30 مليار معلمة يستخدم بيانات اصطناعية وتعلّم التعزيز القائم على معايير التقييم لتعزيز كل من الاستدلال التشخيصي والسريري في الرعاية الصحية.

media Latent Space · منذ 9 يوم · 22 مشاهدة

تايب سيف آي تطرح جيف، نموذج من فئة "النظام الأول" مُدرَّب بتعلّم التعزيز لقرارات مُعايرة

أطلقت تايب سيف آي جيف، وهو فئة جديدة من نماذج "النظام الأول" مصمّمة لبيئات الإنتاج. يجادل ديغو ألميدا، الرئيس التنفيذي للشركة والمؤلف المشارك لورقة إنستركت جي بي تي (InstructGPT)، بأن النماذج المتقدمة الحالية أولت الأولوية للمواءمة والرفض على حساب الموثوقية، ما أدى إلى مشكلات مثل الهلوسة والخضوع المفرط.

media Hugging Face Forums · منذ 11 يوم · 19 مشاهدة

اقتراح: نقل معرفي تدريجي من Qwen 9B إلى 27B لنموذج ثابت الحجم 4B

يقترح مستخدم في منتديات Hugging Face تجربة في النقل المعرفي التدريجي، حيث يتعلم نموذج طالب ذو حجم ثابت (Qwen 4B) بشكل تسلسلي من نماذج معلمة أكبر فأكبر بدلاً من التعلم مباشرةً من الأكبر حجماً المتاح.

media MarkTechPost · منذ 13 يوم · 23 مشاهدة

OpenAI تُطلق إطار عمل للإفصاح عن عدم توافق النماذج بثلاث مسارات مراجعة

أعلنت OpenAI عن إطار عمل جديد لتتبع والتحقيق والإفصاح عن عدم التوافق في نماذجها، مصحوبًا بستة تقارير مفصلة حول الحوادث من تدريب التعلم بالتعزيز. يحدد النظام معايير ومواعيد نهائية محددة للإفصاح العام، وينطبق حتى عندما لا يكون السلوك موضحًا أو مخففًا بالكامل.

media Hugging Face Forums · منذ 14 يوم · 21 مشاهدة

ByteLex تستخدم خريطة المُرمِّز للتنبؤ وإصلاح أخطاء نموذج البايت

قام باحثو ByteLex ببناء فضاء إحداثيات من 11 مفردات للمُرمِّز للتنبؤ بالكلمات المصطنعة التي سيفشل فيها نموذج اللغة على مستوى البايت الخاص بهم. حققت الخريطة ارتباط سبيرمان بقيمة -0.98 مع دقة النموذج المقاسة لكل كلمة، متفوقةً على الإحصائيات المستمدة من المجموعة النصية.