المصدر · arXiv cs.LG
arxiv arXiv cs.LG · منذ 28 يوم · 73 مشاهدة

تحقق نماذج NVIDIA Nemotron-3 ميداليات ذهبية ونتائج تفوق البشر في أولمبياد المعلوماتية 2026

طور الباحثون خط أنابيب ما بعد التدريب لنماذج اللغة الكبيرة يمكّنها من تحقيق أداء بحصول على الميدالية الذهبية في البرمجة التنافسية. ومن خلال الجمع بين الضبط الدقيق الخاضع للإشراف، والتعلم المعزز، واستراتيجية جديدة مدفوعة بالملاحظات تُدعى GenCorrect، يتفوق النظام على أفضل المتسابقين البشر في مجموعة مسائل أولمبياد المعلوماتية 2026.

arxiv arXiv cs.LG · منذ 6 يوم · 7 مشاهدات

إطار عمل GRASP يحسّن التخطيط الاستراتيجي باستخدام الذكاء الاصطناعي الوكيل متعدد المراحل

يقدم الباحثون إطار عمل GRASP، وهو إطار تخطيط متعدد المراحل واعٍ بالاستراتيجية، مصمم لتوليد خطط قابلة للتنفيذ بلغة طبيعية عالية الجودة للمهام المعقدة من خلال فصل خط الأنابيب إلى وحدات متخصصة. يقوم النظام بتجميع الإرشادات العيانية العالمية مسبقاً عبر GenPlan، ويستكشف الاستراتيجيات المحلية عبر RevPlan، ويقيّم المسارات باستخدام مُميّز متعدد المعايير يُدعى VerPlan.

arxiv arXiv cs.LG · منذ 8 يوم · 22 مشاهدة

يتيح AIDE^2 التحسين الذاتي المتكرر لوكلاء أبحاث الذكاء الاصطناعي

يقدم الباحثون نظام AIDE^2، الذي يطبق حلقة من التحسين الذاتي المتكرر لوكيل أبحاث ذكاء اصطناعي متقدم من خلال تحسين شيفرته الخاصة. يقترح النظام تغييرات على منطقِه الداخلي، ويقيّم الإصدارات المعدّلة في مهام بحث وتطوير الذكاء الاصطناعي، ويحتفظ فقط بتلك التحديثات التي تحقق أفضل أداء في التقييمات المخفية.

arxiv arXiv cs.LG · منذ 8 يوم · 21 مشاهدة

يقلل CliffCompaction تكاليف وكلاء البرمجة طويلة المدى بنسبة تصل إلى 50% مع الحفاظ على الأداء

يقدم الباحثون تقنية CliffCompaction، وهي طريقة ضغط ذاتي مصممة للوكلاء الذين يتعاملون مع ملايين الرموز (tokens)، مما يقلل التكاليف بنسبة تصل إلى 50% ضمن سياق محدود. تحافظ الطريقة على الأداء أو تحسّنه في Terminal-Bench وتحقق نتائج رائدة في KernelBench من خلال الحفاظ على دقة المعلومات عبر الاقتطاع بدلاً من إعادة الصياغة.

arxiv arXiv cs.LG · منذ 9 يوم HealthBench · 50.1% · 13 مشاهدة

Fathom-Vaidya يحسّن الاستدلال الطبي باستخدام مكافآت قائمة على المعايير

يقدم المؤلفون Fathom-Vaidya، وهو نموذج بـ 30B معلمة يستخدم بيانات اصطناعية وتعلّم التعزيز القائم على المعايير لتعزيز الاستدلال التشخيصي والسريري في الرعاية الصحية. يطبق إطار التدريب أولاً RL الموجه بالقواعد على الأسئلة المستمدة من MedBullets للتشخيص، ثم يستخدم 5.3k سيناريوهات اصطناعية متعددة الأدوار بمعايير متعددة الأبعاد لمهام سريرية تفاعلية.

arxiv arXiv cs.LG · منذ 15 يوم · 28 مشاهدة

OpenAI تطلق Open-1B مع عملية تدريب قابلة للمراجعة بالكامل

أطلقت OpenAI نموذج Open-1B، وهو نموذج لغوي تم تدريبه في نظام حيث يمكن إعادة إنتاج كل عملية أثناء التدريب بشكل مستقل على عتاد تجاري متنوع بدقة بتية. يعالج هذا النهج مشكلات إمكانية إعادة الإنتاج الكامنة في النماذج مفتوحة المصدر من خلال فرض ترتيب محدد لمصادر عدم الحتمية، مثل اختزال نوى وحدة معالجة الرسومات وترتيب دفعات البيانات.

arxiv arXiv cs.LG · منذ 16 يوم Codeforces (Elo) · 98.2% · 29 مشاهدة

الكوليسيوم النجمي: إطار عمل متعدد الوكلاء لأبحاث الرياضيات وعلوم الحاسوب النظرية طويلة المدى

يقدم المؤلفون الكوليسيوم النجمي، وهو إطار عمل غير محدد بنموذج مصمم لتوزيع الاستدلال عبر أبحاث الرياضيات وعلوم الحاسوب النظرية طويلة المدى. يستكشف النظام استراتيجيات بديلة قبل بناء البرهان، ويستخدم بوابة جاهزية لتحديد متى يكون المسار ناضجًا بما يكفي للتجزئة، ويمثل خطة البرهان كمسائل فرعية على مستوى الأقسام مترابطة الاعتماد.

arxiv arXiv cs.LG · منذ 20 يوم · 34 مشاهدة

Vidu S2 يقدم نماذج أفتار تفاعلية في الوقت الفعلي وتحرير

يتكون Vidu S2 من Vidu S2-Avatar، وهو نموذج لشخصية رقمية تفاعلية في الوقت الفعلي، وVidu S2-Editing، وهو نموذج لتحرير الفيديو في الوقت الفعلي. يستكشف النظام أيضًا جدوى توليد الفيديو المكاني في الوقت الفعلي لكلا المكونين.

arxiv arXiv cs.LG · منذ 22 يوم · 28 مشاهدة

تمكّن TontaubeV1 من تحويل النص إلى كلام بالتدفق مع سياق محدود

يقدم الباحثون نموذج TontaubeV1 لتحويل النص إلى كلام يحافظ على الإيقاع الطبيعي مع تمكين الاستدلال بالتدفق من خلال بطاقة رسوميات استهلاكية واحدة. يستخدم النظام تمثيل DualCodec الهرمي بمعدل 12.5 هرتز لفصل التدفقات الدلالية عن التحسينات الصوتية، مما يتيح توليدًا منخفض التأخير.

arxiv arXiv cs.LG · منذ 24 يوم · 33 مشاهدة

طريقة الشك التوقعي تقلل أخطاء وكيل هندسة البرمجيات باستخدام بوابة النموذج المسودة

يقدم المؤلفون طريقة الشك التوقعي (SU)، وهي تقنية تستعيد إشارة فشل تنبؤي لوكلاء نماذج لغوية كبيرة ذات صندوق أسود من خلال تحليل رموز مخرجاتهم فقط، دون الحاجة إلى الوصول إلى اللوغاريتمات أو الأوزان أو التنشيطات. ومن خلال عكس فك التشفير التوقعي، يقوم نموذج مسودة صغير ذو أوزان مفتوحة بتقييم مسار الوكيل في تمرير أمامي واحد لاستخراج ميزات واعية بالمرحلة ومعايرتها مقابل هدف قابل للتحقق.

arxiv arXiv cs.LG · منذ 27 يوم · 51 مشاهدة

FlashAttention-4 يقدم Direct-P للاستدلال والتدريب الواعي بالعتاد باستخدام FP4

يعالج FlashAttention-4 قيود الأداء في نوى التنسور ذات النقطة العائمة 4 بت (FP4) الخاصة بـ Blackwell من خلال إدخال مسارات جديدة للاستدلال غير السببي والتدريب السببي. تُعرف الطريقة باسم Direct-P، وتقوم بربط الدرجات مباشرةً باحتمالات FP4 لتجاوز أعباء تحويل softmax التي تهيمن عادةً عندما تصغر حاصل ضرب المصفوفات.

arxiv arXiv cs.LG · منذ 29 يوم SWE-bench Verified · 16.6% · 42 مشاهدة

CANOPY تمكّن Qwen3-14B من تصدر قائمة AppWorld باستخدام التعزيز المعتمد على النتائج فقط

تقدم الورقة البحثية CANOPY (Coverage-ANchored On-PolicY RL)، وهو بروتوكول يعالج مشكلة شح الإشارة والانحراف في السياسة ضمن التعلم المعزز طويل المدى للنماذج المفتوحة الصغيرة. ومن خلال توسيع نطاق استكشاف المهمة نفسها والحفاظ على التحديثات مرتبطة بمسافة KL، تتيح هذه الطريقة للوكلاء التعلم بفعالية من التحقق النهائي للمهمة فقط.