المصدر · arXiv cs.CL
arxiv arXiv cs.CL · منذ 28 يوم · 35 مشاهدة

تحقق نماذج NVIDIA Nemotron-3 أداءً ذهبيًا في مسابقات البرمجة الأولمبية الدولية

طورت NVIDIA خطوط أنابيب ما بعد التدريب لنماذجها اللغوية Nemotron-3-Nano-CC وNemotron-3-Ultra-CC لتتفوق في البرمجة التنافسية. ومن خلال الجمع بين تنسيق المشكلات واسع النطاق، وآثار الاستدلال الاصطناعية، والضبط الدقيق الخاضع للإشراف، والتعلم التعزيزي، أنشأ الفريق أنظمة متخصصة قادرة على استدلال خوارزمي عالي المستوى.

arxiv arXiv cs.CL · منذ 17 ساعة · مشاهدة واحدة

نماذج اللغة السياقية تدير السياق بشكل أصلي كملفات قابلة للتعديل

يقدم الباحثون نماذج اللغة السياقية (CLMs)، وهي بنية جديدة تعالج نافذة سياق النموذج كملف قابل للتعديل، مما يتيح للنموذج إجراء تحديثات غير مقيدة على ذاكرته الخاصة. ينقل هذا النهج إدارة السياق من التحكم الخارجي إلى سلوك النموذج الجوهري، مما يمكّن من تعلم استراتيجيات إدارة السياق في السياق وفي المعلمات.

arxiv arXiv cs.CL · منذ 2 يوم · مشاهدة واحدة

دراسة تكشف عن تباعد في السياسات المعرفية خلال تلوث نماذج اللغات الكبيرة متعددة الأدوار

تقيّم دراسة بعنوان "التباعد في السياسات المعرفية خلال تلوث نماذج اللغات الكبيرة متعددة الأدوار: تحقيق تدرج البروتوكول" كيفية تعامل نماذج اللغات الكبيرة مع المقدمات الخاطئة المُحقَنة في سجل المحادثة، وهي حالة فشل تُعرف بالتلوث على مستوى الجلسة. اختبر الباحثون GPT-5.4 Mini وGemini-3.1 Flash-Lite وGLM-4.5-Air عبر عشرة مجالات معرفية باستخدام 22,500 دور عند درجة حرارة صفر.

arxiv arXiv cs.CL · منذ 2 يوم SWE-bench Verified · 49.2% · مشاهدة واحدة

يحسّن ROFT النماذج الوكيلية عن طريق الضبط الدقيق على الشروحات المولَّدة ذاتياً

يبحث الباحثون في ضبط الفروق الوحيد للاسترجاع (Retrospection-Only Fine-Tuning) (ROFT)، وهي إجراء عبر الإنترنت بسيط حيث يولد وكيل شروحات استرجاعية لتجاربه الخاصة ويتم ضبطه بدقة باستخدام خسارة التنبؤ بالرمز التالي فقط على رموز الشرح هذه. لا يتطلب هذا الأسلوب معلماً خارجياً أو تحديثاً للسياسة القائم على المكافأة.

arxiv arXiv cs.CL · منذ 2 يوم · مشاهدة واحدة

TokenProbe يقلل استخدام رموز CoT بنسبة 76% مع الحفاظ على الدقة

يقدم الباحثون TokenProbe، وهو إطار عمل يعالج الاستهلاك العالي للرموز في استدلال Chain-of-Thought من خلال استغلال القيمة غير المتجانسة للرموز داخل مسارات الاستدلال. يميز الأسلوب بين الرموز الأساسية الحاملة للمحتوى الحاسم والحشو الزائد باستخدام إشارات الاحتمال اللوغاريتمي المعياري.

arxiv arXiv cs.CL · منذ 2 يوم · مشاهدة واحدة

يُطابق Rep2Act تمثيلات نماذج الرؤية واللغة لتحسين الامتناع عن الإجابة على معيار VAD-R الجديد

يقدم الباحثون تشخيص إمكانية الإجابة البصري مع المبررات (VAD-R)، وهو معيار جديد صُمّم لتقييم قدرة نماذج الرؤية واللغة على الامتناع عن الإجابة عن الأسئلة التي لا يمكن الإجابة عليها دون الاعتماد على إشارات مختصرة. تكشف الدراسة أنه بينما يمكن للحالات المخفية التمييز بين إمكانية الإجابة، تفشل النماذج الحالية في ترجمة ذلك إلى قرارات صريحة.

arxiv arXiv cs.CL · منذ 3 يوم · 6 مشاهدات

يُضغط Highlight-Then-Summarize الأدلة لفهم أفضل للسياق الطويل

يقترح الباحثون نهج Highlight-Then-Summarize (H2S)، وهو نموذج ضغط ثم استدلال يحدد الأدلة ذات الصلة بالسؤال ودمجها في ملخص مدمج قبل توليد الإجابة. لدعم هذا النهج، أنشأ الفريق مجموعة H2S-Dataset بـ 6,647 مثالاً من 11 عائلة معايير وأدخل H2S-RL لمكافآت على مستوى العملية.

arxiv arXiv cs.CL · منذ 3 يوم · 7 مشاهدات

تسميم المستندات القديمة يتسبب في تجاوز الاسترجاع غير المحدّث للإجابات الصحيحة للنموذج

يحدد الباحثون "تسميم المستندات القديمة"، وهو فشل في المحاذاة الزمنية في التوليد المعزز بالاسترجاع (RAG) حيث يؤدي الدليل الخارجي القديم إلى تقديم النماذج لإجابات خاطئة رغم معرفتها بالإجابة الصحيحة دون استرجاع.

arxiv arXiv cs.CL · منذ 3 يوم · 7 مشاهدات

يقوم KuaFu بضغط سلوك المستخدم إلى فهم على نطاق المليار

تقدم Tencent نظام KuaFu، وهو طبقة موحدة لضغط السلوك تقوم بتكثيف سجل المستخدم الخام إلى تمثيلات مضغوطة لوكلاء المحادثة وأنظمة التوصية. يستخدم النظام مُوجِّهًا ثنائي المحور لضغط كل عنصر سلوكي إلى 2-4 رموز بعرض 128-256، مما يعالج الاختناقات في معالجة التسلسلات الطويلة لمليار مستخدم.

arxiv arXiv cs.CL · منذ 6 يوم · 9 مشاهدات

إطار عمل جسر المزامنة يفوز بالمسار الثاني من CAR-bench بنسبة 60.0% Pass^3

فاز إطار عمل جديد قائم على جسر المزامنة للوكلاء المستخدمين للأدوات بالمسار الثاني من تقييم CAR-bench، محققاً نتيجة 60.0% في مقياس Pass@3 على مجموعة الاختبار المخفية الرسمية. يفصل النظام استدعاء النموذج عن عمليات الذهاب والإياب للأدوات من خلال إصدار النموذج لبرامج بايثون التي تتوقف وتستأنف عبر تبادلات المُقيّم.

arxiv arXiv cs.CL · منذ 7 يوم · 6 مشاهدات

يطبق R3Con مبادئ تحقيق الصلة لتحسين الاستدلال واسع النطاق

يقترح الباحثون R3Con، وهو أداة تشغّل مبادئ النظرية المعرفية لبناء تمثيلات فعّالة للسياقات الكبيرة جداً. يتعامل النظام مع تحدي تجميع المعلومات المترابطة المشتتة عبر مصادر شاسعة تتجاوز حدود سياق النموذج القياسية.

arxiv arXiv cs.CL · منذ 7 يوم · 8 مشاهدات

VHD-Play يولّد بيئات تعلم معزز وكيلي من آليات محلولة

يُعد VHD-Play خط أنشطة يُنتج بيئات متنوعة للتعلم المعزز الوكيل عن طريق أخذ عينات وحل النماذج الرياضية قبل عرض عمليات اتخاذ القرار الخاصة بها كأدوات ذات حالة. يضمن هذا النهج أن الديناميكيات القابلة للتنفيذ ومراجع تقييم المسارات تُورث مباشرة من النموذج المحلول، مما يعالج مشكلات عدم التطابق الشائعة في خطوط الأنظمة الحالية.

arxiv arXiv cs.CL · منذ 7 يوم · مشاهدتان

يكشف معيار WebMRE عن التعزيز المتبادل بين التوجيه والإجراء في وكلاء الويب

يقدم المؤلفون WebMRE، وهو معيار غير متصل يتكون من 541 مهمة و5,293 خطوة مستمدة من مسارات WebArena الناجحة، مصممًا لتقديم بروتوكول حتمي لتقييم نقاط تفتيش وكلاء الويب دون انجراف البيئة. يجمع هذا الإطار بين جمل توجيهية موجهة للبشر وإجراءات موثوقة لدراسة تأثير التعزيز المتبادل بينهما.

arxiv arXiv cs.CL · منذ 7 يوم SWE-Lancer · 51.47% · 10 مشاهدات

تدمج SkillGym المهارات البشرية داخل النماذج اللغوية الكبيرة لحل المشكلات الواقعية

يقدم الباحثون إطار عمل SkillGym، الذي يحول مهارات الوكلاء المكتوبة يدوياً من قبل البشر إلى بيئات تدريب قابلة للتنفيذ وقابلة للتحقق لوكلاء النماذج اللغوية الكبيرة. يستخدم النظام خط أنابيب من المهارة إلى المهمة لتجسيد مهام ملموسة والتحقق من النتائج باستخدام فاحصات مبنية على الكود.

arxiv arXiv cs.CL · منذ 8 يوم · 19 مشاهدة

TelecomGPT-R1: تدريب موحد ما بعد التدريب للاستدلال عبر مهام اتصالات متنوعة

يقدم الباحثون TelecomGPT-R1، وهو عائلة من نماذج استدلال الاتصالات المفتوحة المصدر والموحدة، مصممة لأتمتة المهام الهندسية من خلال الاستدلال على المعايير والتكوينات والسجلات. يتناول النموذج قيود نماذج الذكاء الاصطناعي التوليدية العامة والمتخصصة الحالية من خلال نهج هيكلي يغطي محاور البروتوكول والمعرفة والنمذجة والأعطال.

arxiv arXiv cs.CL · منذ 8 يوم · 19 مشاهدة

Qwen تطلق Qwen3.8-Omni-Flash، نموذجًا متعدد الوسائط أصليًا مع سياق مكون من مليون رمز

أعلنت Alibaba Cloud عن إطلاق Qwen3.8-Omni-Flash، وهو نموذج متعدد الوسائط أصليًا مصمم لمهام الإنتاجية في العالم الحقيقي، والذي يحسّن بشكل كبير الفهم والاستدلال متعدد الوسائط مقارنة بالنماذج السابقة.

arxiv arXiv cs.CL · منذ 9 يوم HealthBench · 50.1% · 14 مشاهدة

Fathom-Vaidya يحسّن الاستدلال الطبي باستخدام مكافآت قائمة على معايير التقييم

يقدم المؤلفون Fathom-Vaidya، وهو نموذج يحتوي على 30 مليار معلمة يستخدم بيانات اصطناعية وتعلّم التعزيز القائم على معايير التقييم لتعزيز كل من الاستدلال التشخيصي والسريري في الرعاية الصحية.

arxiv arXiv cs.CL · منذ 9 يوم · 15 مشاهدة

يقلل AgentRouter تكاليف سير العمل الوكيلّي بنسبة 72٪ عبر توجيه النماذج على مستوى الخطوة

يقترح الباحثون AgentRouter، وهو مصنف خفيف الوزن يحسّن سير العمل الوكيلّي متعدد الخطوات من خلال توجيه خطوات المسار الفردية إلى طبقات نماذج مناسبة بدلاً من استخدام نموذج حدودي واحد لجميع المهام. يعالج النظام عدم كفاءة الأنظمة المؤسسية التي تهدر 60-80٪ من ميزيتها الاستدلالية في مهام فرعية يمكن للنماذج الأصغر معالجتها بنفس الجودة.

arxiv arXiv cs.CL · منذ 10 يوم · 17 مشاهدة

NemotronLabs تطلق VoiceChat، نموذج مفتوح المصدر للتحويل من الكلام إلى كلام مع استدعاء الأدوات

أعلنت NemotronLabs عن إطلاق VoiceChat، وهو نموذج مفتوح الأوزان للتحويل من الكلام إلى كلام يعمل بنظام الاتصال الكامل (full-duplex)، مصمم لدمج الاستماع، والنسخ، والاستدلال، والتحدث ضمن بنية دفق موحدة. يجمع النظام بين مشفر صوتي للدفق ومُفسّر لغة يعتمد على نموذج لغوي فقط (decoder-only) مع تدفقات إخراج متخصصة متوازية للنص الوكيل والمكالمات الدالية المهيكلة، بالإضافة إلى فرع مساعد من نوع RNN-T للنسخ التدريجي للمستخدم.