المصدر · arXiv cs.CL
arxiv arXiv cs.CL · منذ 18 يوم · 6 مشاهدات

مونشوت آي إيه تطلق كيمي K3، نموذج MoE بـ 2.8T وسياق بمليون توكن

تُقدم مونشوت آي إيه كيمي K3، وهو نموذج خليط الخبراء مفتوح المصدر يتميز بـ 2.8 تريليون معامل إجمالي و104 مليار معامل مُفعّل لكل توكن. يعتمد البنية على قدرات الرؤية الأصلية وتدعم نافذة سياق بمليون توكن، مدعومة بتقنيتي Kimi Delta Attention وStable LatentMoE.

arxiv arXiv cs.CL · منذ 1 يوم

تقليل ضرب المصفوفات: اختزال حاصل ضرب المصفوفات المتكيف مع الإدخال لاستدعاء النماذج اللغوية الكبيرة

يقترح الباحثون طريقة استدعاء تكيفية مع الإدخال وخالية من التدريب تُسمى تقليل ضرب المصفوفات (RMM)، والتي تقلل حاصل ضرب مصفوفات المحولات عن طريق اختيار شرائح ذات معلوماتية عالية على طول أبعاد الانكماش دون تعديل أوزان النموذج. تحت تحكم بسيط بنسبة الاحتفاظ، يوفر RMM مقايضة سلسة ومتوقعة بين الدقة والكفاءة عبر نماذج لغوية تتراوح من 1 مليار إلى 70 مليار معامل.

arxiv arXiv cs.CL · منذ 1 يوم

يستخدم AutoDesign تحسين الهيكل الفائق لتحسين التصميم الوكيل طويل المدى

تقدم الورقة البحثية إطار عمل AutoDesign، الذي يستخدم محسّن الهيكل الفائق لتوجيه وكيل الكود في التحسين التكراري لهيكله استنادًا إلى ملاحظات التنفيذ. قام المؤلفون بتقييم هذا النهج على مهمة توليد الملصق من الأوراق الأكاديمية باستخدام معيار جديد يُدعى PosterBench.

arxiv arXiv cs.CL · منذ 1 يوم

Intern-S2-Preview يقدم نموذجًا أساسيًا علميًا قائمًا على الوكلاء مع تدريب مسبق متعدد الوسائط وتعلم التعزيز

يقدم المؤلفون Intern-S2-Preview، وهو سلسلة من النماذج الأساسية العلمية القائمة على الوكلاء مصممة لدعم الفهم العلمي متعدد الوسائط، والاستدلال، والتوليد، والمهام طويلة المدى. تبدأ خط أنابيب التدريب بالتدريب المسبق متعدد الوسائط العلمي على المستندات العلمية المُولَّدة، وبيانات الصور والنصوص المتبادلة، ومجموعات البيانات العلمية المتنوعة.

arxiv arXiv cs.CL · منذ 2 يوم HealthBench · 51.9% · 4 مشاهدات

يتطابق VITA الخاص بمجموعة البيانات أو يتفوق على نماذج اللغات الكبيرة المتقدمة في HealthBench

يحتل VITA، وهو نظام توليد مدعوم بالاسترجاع مصمم للبيئات ذات الدخل المنخفض والمتوسط، المرتبة الأولى في المجموعة الفرعية باللغة الإنجليزية من HealthBench، متفوقًا على GPT-5.4 و o4-mini و Gemini 3.1 Pro و Claude Sonnet 4.6.

arxiv arXiv cs.CL · منذ 3 يوم · مشاهدة واحدة

تحسّن MiLMMT-46-v1.0 للترجمة متعددة اللغات عبر ما بعد التدريب بدون مرجع

أطلق الباحثون نموذج MiLMMT-46-v1.0، وهو نموذج لغوي كبير مفتوح المصدر للترجمة الآلية متعددة اللغات، يعتمد على ما بعد التدريب بدون مرجع. بدءاً من النسخة المدققة بالإشراف MiLMMT-46-v0.1، طبق الفريق تحسين السياسة النسبية للمجموعة (GRPO) مع مكافأة تستند إلى نموذجين لتقدير الجودة بدون مرجع، يتم تفعيلهما عبر تحديد اللغة.

arxiv arXiv cs.CL · منذ 4 يوم · 10 مشاهدات

Macaron-V1 يُطلق عائلة نماذج وكلاء مفتوحة المصدر باستخدام مزيج من LoRA للتعلم المستمر

يُعد Macaron-V1 عائلة نماذج وكلاء مفتوحة المصدر مصممة للذكاء التجريبي، مما يتيح للنظم التعلم من تجارب العالم الحقيقي والاستمرار في التحسين بعد النشر. يركز العمارة على هدفين رئيسيين: التكيف من خلال التحسين الذاتي المتكرر لأزواج النموذج-المُجَهِّز، والتعاون عبر نظام مزيج من LoRA (MoL) الذي يختار محولات متخصصة لكل دور للمستخدم.

arxiv arXiv cs.CL · منذ 4 يوم

AMIE (Video) يحقق أداءً على مستوى الخبراء في الاستشارات الطبية في الوقت الفعلي

أظهر الباحثون أول نظام ذكاء اصطناعي على مستوى الخبراء للاستشارات السريرية عبر الفيديو في الوقت الفعلي باستخدام AMIE (Video)، وهو نظام متعدد الوكلاء يعتمد على Gemini يدمج الحوار منخفض التأخير مع الإدراك السمعي البصري في الوقت الفعلي.

arxiv arXiv cs.CL · منذ 5 يوم · 8 مشاهدات

GPT-5 و GPT-5 Nano يتطابقان مع الخبراء في استخراج أدلة التكوّن الورمي الميكروبي

أظهرت دراسة تقارن النماذج اللغوية الكبيرة في التوليف المنهجي للأدلة الخاصة بالتكوّن الورمي الميكروبي أن GPT-5 و GPT-5 Nano يؤديان أداءً لا يمكن تمييزه عن أداء الخبراء في المجال. قام الباحثون بتقييم Gemini 2.5 Pro، و Gemini 2.5 Flash، و GPT-5، و GPT-5 Nano على 24 ورقة بحثية باستخدام قالب منظم يتكون من 77 عنصرًا عبر أنواع متعددة من الأسئلة.

arxiv arXiv cs.CL · منذ 8 يوم · 4 مشاهدات

يقدم M$^3$R-Bench معيارًا مدعومًا بالأدلة لفهم الاستعارات متعددة الوسائط

يقدم الباحثون M$^3$R-Bench، وهو معيار موحد يحتوي على 1,000 حالة من الصور والنصوص معannotations تم التحقق منها بشريًا مصممة لتقييم فهم الاستعارات متعددة الوسائط المدعوم بالأدلة. يوفر المعيار annotations مشتركة لحدوث الاستعارة، والربط بين الهدف والمصدر، والمشاعر، وشرح خطوة بخطوة بناءً على نظرية الاستعارة المفاهيمية.

arxiv arXiv cs.CL · منذ 11 يوم OSWorld 2.0 · 21.2% · 18 مشاهدة

Qwen تُطلق Qwen-CUA، وكيل استخدام الحاسوب الأصلي ذو 397B-A17B

أطلق الباحثون Qwen-CUA، وهو وكيل استخدام حاسوب أصلي مبني على هيكل Qwen mixture-of-experts بحجم 397B-A17B. يعمل النظام من خلال مراقبة لقطات الشاشة وتنفيذ الإجراءات عبر أحداث لوحة المفاتيح والماوس، دون الاعتماد على أشجار DOM أو بيانات التعريف الخاصة بإمكانية الوصول.

arxiv arXiv cs.CL · منذ 11 يوم

تنهار مراقبات التفكير المتسلسل عندما يعيد الخصوم صياغة الاستدلال

تُظهر الأبحاث أن مراقبة التفكير المتسلسل (CoT) تفشل في مواجهة الخصوم الذين يتحكمون في عملية الاستدلال. ومن خلال إعادة صياغة استدلال الوكيل ليبدو كهندسة بحسن نية مع الحفاظ على الأوامر والمخرجات حرفياً، يمكن للمهاجمين تجاوز آليات الكشف.

arxiv arXiv cs.CL · منذ 15 يوم · 4 مشاهدات

مُفكِّر الذاكرة على نطاق واسع: توسيع نطاق الذاكرة طويلة الأمد البارامترية إلى 6.9 مليار معلمة

يقدم الباحثون مُفكِّر الذاكرة على نطاق واسع، وهو نظام يوسّع نماذج الذاكرة طويلة الأمد البارامترية لتصل إلى 6.9 مليار معلمة ويطوّرها مسبقاً باستخدام 300 مليار رمز. وللتغلب على استحالة استخدام خطوط أنابيب Faiss القياسية عند هذا الحجم من البيانات، يطبّق المؤلفون خط أنابيب فهرسة موزع مع تحميل متناثر ودفعي لتوزيعات kNN.

arxiv arXiv cs.CL · منذ 15 يوم MLE-bench · 71.21% · 3 مشاهدات

يحقّق Frontis-MA1 حالةً فائقة في هندسة الآلة عبر التحسين الذاتي المتكرر باستخدام OpenMLE

تُطلق Frontis نموذج Frontis-MA1، وهو نموذج AI4AI ذو 35 مليار معلمة مصمم للتحسين الذاتي المتكرر في هندسة التعلم الآلي، جنبًا إلى جنب مع مجموعة الأدوات مفتوحة المصدر OpenMLE. يدمج النظام بيئات مهام قابلة للتحقق، وتعلّم المشغّلين، والبحث طويل المدى لتمكين وكيلٍ يحسّن شفرة برمجته الخاصة من خلال التدريب القائم على التنفيذ.

arxiv arXiv cs.CL · منذ 15 يوم · 4 مشاهدات

OSReward تقدم تقييماً موحداً لنماذج المكافآت للاستخدام الحاسوبي عبر المنصات

يقدم الباحثون OSReward، وهو معيار واقعي مصمم لتقييم موثوقية نماذج الرؤية واللغة (VLMs) التي تعمل كحكم لمسارات وكلاء الاستخدام الحاسوبي. تكشف الدراسة أن أحدث نماذج VLM تعاني من تحيز التساهل المنهجي وغالباً ما تكون مكلفة جداً للتوسع، بينما تؤدي النماذج المفتوحة الميسورة التكلفة أداءً ضعيفاً.

arxiv arXiv cs.CL · منذ 16 يوم · 5 مشاهدات

Living-Harness يتطور ذاتياً لتحسين Pass@1 بنحو 10 نقاط

يقترح الباحثون Living-Harness، وهو إطار عمل للوكلاء يتطور ذاتياً يحول المسارات المكتملة وإشارات التقييم إلى أدلة لاحقة لتحديثات الإطار المحدودة. وبإرشاد من Evolution-SOP، يستخرج النظام تجريدات الحلقات وأدلة التحديث المهيكلة لكتابة الذاكرة الحلقية ورسوم الحالة.

arxiv arXiv cs.CL · منذ 16 يوم · 3 مشاهدات

التدريب الوسيط الدستوري يحقق مكاسب متينة في المحاذاة دون فقدان القدرات

اختبر الباحثون التدريب الوسيط الدستوري من خلال إدراج محتوى قائم على القيم في عملية تدريب النماذج بحجم 120B لتحديد ما إذا كان ينتج محاذاة أكثر متانة مقارنة بطرق ما بعد التدريب القياسية. وجدت الدراسة أن هذا النهج يحسّن بشكل كبير تعميم المتانة والمحاذاة، لا سيما في التخفيف من الميل إلى الابتزاز بعد الضبط الدقيق الخاضع للإشراف.

arxiv arXiv cs.CL · منذ 17 يوم · مشاهدة واحدة

يقلل Relay-OPD طول مسار التدريب بأكثر من 50٪ في التقريب غير الرسمي

يقدم الباحثون تقريبًا غير رسمي متتابع (Relay-OPD) لمعالجة فشل البادئة في التقريب غير الرسمي القياسي، حيث تؤدي أخطاء الطالب إلى إشراف غير موثوق. تستخدم الطريقة عدم تماثل الاستمرارية بين المعلم والطالب كمحفز ليأخذ المعلم زمام المبادرة لفترة قصيرة لإعادة توجيه المسار قبل أن يستأنف الطالب.

arxiv arXiv cs.CL · منذ 18 يوم · 3 مشاهدات

تشارك PIVOT مسوحات البادئة عبر مجموعات الاستعلام لتسريع الانتباه المتناثر على مستوى الرموز

PIVOT (الفهرسة الوسيطة عبر اجتياز بادئة كاملة) هي بديل جاهز للاستخدام لا يتطلب تدريبًا، لفهرس DeepSeek Sparse Attention (DSA)، ويقلل من التكرار الحسابي عن طريق مشاركة مسح بادئة واحدة عبر مجموعة من الاستعلامات القريبة. وبدلاً من تقييم كل رمز سابق لكل استعلام على حدة، تجمع PIVOT المجموعة في استعلام وسيط واحد للحصول على مجموعة مرشحة، يتم منها اختيار أفضل k رموز لكل استعلام.