Research paper
arxiv arXiv cs.LG · منذ 2 يوم

يُمكّن U-OPSD التنقيح الذاتي غير الخاضع للإشراف في السياسة الحالية لنماذج اللغات الكبيرة

يقترح الباحثون التنقيح الذاتي غير الخاضع للإشراف في السياسة الحالية (U-OPSD)، وهي طريقة تحقق تحسينًا ما بعد التدريب لنماذج اللغات الكبيرة باستخدام توليدات النموذج الخاصة به فقط دون إشراف خارجي. تعتمد الطريقة على أخذ عينات من عدة مسارات لبناء حل شبه صحيح عبر التصويت بالأغلبية، ثم تنقيح توزيع المعلم إلى بادئات أطول إكمال خاطئ للنموذج.

arxiv arXiv cs.CL · منذ 2 يوم

يقدم M$^3$R-Bench معيارًا مدعومًا بالأدلة لفهم الاستعارات متعددة الوسائط

يقدم الباحثون M$^3$R-Bench، وهو معيار موحد يحتوي على 1,000 حالة من الصور والنصوص معannotations تم التحقق منها بشريًا مصممة لتقييم فهم الاستعارات متعددة الوسائط المدعوم بالأدلة. يوفر المعيار annotations مشتركة لحدوث الاستعارة، والربط بين الهدف والمصدر، والمشاعر، وشرح خطوة بخطوة بناءً على نظرية الاستعارة المفاهيمية.

lab Google DeepMind Blog · منذ 3 يوم · 16 مشاهدة

Google DeepMind يُصدر نموذج WeatherNext الذكي للتنبؤ بالأعاصير كمصدر مفتوح

أطلقت Google DeepMind وGoogle Research نموذجي WeatherNext 2 وWeatherNext Cyclones كنماذج ذكية مفتوحة المصدر، والتي حققت دقةً متقدمة في التنبؤ بمسارات الأعاصير المدارية، وشدة العواصف، وهيكل الرياح. ونُشر العمل في مجلة Nature، ويُظهر أن هذه النماذج تمنح المتنبئين يوماً إضافياً من الدقة التنبؤية مقارنةً بالأنظمة السابقة.

arxiv arXiv cs.AI · منذ 3 يوم SWE-bench Pro · 78.0%

أرجوس: بيئة تشغيل عميلية عامة الغرض للاستدلال طويل المدى

يقدم الباحثون أرجوس، وهي بيئة تشغيل عميلية ذاتية التطور ودائمة مصممة للاستدلال طويل المدى تفصل بين نوايا المستخدم الثابتة والأهداف التشغيلية. تستخدم النظام أدوار المدير والمخطط والمهندس والمراجع لتنفيذ مهام محدودة عبر حالة مشروع متينة، مما يسمح بالتنفيذ الذاتي بين نقاط التصعيد المملوكة للمشغل.

media MarkTechPost · منذ 3 يوم

تتيح SkillOpt من مايكروسوفت نقل مهارات الوكيل بين Codex وClaude Code

طوّر باحثون من جامعة شنغهاي جياو تونغ، وجامعة تونغجي، وجامعة فودان، وشركة مايكروسوفت أداة SkillOpt، وهي مُحسِّن في الفضاء النصي يدرب وثائق مهارات بلغة طبيعية مع إبقاء النموذج المستهدف ثابتاً. يستخدم النظام نموذج محسّن لاقتراح تعديلات محدودة بناءً على تقييمات التنفيذات، ويصدّر النتيجة كملف `best_skill.md` واحد.

lab NVIDIA Research · منذ 3 يوم · 5 مشاهدات

تحسين إنتاجية المصنع بنسبة تصل إلى 12.06 مرة عبر تقديم مجموعة GPU مشتركة باستخدام ROSA

يقترح الباحثون نظام تقديم نماذج أساسية للروبوتات يُدعى ROSA، مصمم لمصانع الروبوتات ويتجاوز افتراضات الحوسبة الطرفية لروبوت واحد. يستخدم النظام تقديم مجموعة GPU المشتركة للسماح لأساطيل الروبوتات بالوصول إلى وحدات معالجة الرسومات من فئة الخوادم عبر الشبكة.

arxiv arXiv cs.LG · منذ 5 يوم OSWorld 2.0 · 21.2% · 6 مشاهدات

كيون تطلق كيون-سيوا، وكيل استخدام الحاسوب الأصلي ذو 397B-A17B

تقدم كيون كيون-سيوا، وهو وكيل استخدام حاسوب أصلي مبني على هيكل مزيج الخبراء بـ 397B-A17B يعمل عبر لقطات الشاشة وأحداث الإدخال دون الاعتماد على أشجار DOM أو البيانات الوصفية لإمكانية الوصول. يستخدم النظام دعامة للحفاظ على ما يصل إلى 20 لقطة شاشة نشطة وتم تدريبه باستخدام أسطول نشر سحابي يضم ما يقرب من 100,000 وحدة معالجة افتراضية عبر حوالي 40,000 مهمة قابلة للتحقق.

arxiv arXiv cs.CL · منذ 5 يوم OSWorld 2.0 · 21.2% · 4 مشاهدات

Qwen تُطلق Qwen-CUA، وكيل استخدام الحاسوب الأصلي ذو 397B-A17B

أطلق الباحثون Qwen-CUA، وهو وكيل استخدام حاسوب أصلي مبني على هيكل Qwen mixture-of-experts بحجم 397B-A17B. يعمل النظام من خلال مراقبة لقطات الشاشة وتنفيذ الإجراءات عبر أحداث لوحة المفاتيح والماوس، دون الاعتماد على أشجار DOM أو بيانات التعريف الخاصة بإمكانية الوصول.

arxiv arXiv cs.CL · منذ 5 يوم

تنهار مراقبات التفكير المتسلسل عندما يعيد الخصوم صياغة الاستدلال

تُظهر الأبحاث أن مراقبة التفكير المتسلسل (CoT) تفشل في مواجهة الخصوم الذين يتحكمون في عملية الاستدلال. ومن خلال إعادة صياغة استدلال الوكيل ليبدو كهندسة بحسن نية مع الحفاظ على الأوامر والمخرجات حرفياً، يمكن للمهاجمين تجاوز آليات الكشف.

media Don't Worry About the Vase · منذ 5 يوم · 5 مشاهدات

أسترا من أوبن إيه آي تحل 10 مسائل رياضية مفتوحة كبرى

أطلقت أوبن إيه آي نتائج نموذجها الداخلي غير المُصدر، أسترا، الذي نجح في حل عشرة مسائل مفتوحة مهمة في الرياضيات. تم توليد الحلول بواسطة النموذج ثم صاغها باحثون بشريون إلى شهادات لين (Lean).

lab OpenAI News · منذ 8 يوم · 16 مشاهدة

نموذج أسترا يحل عشر مسائل مفتوحة في الرياضيات وعلوم الحاسوب النظرية

أنتج النموذج الداخلي أسترا التابع لشركة OpenAI حلولاً لعشر مسائل مفتوحة طويلة الأمد عبر مجالي الرياضيات وعلوم الحاسوب النظرية، مع توثيق الحجج بشكل رسمي باستخدام Lean. تمتد هذه النتائج لتشمل الهندسة متعددة الأبعاد، ونظرية الترميز، ونظرية الزمر، والتعقيد الكمي، حيث عالجت أسئلة لم تشهد أي تقدم لمدة عشر سنوات على الأقل.

arxiv arXiv cs.CL · منذ 9 يوم · مشاهدتان

مُفكِّر الذاكرة على نطاق واسع: توسيع نطاق الذاكرة طويلة الأمد البارامترية إلى 6.9 مليار معلمة

يقدم الباحثون مُفكِّر الذاكرة على نطاق واسع، وهو نظام يوسّع نماذج الذاكرة طويلة الأمد البارامترية لتصل إلى 6.9 مليار معلمة ويطوّرها مسبقاً باستخدام 300 مليار رمز. وللتغلب على استحالة استخدام خطوط أنابيب Faiss القياسية عند هذا الحجم من البيانات، يطبّق المؤلفون خط أنابيب فهرسة موزع مع تحميل متناثر ودفعي لتوزيعات kNN.

arxiv arXiv cs.AI · منذ 9 يوم WebArena · 73.6% · مشاهدتان

يُحدّد Qwen-UI-Agent حالة الفن في معايير استخدام الهاتف المحمول

أصدر فريق Qwen تقريراً تقنياً لـ Qwen-UI-Agent، وهو وكيل واجهة مستخدم أساسي يركز على العالم الحقيقي ومصمم للعمل بشكل موثوق عبر بيئات الهاتف المحمول واستخدام الكمبيوتر والويب وDeepSearch. يجمع النظام بين بيئات صناديق رملية متنوعة مع وقت تشغيل للهاتف المحمول على أجهزة حقيقية واسعة النطاق، ويتداخل عمليات واجهة المستخدم الرسومية مع تنفيذ سطر الأوامر ويدعم المهام طويلة المدى.

arxiv arXiv cs.CL · منذ 10 يوم · 4 مشاهدات

Living-Harness يتطور ذاتياً لتحسين Pass@1 بنحو 10 نقاط

يقترح الباحثون Living-Harness، وهو إطار عمل للوكلاء يتطور ذاتياً يحول المسارات المكتملة وإشارات التقييم إلى أدلة لاحقة لتحديثات الإطار المحدودة. وبإرشاد من Evolution-SOP، يستخرج النظام تجريدات الحلقات وأدلة التحديث المهيكلة لكتابة الذاكرة الحلقية ورسوم الحالة.

arxiv arXiv cs.CL · منذ 10 يوم · 3 مشاهدات

التدريب الوسيط الدستوري يحقق مكاسب متينة في المحاذاة دون فقدان القدرات

اختبر الباحثون التدريب الوسيط الدستوري من خلال إدراج محتوى قائم على القيم في عملية تدريب النماذج بحجم 120B لتحديد ما إذا كان ينتج محاذاة أكثر متانة مقارنة بطرق ما بعد التدريب القياسية. وجدت الدراسة أن هذا النهج يحسّن بشكل كبير تعميم المتانة والمحاذاة، لا سيما في التخفيف من الميل إلى الابتزاز بعد الضبط الدقيق الخاضع للإشراف.