المصدر · arXiv cs.AI
arxiv arXiv cs.AI · منذ 19 ساعة · مشاهدتان

Faraday 27B يتفوق على Claude Opus 4.8 و GPT-5.5 في مهام استنساخ الأوراق البحثية

طور الباحثون Replica، وهو مساحة مهام قابلة للتوسع لاستنساخ الأوراق البحثية، وقدموا قاضياً يعتمد على المعايير ويتم إنشاؤه تلقائياً لتوفير إشارات مكافأة منخفضة الضوضاء تتماشى مع التقييم البشري.

arxiv arXiv cs.AI · منذ 19 ساعة

يستخدم AutoDesign تحسين الهارنش الفوقي لتحسين التصميم الوكيل طويل المدى

يقدم الورقة AutoDesign، وهو إطار عمل يستخدم محسن هارنش فوقي لتوجيه وكيل الكود في التحسين المتكرر لهارنش الخاص به بناءً على تغذية راجعة من التكرارات. يهدف هذا النهج إلى محاذاة مع أولويات التصميم البشرية وتراكم الخبرة القابلة لإعادة الاستخدام للتحسين الذاتي المتكرر.

arxiv arXiv cs.AI · منذ 2 يوم · 3 مشاهدات

تحسّن SCOUT الاستدلال المكاني في نماذج اللغة والرؤية عبر التفكير المتسلسل المهيكل والتعلم التعزيزي المشرف على العملية

يقترح الباحثون إطار عمل SCOUT الذي يعزز الاستدلال المكاني لنماذج اللغة والرؤية من خلال دمج التفكير المتسلسل المهيكل مع التعلم التعزيزي متعدد الأهداف والمشرف على العملية. يتناول هذا النهج مشكلات تعيين الائتمان في طرق التعلم التعزيزي الحالية ودمك إدراك العمق لفهم شامل للبيئة ثلاثية الأبعاد.

arxiv arXiv cs.AI · منذ 2 يوم HealthBench · 51.9% · 4 مشاهدات

يتطابق VITA السريري المعزز بالاسترجاع أو يتفوق على نماذج اللغات الكبيرة المتقدمة في HealthBench

تم تقييم نظام مُصمم خصيصًا لتوليد النصوص المعزز بالاسترجاع يُدعى VITA، والمُعدّ للبيئات ذات الدخل المنخفض والمتوسط، مقابل نماذج لغوية كبيرة لأغراض عامة على معيار HealthBench. تُظهر الدراسة أن التصميم المخصص للمجموعة النصية يمكنه الحفاظ على أداء تنافسي حتى مع إصدار نماذج متقدمة جديدة.

arxiv arXiv cs.AI · منذ 3 يوم

يحسّن MiLMMT-46-v1.0 الترجمة متعددة اللغات عبر ما بعد التدريب بدون مرجع

طوّر الباحثون نموذج MiLMMT-46-v1.0 للترجمة الآلية متعددة اللغات، الذي يطبّق ما بعد التدريب بدون مرجع على نماذج لغوية كبيرة مفتوحة المصدر. يستخدم الفريق تحسين السياسة النسبية للمجموعة (GRPO) مع مكافأة تعتمد على نموذجين لتقدير الجودة بدون مرجع، يتم التحكم فيهما عبر تحديد اللغة.

arxiv arXiv cs.AI · منذ 4 يوم

التحسين المفتوح النهاية يتيح لـ GPT-5.5 تأليف عملية تحسينه الخاصة

تقدم المقالة التحسين المفتوح النهاية (OEO)، وهو إطار عمل يسمح لمُحسّن النماذج المتقدمة بتأليف عملية تحسينه ديناميكيًا عبر الإنترنت، بدلاً من الاعتماد على خطوط أنابيب التحديد المسبق. قارن المؤلفون OEO مع نهجين مرحليين، هما SkillOpt وGEPA، عبر 14 مقارنة مباشرة عبر إعدادات نموذج-هدف-معيار ثمانية.

arxiv arXiv cs.AI · منذ 4 يوم

AMIE (Video) يحقق أداءً على مستوى الخبراء في الاستشارات الطبية في الوقت الفعلي

أظهر الباحثون أول نظام ذكاء اصطناعي على مستوى الخبراء للاستشارات السريرية بالفيديو في الوقت الفعلي باستخدام AMIE (Video)، وهو نظام متعدد الوكلاء يعتمد على Gemini يدمج الحوار منخفض التأخير مع الإدراك السمعي البصري في الوقت الفعلي. في دراسة فحص سريري موضوعي عشوائية شملت 30 طبيب رعاية أولية و100 سيناريو، قيّم المقيّمون السريريون النظام بأنه يعادل أو يتفوق على الأطباء في أخذ التاريخ المرضي، والتشخيص، والإدارة، والملاحظة الجسدية.

arxiv arXiv cs.AI · منذ 4 يوم · 16 مشاهدة

مهاجمون يسرقون مسارات الاستدلال من واجهات برمجة تطبيقات النماذج اللغوية الكبيرة الخاصة عبر ثغرة في الكتلة المشفرة

حدد باحثون عيباً معمارياً في كيفية تعامل مقدمي نماذج لغوية كبيرة رائدين مع مسارات الاستدلال خطوة بخطوة. يعيد هؤلاء الموفدون هذه المسارات ككتل مشفرة إلى العملاء، لكن الدراسة وجدت أن هذه الكتل متوافقة تماماً وقابلة للتبديل عبر جلسات مختلفة ومستخدمين ونماذج داخل بيئة مقدم الخدمة.

arxiv arXiv cs.AI · منذ 4 يوم OSWorld · 90.69% · 6 مشاهدات

وكيل Ouroboros ذاتي التطوير يضرب أرقامًا قياسية جديدة مع Opus 5

Ouroboros هو إطار عمل لوكلاء التطور الذاتي حيث تتحسن الأدوات والبرومبتات والتنفيذ الأساسي من خلال الالتزامات التي تمت مراجعتها والتي تصبح بيئة التشغيل للأعمال اللاحقة. يعمل عبر التطور الحر المتكرر أو تطور النواة المدفوع بالخبرة، والذي يتم تفعيله عن طريق الأخطاء وعدم الكفاءة التي تم العثور عليها أثناء الاستخدام.

arxiv arXiv cs.AI · منذ 4 يوم

سانغفور تُطلق نظام حواجز الأمان ذاتي التطور SESG

أطلقت سانغفور نظام SESG (حواجز الأمان ذاتية التطور)، وهو نظام متعدد الوكلاء يتكيف باستمرار مع دفاعات نماذج اللغة الكبيرة ضد التهديدات الجديدة في بيئة الإنتاج. يراقب النظام حركة المرور المباشرة لاكتشاف ثغرات الاختراق الجديدة والفئات الضارة، ثم يقوم تلقائياً بتركيب بيانات التدريب وتحديث النموذج دون تدخل يدوي.

arxiv arXiv cs.AI · منذ 5 يوم · 12 مشاهدة

GPT-5 و GPT-5 Nano يتطابقان مع الخبراء في تقييم أبحاث التكوين الورمي الميكروبي

تُظهر دراسة أن GPT-5 و GPT-5 Nano يحققان أداءً على مستوى الخبراء في استخراج الأدلة وتقييم الأبحاث المنشورة حول التكوين الورمي الميكروبي بشكل نقدي. قام الباحثون بمقارنة هذه النماذج مع Gemini 2.5 Pro و Gemini 2.5 Flash مقابل خبراء متخصصين باستخدام مجموعة بيانات مكونة من 24 ورقة بحثية تركز على MMTV-LV وسرطان الثدي.

arxiv arXiv cs.AI · منذ 9 يوم SWE-bench Pro · 78.0% · مشاهدة واحدة

أرجوس: بيئة تشغيل عميلية عامة الغرض للاستدلال طويل المدى

يقدم الباحثون أرجوس، وهي بيئة تشغيل عميلية ذاتية التطور ودائمة مصممة للاستدلال طويل المدى تفصل بين نوايا المستخدم الثابتة والأهداف التشغيلية. تستخدم النظام أدوار المدير والمخطط والمهندس والمراجع لتنفيذ مهام محدودة عبر حالة مشروع متينة، مما يسمح بالتنفيذ الذاتي بين نقاط التصعيد المملوكة للمشغل.

arxiv arXiv cs.AI · منذ 9 يوم

يصحّح SciCode-Verified عيوب المعيار ليكشف القدرة الحقيقية للنماذج في البرمجة العلمية

يحدد المؤلفون أن تراجُع النتائج على معيار SciCode ينجم عن عيوب كبيرة في أداة التقييم وليس عن قيود في قدرة النموذج. كشف تدقيق من خبراء المجال لـ 65 مشكلة اختبارية عن 263 عيبًا، تسبب 192 منها في رفض الحلول الصحيحة بشكل خاطئ بسبب مشكلات مثل إجابات مرجعية غير قابلة للتكرار وتسامحات ضيقة للغاية.

arxiv arXiv cs.AI · منذ 10 يوم

Video-DeepResearch يقدم وكيلًا متعدد الوسائط لتدفقات الفيديو المستمرة

يقدم الباحثون Video-DeepResearch (Video-DR)، وهو إطار عمل يمدد الوكلاء متعددي الوسائط من الصور الثابتة إلى تدفقات الفيديو المستمرة، مما يعالج تحيز الوسائط وتسرب المعرفة البارامترية. يعتمد النظام على خط أنابيب لفصل الاستكشاف عن الإدراك مع فتح الأدوات تدريجيًا لضمان التأسيس البصري عبر الإطارات قبل البحث في الويب.

arxiv arXiv cs.AI · منذ 15 يوم WebArena · 73.6% · 4 مشاهدات

يُحدّد Qwen-UI-Agent حالة الفن في معايير استخدام الهاتف المحمول

أصدر فريق Qwen تقريراً تقنياً لـ Qwen-UI-Agent، وهو وكيل واجهة مستخدم أساسي يركز على العالم الحقيقي ومصمم للعمل بشكل موثوق عبر بيئات الهاتف المحمول واستخدام الكمبيوتر والويب وDeepSearch. يجمع النظام بين بيئات صناديق رملية متنوعة مع وقت تشغيل للهاتف المحمول على أجهزة حقيقية واسعة النطاق، ويتداخل عمليات واجهة المستخدم الرسومية مع تنفيذ سطر الأوامر ويدعم المهام طويلة المدى.

arxiv arXiv cs.AI · منذ 18 يوم · مشاهدة واحدة

ClinFusion يقدم نموذجًا لغويًا متعدد الوسائط كبيرًا يركز على الرؤية للفهم الطبي الشامل

يقدم الباحثون ClinFusion، وهو نموذج لغوي متعدد الوسائط كبير يركز على الرؤية، مصمم لمعالجة تحديات نشر الذكاء الاصطناعي في الممارسة السريرية من خلال توحيد فهم الصور الطبية ثنائية وثلاثية الأبعاد. يتميز النظام بمُشفِّر رؤية متدرج مركب يتضمن عامل دمج محلي مكاني متسلسل واعٍ، ويتضمن إطار تقييم جديدًا يتكون من MedIF-Bench ومقاييس مبنية على منطقة الاهتمام.

arxiv arXiv cs.AI · منذ 18 يوم

تستخدم وحدة أهلية Aethis بنية عصبية-رمزية لإصلاح أخطاء تقييم قواعد LLM

يوثق المقال فئة فشل في نماذج اللغة الكبيرة المتقدمة تُسمى انهيار سلسلة الاستثناءات، حيث تقيم النماذج القواعد الشرطية المتداخلة بشكل غير صحيح. لمعالجة ذلك، يقدم المؤلفون وحدة أهلية Aethis، وهي بنية عصبية-رمزية تجمع بين القواعد التي كتبتها LLM مع طبقة تعتمد على SMT للتنفيذ الحتمي.

arxiv arXiv cs.AI · منذ 22 يوم OSWorld · 37.7% · 5 مشاهدات

يمكّن OpenForgeRL التدريب الشامل للوكلاء المعتمدين على أدوات في أي بيئة

يُعد OpenForgeRL إطار عمل مفتوح المصدر يسمح للباحثين بتدريب وكلاء الذكاء الاصطناعي المعتمدين على أدوات بشكل شامل باستخدام حزم التعلم التعزيزي القياسية. ويتحقق من ذلك عن طريق فصل التدريب عن الاستدلال عبر وسيط خفيف الوزن يسجل استدعاءات النموذج كبيانات، ومنسق Kubernetes الذي يدير نشر الحاويات عن بُعد.

arxiv arXiv cs.AI · منذ 22 يوم · 4 مشاهدات

AREX تقدم وكلاء بحث عميق يحسنون أنفسهم بشكل متكرر

يقدم الباحثون AREX، وهو عائلة من وكلاء البحث العميق ذاتية التحسين المتكرر (RSI) المصممة لمعالجة عدم التماثل بين الاكتشاف والتحقق في الاستعلامات المعقدة. يتناوب AREX بين حلقة داخلية تجمع الأدلة وتبني إجابات مؤقتة، وحلقة خارجية تراجعت القيود لتوجيه التحسين المستهدف.

arxiv arXiv cs.AI · منذ 23 يوم · 4 مشاهدات

تمكّن SLAI T-Rex من التدريب اللاحق الكامل المعلمات لنموذج DeepSeek-V4 على Ascend SuperPOD

تُقدّم SLAI إطار عمل T-Rex، وهو إطار تحسين متكامل للتدريب اللاحق الكامل المعلمات لنماذج MoE ذات الحجم التريليوني من المعلمات على Ascend NPU SuperPOD. باستخدام عائلة نماذج DeepSeek-V4 كحملة عمل مستهدفة، يتعامل النظام مع ضغط الذاكرة وأعباء الاتصال من خلال التسامح المتوازي الهرمي وتحسينات تنفيذ النواة.