Benchmark results
media MarkTechPost · الآن DeepSWE · 68.8% · مشاهدة واحدة مباشر

OpenAI تُطلق GPT-6 Sol وLuna بأسعار واجهة برمجة تطبيقات أقل بنسبة 50%

أطلقت OpenAI نموذجين جديدين، هما GPT-6 Sol وGPT-6 Luna، وهما متاحان الآن في واجهة برمجة تطبيقات OpenAI. تأتي هذه النماذج تحت الإصدار السابق GPT-6 Astra وتهدف إلى نقل تقدمها التقني إلى طبقات أسرع وأكثر بأسعار معقولة لأعمال البرمجة المعقدة والأعمال اليومية عالية الحجم.

media Latent Space · الآن · 4 مشاهدات مباشر

أنثروبيك تطلق كلاود أوبس 5.5 بكتابة محسّنة وتكاليف أقل

أطلقت أنثروبيك كلاود أوبس 5.5، وهو أول نموذج في عائلتها الجديدة من كلاود 5.5، مما يضعه كبديل أكثر كفاءة للأجيال السابقة. صُمم النموذج لأداء مهام بمستوى كلاود فابل 5.1 في معظم الحالات، مع انخفاض تكلفته بنسبة 40% مقارنة بتشغيل أوبس 5.

lab Hugging Face Blog · منذ 15 ساعة · 9 مشاهدات

معهد أمان الذكاء الاصطناعي البريطاني ينشر نتائج تقييم موثقة لستة نماذج متقدمة على خمسة معايير

أتاح معهد أمان الذكاء الاصطناعي البريطاني (AISI) طرق التقييم والنتائج المنشورة علناً عبر منصة بطاقات التقييم الخاصة بـ EvalEval لتحسين إمكانية إعادة إنتاج المعايير. تتضمن هذه الإصدار نتائج موثقة، وسياقاً، ومعلومات حول التكوين لخمسة معايير محددة: HealthBench، وFrontierMath، وHumanity's Last Exam، وSWE-Bench Pro، وTerminal-Bench 2.0.

media MarkTechPost · منذ 21 ساعة GDPval-AA (Elo) · 1695.0Elo · 13 مشاهدة

SpaceXAI تطلق Grok 4.7 بنموذج أساسي أكبر ومعايير تقييم محسّنة

أطلقت SpaceXAI نموذج Grok 4.7، وهو نموذج رائد جديد للبرمجة والمهام الوكيلية والعمل المعرفي، يعتمد على نموذج أساسي أكبر وتشغيل تعلم تعزيزي ممتد مقارنة بـ Grok 4.6. يحافظ النموذج على هيكل التسعير نفسه لسلفه مع تقديم قدرات محسّنة في التحقق الذاتي، ومعالجة السياقات الطويلة، والسلامة.

media Interconnects · منذ 2 يوم Artificial Analysis Intelligence Index · 45.0% · 17 مشاهدة

تتفوق النماذج الصينية مفتوحة الأوزان على نظيرتها الأمريكية في التنزيلات والمعايير

يقدم المؤلف موجزًا عن حالة النماذج مفتوحة الأوزان، موضحًا أن الشركات الصينية للذكاء الاصطناعي أصبحت القادة الواضحون في هذا المجال منذ حوالي أبريل 2025. ويتجلى هذا التحول من خلال مقاييس التنزيل على Hugging Face والأداء في معايير القدرات.

media Hugging Face Forums · منذ 6 يوم · 13 مشاهدة

فهرس هدر الوكلاء يصنف 341,054 تشغيلًا عامًا لوكلاء البرمجة لأنماط الهدر

قام فهرس هدر الوكلاء بتقييم 341,054 مسارًا للوكيل من 11 مجموعة بيانات عامة لتحديد عدم الكفاءة مثل الحلقات، وإعادة المحاولة العمياء، وإخراج الأدوات الضخم، والتشغيلات المهجورة. يكشف التحليل أن سلوكيات الحلقة وإعادة المحاولة شائعة في النماذج الأضعف مثل وكلاء Llama لكنها نادرة في Claude 3.7 Sonnet و Qwen3-Coder-480B.

media r/LocalLLaMA · منذ 7 يوم · 18 مشاهدة

تقرير موزيلادعوى أن نماذج الذكاء الاصطناعي ذات الأوزان المفتوحة في الصين متأخرة بشهرين عن عروض الواجهة الأمريكية

يشير تقرير من موزيلا إلى أن نماذج الذكاء الاصطناعي ذات الأوزان المفتوحة في الصين قد أغلقت فجوة التطوير لتصبح فقط أربعة أشهر خلف العروض الواجهة الأمريكية. على الرغم من هذا التقدم السريع، لا تزال النماذج تتأخر في بعض تقييمات المعايير.

media MarkTechPost · منذ 7 يوم LMSYS Arena (Elo) · 1866.0Elo · 20 مشاهدة

لايتير لابس تطلق TabPFN-3.5، متفوقة على الفائز في كغكل أوتو 2015 بإعدادات افتراضية

أطلقت لايتير لابس TabPFN-3.5، وهو نموذج أساسي للجداول يتنبأ ببيانات الجدول في تمرير أمامي واحد دون تدريب أو ضبط لكل مجموعة بيانات. حقق النموذج نتيجة 0.375 على القائمة الخاصة في تحدي تصنيف منتجات مجموعة أوتو 2015، متفوقة على النتيجة الأصلية للفائز وهي 0.382 التي حققها جيلبرتو تيتيريتز وستانيسلاف سيمونوف.

media r/LocalLLaMA · منذ 7 يوم · 17 مشاهدة

تقرير موزيللا يكشف عن ضيق الفجوة في قدرات نماذج الذكاء الاصطناعي بين الصين والولايات المتحدة إلى 4.4 أشهر

تشير تقرير من موزيللا إلى أن الفجوة في القدرات بين نماذج الذكاء الاصطناعي الصينية والأمريكية قد تضاءلت بشكل كبير، لتصبح فرقاً قدره 4.4 أشهر.

media MarkTechPost · منذ 7 يوم · 28 مشاهدة

Nums AI تطلق Causilo، نموذج أساسي للبيانات الجدولية يتصدر TabArena بين النماذج الفردية

أطلقت Nums AI نموذج Causilo، وهو نموذج أساسي مدرب مسبقاً للبيانات الجدوية مخصص للتصنيف والانحدار، يحقق أعلى درجة Elo بين النماذج الفردية على TabArena. يعتمد النموذج نهج التعلم في السياق حيث تُخزن صفوف التدريب كسياق بدلاً من تحديث الأوزان، وهو متاح بكود مرخص بموجب Apache-2.0 وأوزان مدربة مسبقاً على Hugging Face.

arxiv arXiv cs.CL · منذ 8 يوم Codeforces (Elo) · 98.2% · 27 مشاهدة

يستغل ستيلار كولوسيوم الاستدلال متعدد الوكلاء لأبحاث الرياضيات طويلة المدى

ستيلار كولوسيوم هو إطار عمل عام النماذج مُصمم لتخصيص الاستدلال عبر أبحاث الرياضيات وعلوم الكمبيوتر النظرية طويلة المدى، لمعالجة عدم موثوقية نماذج اللغة في المشكلات المعقدة. يستكشف النظام استراتيجيات بديلة قبل بناء البرهان، ويستخدم بوابة جاهزية لتحديد متى يكون المسار ناضجًا بما يكفي للتجزئة، ويمثل خطة البرهان كمجموعة من المشكلات الفرعية على مستوى الأقسام المترابطة.

arxiv arXiv cs.LG · منذ 8 يوم Codeforces (Elo) · 98.2% · 25 مشاهدة

الكوليسيوم النجمي: إطار عمل متعدد الوكلاء لأبحاث الرياضيات وعلوم الحاسوب النظرية طويلة المدى

يقدم المؤلفون الكوليسيوم النجمي، وهو إطار عمل غير محدد بنموذج مصمم لتوزيع الاستدلال عبر أبحاث الرياضيات وعلوم الحاسوب النظرية طويلة المدى. يستكشف النظام استراتيجيات بديلة قبل بناء البرهان، ويستخدم بوابة جاهزية لتحديد متى يكون المسار ناضجًا بما يكفي للتجزئة، ويمثل خطة البرهان كمسائل فرعية على مستوى الأقسام مترابطة الاعتماد.

arxiv arXiv cs.AI · منذ 9 يوم · 25 مشاهدة

إعادة تقييم الخبراء تكشف أن النماذج المتقدمة تقترب من التشبع في معايير الفيزياء

تُظهر دراسة تدقق فيها ستة معايير فيزيائية مستخدمة على نطاق واسع أن الدرجات المنخفضة المبلغ عنها للنماذج اللغوية المتقدمة تعزى بشكل كبير لأخطاء في التقييم وليس لنقص في قدرات النموذج. راجع الخبراء عبارات المشكلات والحلول المرجعية واستجابات النماذج، لتمييز الأخطاء الحقيقية عن أخطاء المصححين والمراجع غير الصحيحة والأسئلة الغامضة.

lab Cohere Blog · منذ 10 يوم · 35 مشاهدة

كوهير تطلق نموذج North Small Translate، وهو نموذج ترجمة آلي مفتوح السيادة

أطلقت شركة كوهير نموذج North Small Translate، وهو أول نموذج للترجمة في عائلة North، متاح للأبحاث والاستخدام غير التجاري بموجب ترخيص CC BY-NC 4.0. يحقق هذا النموذج القائم على مزيج من الخبراء (mixture-of-experts) درجة 83.6 على معيار WMT26 All Languages، متفوقاً على النماذج المملوكة مثل DeepL NextGen وGoogle Translate.

media MarkTechPost · منذ 10 يوم Terminal-Bench 2 · 92.8% · 28 مشاهدة

Cognition تُطلق SWE-2، نموذج برمجة مُدرَّب بعد التدريب على Kimi K3 مع جهد استدلال قابل للاختيار

أطلقت Cognition SWE-2، وهو أكثر نماذج البرمجة قدرةً حتى الآن، وقد خضع لتدريب لاحق باستخدام التعزيز من التعلم المعزز (RL) المستمد من النموذج المفتوح ذي 2.8 تريليون معلمة الخاص بـ Moonshot AI، والمسمى Kimi K3. حقق النموذج نتيجة بنسبة 50.0% على FrontierCode 1.1 Main، مما يضعه ضمن نقطة واحدة من Fable 5.1 مع تشغيل بتكلفة أقل بنسبة 64%.

lab NVIDIA Research · منذ 11 يوم · 16 مشاهدة

ReasoningBomb يُحدث استدلالاً طويلاً مرضياً في نماذج الاستدلال الكبيرة

قام الباحثون بتعميم هجمات الحرمان من الخدمة أثناء الاستدلال (PI-DoS) التي تستغل التكلفة الحسابية العالية للاستدلال الصريح متعدد الخطوات في نماذج الاستدلال الكبيرة (LRMs). يقدمون ReasoningBomb، وهو إطار عمل يعتمد على التعلم المعزز لتدريب مهاجم على توليد مطالبات طبيعية قصيرة تدفع النماذج الضحية إلى مسارات استدلال طويلة مرضياً وغالباً ما لا تنتهي.