الموضوع · Benchmark results
lab NVIDIA Research · منذ 19 يوم · 21 مشاهدة

ReasoningBomb يُحدث استدلالاً طويلاً مرضياً في نماذج الاستدلال الكبيرة

قام الباحثون بتعميم هجمات الحرمان من الخدمة أثناء الاستدلال (PI-DoS) التي تستغل التكلفة الحسابية العالية للاستدلال الصريح متعدد الخطوات في نماذج الاستدلال الكبيرة (LRMs). يقدمون ReasoningBomb، وهو إطار عمل يعتمد على التعلم المعزز لتدريب مهاجم على توليد مطالبات طبيعية قصيرة تدفع النماذج الضحية إلى مسارات استدلال طويلة مرضياً وغالباً ما لا تنتهي.

lab Hugging Face Blog · منذ 1 يوم · 8 مشاهدات

إطلاق إنفيديا لنموذج Kumo Tabular الأساسي المفتوح للتنبؤ الجدولي بدون تدريب

أطلقت إنفيديا نموذج Kumo Tabular، وهو نموذج أساسي مفتوح المصدر لتصنيف البيانات الجدولية والانحدار عليها، ويعمل عبر التعلم في السياق دون الحاجة إلى التدريب أو هندسة الميزات. تم تدريبه مسبقاً حصرياً على بيانات اصطناعية مولّدة بواسطة النماذج السببية الهيكلية، ويتوفر النموذج بثلاثة أحجام تتراوح بين 28 مليون و215 مليون معلمة.

media MarkTechPost · منذ 1 يوم · 4 مشاهدات

أنثروبيك تطلق كلود سونيت 5.5 بسرعة أعلى وتكلفة أقل لكل مهمة

أطلقت أنثروبيك نموذج كلود سونيت 5.5، وهو النموذج الثاني في عائلة كلود 5.5، حيث يُصوَّر كمكمل أسرع وأكثر فعالية من حيث التكلفة لنموذج كلود أوبوس 5.5 للمهام اليومية، وإصلاح الأخطاء، وتنقية المستندات.

media The Batch · منذ 5 يوم Humanity's Last Exam · 61.4% · 11 مشاهدة

أنثروبيك تطلق كلود أوبوس 5.5؛ تايب سيف تطلق نموذج تصنيف جيف

أطلقت أنثروبيك كلود أوبوس 5.5، وهو الخلف الأقل تكلفة لكلود أوبوس 5 الذي يتصدر مؤشر الذكاء v4.3 من تحليلات الذكاء الاصطناعي ومؤشر فالز AI في معايير الذكاء العامة. بالتزامن مع ذلك، قدمت تايب سيف، التي أسسها خريج أوبن إيه آي دييغو ألميدا، نموذج جيف، وهو نموذج تصنيف عام مصمم لتحليل النصوص وإرجاع مخرجات محددة مسبقًا بتكلفة أقل من نماذج اللغات الكبيرة.

media MarkTechPost · منذ 8 يوم DeepSWE · 68.8% · 23 مشاهدة

OpenAI تُطلق GPT-6 Sol وLuna بأسعار واجهة برمجة تطبيقات أقل بنسبة 50%

أطلقت OpenAI نموذجين جديدين، هما GPT-6 Sol وGPT-6 Luna، وهما متاحان الآن في واجهة برمجة تطبيقات OpenAI. تأتي هذه النماذج تحت الإصدار السابق GPT-6 Astra وتهدف إلى نقل تقدمها التقني إلى طبقات أسرع وأكثر بأسعار معقولة لأعمال البرمجة المعقدة والأعمال اليومية عالية الحجم.

media Latent Space · منذ 8 يوم · 27 مشاهدة

أنثروبيك تطلق كلاود أوبس 5.5 بكتابة محسّنة وتكاليف أقل

أطلقت أنثروبيك كلاود أوبس 5.5، وهو أول نموذج في عائلتها الجديدة من كلاود 5.5، مما يضعه كبديل أكثر كفاءة للأجيال السابقة. صُمم النموذج لأداء مهام بمستوى كلاود فابل 5.1 في معظم الحالات، مع انخفاض تكلفته بنسبة 40% مقارنة بتشغيل أوبس 5.

media MarkTechPost · منذ 8 يوم GDPval-AA (Elo) · 1695.0Elo · 23 مشاهدة

SpaceXAI تطلق Grok 4.7 بنموذج أساسي أكبر ومعايير تقييم محسّنة

أطلقت SpaceXAI نموذج Grok 4.7، وهو نموذج رائد جديد للبرمجة والمهام الوكيلية والعمل المعرفي، يعتمد على نموذج أساسي أكبر وتشغيل تعلم تعزيزي ممتد مقارنة بـ Grok 4.6. يحافظ النموذج على هيكل التسعير نفسه لسلفه مع تقديم قدرات محسّنة في التحقق الذاتي، ومعالجة السياقات الطويلة، والسلامة.

media The Batch · منذ 19 يوم GPQA Diamond · 96.3% · 32 مشاهدة

OpenAI تُطلق GPT-6 Astra، وتتصدر القوائم بميزانية أقل

أطلقت OpenAI نموذج GPT-6 Astra، وهو نموذجها الجديد الرائد في معالجة اللغات والصور، والذي يحقق تصنيفات أولى أو قريبة من الأولى على قوائم المتصدرين الرئيسية للذكاء الاصطناعي مع استخدام عدد أقل بكثير من الرموز (tokens) وتكلفة أقل مقارنة بالنماذج المنافسة. صُمم النموذج لتلبية مستوى الأمن السيبراني الحرج لدى OpenAI، حيث تُحصر القدرات السيبرانية المتقدمة في المنظمات المختارة.

blog Simon Willison · منذ 27 يوم Artificial Analysis Intelligence Index · 66.0% · 51 مشاهدة

OpenAI تُطلق GPT-6 Astra مع ARC-AGI 3 وتحسينات أمنية

أطلقت OpenAI نموذج GPT-6 Astra، وهو نموذج جديد متاح لمستخدمي ChatGPT Plus وPro وBusiness وEnterprise، وكذلك عبر واجهة برمجة التطبيقات (API) الخاصة بـ OpenAI وAWS. يُسعّر النموذج عند 10 دولارات لكل مليون توكن إدخال و50 دولارًا لكل مليون توكن إخراج، مما يضعه كمنافس لـ Claude Fable 5.

media AI News (smol.ai) · منذ 29 يوم · 50 مشاهدة

أنثروبيك تطلق كلاود فابل 5.1 ومايثوس 5.1 بأسعار مخفضة للذاكرة المؤقتة

أطلقت أنثروبيك نماذج كلاود فابل 5.1 وكلاود مايثوس 5.1 كنماذج رائدة جديدة لأعمال البرمجة والمعرفة، وتُصنّفها على أنها قادرة على تنفيذ مهام مستقلة ومتعددة الخطوات. يتضمن الإصدار تخفيضاً كبيراً في أسعار قراءة الذاكرة المؤقتة ليصبح 0.25 دولار لكل مليون توكن، مع نافذة سياق تبلغ مليون توكن.

media MarkTechPost · منذ 29 يوم GDPval-AA (Elo) · 1853.0Elo · 53 مشاهدة

أنثروبيك تطلق كلاود فابل 5.1 بنسبة 52.6% على Terminal-Bench-Science وقراءات ذاكرة تخزين مؤقت أرخص

أطلقت أنثروبيك كلاود فابل 5.1 وكلاود ميثوس 5.1 المقيد، حيث يشاركان نموذجاً أساسياً مشتركاً لكنهما يختلفان في طبقات الحماية. فابل 5.1 متاح بشكل عام عبر مزودي السحابة الرئيسيين، بينما يبقى ميثوس 5.1 محدوداً للمنظمات الموثوقة.

media MarkTechPost · منذ 7 ساعة

باحثو إنفيديا يُصدرون Physis-Lang لتحسين الاستدلال الفيزيائي في نماذج الفيديو Cosmos 3

قدّم باحثون من إنفيديا ومعهد ماساتشوستس للتكنولوجيا وجامعة أكسفورد إطار عمل Physis-Lang، الذي يعزز نماذج العالم المرئي من خلال دمج لغة فيزيائية تتطور ذاتياً في التسميات. يعامل هذا النهج اللغة الفيزيائية على أنها تمثيل قابل للتحسين يُستخدم لتنقية البيانات، وتدريب النموذج، والاستدلال لتصحيح الأخطاء الفيزيائية في الفيديوهات المُولَّدة.

media Hugging Face Forums · منذ 10 ساعة

تصنيف AI Compute Radar لأعمال Qwen من Alibaba وGoogle كأفضل مختبرات النماذج المفتوحة حسب درجة الحرارة

نشر تصنيف AI Compute Radar "لوحة الصانعين" التي تصنف 15 مختبراً تساهم في مجموعتها المتتبعة المكونة من 46 نموذجاً مفتوحاً، باستخدام مقياس مركب يُعرف بدرجة الحرارة. يتم تحديد التصنيف بناءً على عدد النماذج التي يمتلكها كل مختبر ضمن أفضل 10، مع كسر التعادل عبر أفضل ترتيب ومجموع التنزيلات خلال 30 يوماً.

blog Simon Willison · منذ 22 ساعة · مشاهدتان

Anthropic تجد أن GLM-5.3 يحقق اختطافًا كاملاً لتدفق التحكم في فرق الاختراق السيبراني

قام فريق Frontier Red Team التابع لشركة Anthropic بتقييم النموذج الصيني GLM-5.3 على 100 مهمة من معيار Binary Exploitation الداخلي ووجد أنه قادر على تطوير اختطاف كامل لتدفق التحكم في 4% من المحاولات.