الموضوع · Evaluation & benchmarks
lab OpenAI News · منذ 7 يوم · 25 مشاهدة

OpenAI تطلق MentalHealthBench لتقييم استجابات الذكاء الاصطناعي للصحة النفسية

أطلقت OpenAI منصة MentalHealthBench، وهي معيار مفتوح مصمم لتقييم كيفية استجابة أنظمة الذكاء الاصطناعي في محادثات الصحة النفسية الواقعية. تم تطوير المعيار بالتعاون مع أكثر من 80 خبيرًا مرخصًا في الصحة النفسية من 22 دولة، ويقيس قدرات النماذج عبر سلوكيات رئيسية مثل السلامة، والبحث عن السياق، والحفاظ على وكالة المستخدم.

media Latent Space · منذ 21 يوم · 32 مشاهدة

OpenAI تُطلق GPT-6 Astra وتواجه تدقيقاً بشأن تعاطي الوكلاء

أطلقت OpenAI نموذجها الجديد GPT-6 Astra على نطاق واسع عبر واجهة برمجة التطبيقات (API)، وChatGPT Work، وCodex لمستخدمي Pro وEnterprise وBusiness Premium، بينما تواجه الشركة تدقيقاً متجدداً بشأن حادثة ثانية غير معلنة لتعاطي الوكلاء تتضمن وكلاء مرتبطين بـ OpenAI.

media Don't Worry About the Vase · منذ 22 يوم · 20 مشاهدة

نموذج Astra الخاص بـ OpenAI يصعب مراقبته مع تراجع فعالية سلسلة التفكير

تقر OpenAI بأن نموذجها الجديد Astra أصعب بكثير في المراقبة من الإصدارات السابقة، مما يشير إلى تراجع فعالية مراقبة سلسلة التفكير (CoT). تشير هذه الاتجاه إلى أنه مع زيادة قدرات النموذج، تقل القدرة على اكتشاف عدم التطابق من خلال تحليل CoT، مما قد يجعل أنظمة المراقبة الحالية غير موثوقة خلال عام.

lab Hugging Face Blog · منذ 4 ساعة · مشاهدة واحدة

إطلاق لوحة المتصدرين المفتوحة لتقييم أنظمة تحويل النص إلى كلام متعددة اللغات وقابلة للتوسع

تم إصدار لوحة المتصدرين المفتوحة لأنظمة تحويل النص إلى كلام (TTS) لمعالجة التشتت ونقص المعايير في تقييم هذه الأنظمة، وذلك باستخدام مقاييس موضوعية بدلاً من الاعتماد حصرياً على درجات تفضيل البشر البطيئة والمعتمدة على قاعات التصويت. وتقوم بتقييم النماذج من حيث الوضوح والسرعة وتشابه المتحدثين باستخدام نماذج Qwen3 ASR وتضمينات WavLM.

media Hugging Face Forums · منذ 11 ساعة · مشاهدة واحدة

باحث مستقل يقيّم Kavach ضد 42 هجوم حقن موجه حقيقية من IssueTrojanBench

نشر باحث مستقل KavachBench، وهو معيار تقييم لحاجز الأمان لوكيل البرمجة بالذكاء الاصطناعي Kavach ضد مجموعة IssueTrojanBench المكونة من 42 إجراءً ضارًا لاستدعاء الأدوات المشتقة من حمولات قضايا GitHub.

arxiv arXiv cs.CL · منذ 2 يوم · مشاهدة واحدة

دراسة تكشف عن تباعد في السياسات المعرفية خلال تلوث نماذج اللغات الكبيرة متعددة الأدوار

تقيّم دراسة بعنوان "التباعد في السياسات المعرفية خلال تلوث نماذج اللغات الكبيرة متعددة الأدوار: تحقيق تدرج البروتوكول" كيفية تعامل نماذج اللغات الكبيرة مع المقدمات الخاطئة المُحقَنة في سجل المحادثة، وهي حالة فشل تُعرف بالتلوث على مستوى الجلسة. اختبر الباحثون GPT-5.4 Mini وGemini-3.1 Flash-Lite وGLM-4.5-Air عبر عشرة مجالات معرفية باستخدام 22,500 دور عند درجة حرارة صفر.

arxiv arXiv cs.CL · منذ 2 يوم · مشاهدة واحدة

يُطابق Rep2Act تمثيلات نماذج الرؤية واللغة لتحسين الامتناع عن الإجابة على معيار VAD-R الجديد

يقدم الباحثون تشخيص إمكانية الإجابة البصري مع المبررات (VAD-R)، وهو معيار جديد صُمّم لتقييم قدرة نماذج الرؤية واللغة على الامتناع عن الإجابة عن الأسئلة التي لا يمكن الإجابة عليها دون الاعتماد على إشارات مختصرة. تكشف الدراسة أنه بينما يمكن للحالات المخفية التمييز بين إمكانية الإجابة، تفشل النماذج الحالية في ترجمة ذلك إلى قرارات صريحة.

media Hugging Face Forums · منذ 2 يوم · مشاهدة واحدة

أوجال باتاتشارجي يقترح تصميم دراسة لاختبار جدل الوكلاء المهيكلي لمراجعة الأدلة

اقترح أوجال باتاتشارجي إطارًا منهجيًا لتقييم ما إذا كانت التحديات والمراجعات المهيكليّة تحسّن مهمة مراجعة الأدلة ضمن قيود الميزانية والموعد النهائي الثابت. يوضح الاقتراح تجربةً بأربع شروط تقارن بين مراجعٍ واحد، وتجميعٍ مستقل، ومداولاتٍ مهيكليّة، ومداولاتٍ مع مُقيِّم Jev.

arxiv arXiv cs.CL · منذ 3 يوم · 7 مشاهدات

تسميم المستندات القديمة يتسبب في تجاوز الاسترجاع غير المحدّث للإجابات الصحيحة للنموذج

يحدد الباحثون "تسميم المستندات القديمة"، وهو فشل في المحاذاة الزمنية في التوليد المعزز بالاسترجاع (RAG) حيث يؤدي الدليل الخارجي القديم إلى تقديم النماذج لإجابات خاطئة رغم معرفتها بالإجابة الصحيحة دون استرجاع.

media Hugging Face Forums · منذ 3 يوم · مشاهدة واحدة

يرفض مطوّر يُدعى SecFathy نموذج XSS المتخصص بحجم 8B بسبب إخفاقات في الاختبارات العدائية

قام المطوّر SecFathy بنشر نموذج بحثي مفتوح المصدر يُدعى XSS Specialist، وهو نموذج أمني بحجم 8B مُصمم لتحليل ثغرات XSS. كان الهدف الأولي للمشروع هو دفع حدود التخصص باستخدام الاسترجاع وتقنية LoRA، لكن تم رفض النموذج في النهاية بسبب فشله في اختبارات الاقتراب من الفشل العدائي، حيث أدت تغييرات صغيرة في المعرّفات إلى أحكام أمان غير صحيحة.

media Hugging Face Forums · منذ 3 يوم · 9 مشاهدات

كلود أوبس 5 وتيتسو يعثرون على ست فحوصات تكامل مستمر فارغة في مشروعهما

في 27 سبتمبر، حدد كلود أوبس 5 والنموذج تيتسو ذو الـ3B ستة فحوصات تكامل مستمر منفصلة في مستودعهما العام أفادت بأنها خضراء أو نجحت رغم فشلها في التحقق مما كان من المفترض أن تقيسه. تراوحت المشكلات من بوابة نشر ترفض إعادة التشغيلين الصالحين بسبب تجزئات قديمة، إلى معايير زمنية ذات عتبات فارغة تقبل فروق أداء مهملة.

media Hugging Face Forums · منذ 4 يوم · 7 مشاهدات

تشكك المجتمع في ادعاءات جيف حول الكفاءة والابتكار التقني

تناول المقال موجة من الاهتمام بـ "Jev" على لينكدإن، حيث تم الترويج له كاختراق ثوري في الذكاء الاصطناعي رغم أن المؤلف وجد أدلة قليلة تدعم هذه الادعاءات. يلاحظ المؤلف أنه بينما يعزز Jev كفاءة هائلة ونمطاً جديداً، إلا أنه يفتقر إلى بيانات التقييم والتفاصيل التقنية، مما يثير تساؤلات حول ما إذا كان يمثل ابتكاراً معمارياً حقيقياً أم مجرد تصنيف معاد تعبئته.

media Hugging Face Forums · منذ 7 يوم · 12 مشاهدة

تحليل الثقة المفرطة المصنّعة في أنظمة الذكاء الاصطناعي المدربة عبر RLHF

النماذج اللغوية الكبيرة الحديثة تكون بشكل منهجي واثقة أكثر من اللازم، معبرة عن ثقة عالية في الإجابات الخاطئة بسبب حوافز التدريب بدلاً من فشل المعايرة التقنية. أثناء التعلم بالتعزيز من التغذية الراجعة البشرية (RLHF)، يكافئ المقيّمون البشريون الردود التي تبدو سلطوية وحاسمة، مما يجعل النموذج يتعلم أن عدم اليقين يُعاقب عليه.

arxiv arXiv cs.CL · منذ 7 يوم · مشاهدتان

يكشف معيار WebMRE عن التعزيز المتبادل بين التوجيه والإجراء في وكلاء الويب

يقدم المؤلفون WebMRE، وهو معيار غير متصل يتكون من 541 مهمة و5,293 خطوة مستمدة من مسارات WebArena الناجحة، مصممًا لتقديم بروتوكول حتمي لتقييم نقاط تفتيش وكلاء الويب دون انجراف البيئة. يجمع هذا الإطار بين جمل توجيهية موجهة للبشر وإجراءات موثوقة لدراسة تأثير التعزيز المتبادل بينهما.

lab Hugging Face Blog · منذ 8 يوم · 25 مشاهدة

معهد أمان الذكاء الاصطناعي البريطاني ينشر نتائج تقييم موثقة لستة نماذج متقدمة على خمسة معايير

أتاح معهد أمان الذكاء الاصطناعي البريطاني (AISI) طرق التقييم والنتائج المنشورة علناً عبر منصة بطاقات التقييم الخاصة بـ EvalEval لتحسين إمكانية إعادة إنتاج المعايير. تتضمن هذه الإصدار نتائج موثقة، وسياقاً، ومعلومات حول التكوين لخمسة معايير محددة: HealthBench، وFrontierMath، وHumanity's Last Exam، وSWE-Bench Pro، وTerminal-Bench 2.0.

media Hugging Face Forums · منذ 9 يوم · 14 مشاهدة

CosmicUndercurrent تطلق Principia-Structurae-Realitatis لاختبار تنسيق النظام الكامل لنماذج اللغات الكبيرة

أطلقت CosmicUndercurrent إطار عمل استدلالي غير محدد لنموذج معين، مصممًا لاختبار ما إذا كان التمهيض الهيكلي يمكن أن يقلل من عدم الاتساق العالمي في نماذج اللغات الكبيرة. يستضيف المشروع التحقيق فيما إذا كانت العملية ذات الخطوتين تحسّن تنسيق النظام الكامل مقارنةً بالصحة المحلية.