يقدم الباحثون GPQA، وهو مجموعة بيانات صعبة تحتوي على 448 سؤالاً متعدد الخيارات كتبها خبراء في مجالات الأحياء والفيزياء والكيمياء. تم تصميم المعيار ليكون صعبًا للغاية؛ حيث يحقق الخبراء بمستوى الدكتوراه دقة تبلغ 65% فقط، بينما يصل غير الخبراء المهرة إلى 34% حتى مع الوصول غير المقيد إلى الويب. تواجه أنظمة الذكاء الاصطناعي المتطورة أيضًا صعوبات، حيث تحقق أقوى خط أساس لـ GPT-4 دقة تبلغ 39% فقط. يهدف هذا الصعوبة لكل من البشر والنماذج الحدودية إلى تمكين تجارب مراقبة قابلة للتوسع وواقعية للإشراف على مخرجات الذكاء الاصطناعي في تطوير المعرفة العلمية.
GPQA: معيار أسئلة وأجوبة على مستوى الدراسات العليا ومقاوم لبحث Google
Benchmarks
| Benchmark | النموذج | الدرجة |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
يقدم M$^3$R-Bench معيارًا مدعومًا بالأدلة لفهم الاستعارات متعددة الوسائط
يقدم الباحثون M$^3$R-Bench، وهو معيار موحد يحتوي على 1,000 حالة من الصور والنصوص معannotations تم التحقق منها بشريًا مصممة لتقييم فهم الاستعارات متعددة الوسائط المدعوم بالأدلة. يوفر المعيار annotations مشتركة لحدوث الاستعارة، والربط بين الهدف والمصدر، والمشاعر، وشرح خطوة بخطوة بناءً على نظرية الاستعارة المفاهيمية.
إطار عمل Zing يعزز الذكاء الاجتماعي لنماذج اللغات الكبيرة عبر معيار SoMBench وترسيخ Actio
يقدم التقرير إطار عمل Zing، وهو إطار متكامل مصمم لتعزيز الذكاء الاجتماعي للنماذج اللغوية الكبيرة من خلال قياس القدرات الاجتماعية واستيعابها وترسيخها. يقدم المؤلفون معيار SoMBench، وهو معيار مدعوم بعلم النفس يمتد عبر 17 بُعداً ثانوياً و3,481 حالة تم التحقق منها من قبل خبراء، والذي يكشف أن النماذج اللغوية الكبيرة الحالية لديها مجال كبير للتحسين دون أن يصل أي نموذج إلى أداء قريب من الذروة.
يكشف مقياس SRRM أن Qwen2.5-1.5B يتفوق على 3B في ذاكرة السياق الطويل
باحث يبحث عن موافقة من arXiv cs.CL لورقة بحثية تقدم Simple Retrieval-Reconstruction Memory (SRRM)، وهو مقياس خفيف الوزن مصمم لتقييم ذاكرة السياق الطويل في نماذج اللغة الصغيرة.
ضبط النماذج اللغوية الكبيرة (LLM) باستخدام السمات يحسّن تقييم المقالات عبر معايير متعددة
يتناول الباحثون تحدي التقييم الآلي للمقالات عندما يقوم المعلمون بمراجعة أو إدخال معايير جديدة، وهو سيناريو يُعرف بالتعميم عبر المعايير. يقترحون إطار عمل لضبط النماذج اللغوية الكبيرة (LLM) يستخدم تمثيلات وسيطة مستقلة عن المعيار تُسمى "سمات" (traits) جنبًا إلى جنب مع إشراف المقالات المستهدفة أثناء التدريب.
تتبع غورباني المباشر: معيار ونظام مرجعي لكتابة ترجمات كيرتان السيخ
يقدم المؤلفون معيارًا ونظامًا مرجعيًا للترجمة التلقائية المباشرة لكيرتان السيخ، والتي تتضمن التلاوة الغنائية المستمرة لآيات من كتاب شري غورو غرانث صاحب جى. وعلى عكس النسخ بمفردات مفتوحة، تتطلب هذه المهمة تطابقًا حرفيًا دقيقًا من النص المقدس لتجنب الأخطاء الإملائية غير المناسبة دينيًا.