المختبر · Zhipu AI
arxiv arXiv cs.AI · منذ 16 ساعة · مشاهدة واحدة

EviRover يعزز الإدراك البصري الوكيل لما وراء نظرة واحدة

يقدم المؤلفون EviRover، وهو أول وكيل إدراك تم تدريبه صراحةً لحل استفسارات الإدراك من خلال التفاعل بدلاً من الاعتماد على توقع لمرة واحدة من صورة واحدة. ولمعالجة نقص البيانات لهذا الإعداد، صمموا خطين أنابيب مخصصين لتوليد البيانات ينتجان EviRover-SFT-5K وEviRover-RL-12K، بالإضافة إلى EviLens، وهو معيار تم التحقق منه بواسطة الإنسان يحتوي على 688 حالة.

blog Simon Willison · منذ 2 يوم · 4 مشاهدات

Anthropic تجد أن GLM-5.3 يحقق اختطافًا كاملاً لتدفق التحكم في فرق الاختراق السيبراني

قام فريق Frontier Red Team التابع لشركة Anthropic بتقييم النموذج الصيني GLM-5.3 على 100 مهمة من معيار Binary Exploitation الداخلي ووجد أنه قادر على تطوير اختطاف كامل لتدفق التحكم في 4% من المحاولات.

media r/LocalLLaMA · منذ 2 يوم · مشاهدة واحدة

ربط بحث أنثروبيك GLM-5 بنشر القدرات السيبرانية المتقدمة

نشرت أنثروبيك مقالاً بحثياً بعنوان "GLM-5.3 ونشر القدرات السيبرانية المتقدمة"، يدرس كيفية استخدام النماذج مفتوحة المصدر مثل GLM-5 في الأنشطة السيبرانية الخبيثة. يبرز المقال أن هذه النماذج قد تم اعتمادها على نطاق واسع من قبل الجهات الفاعلة في التهديدات، وتعمل فعلياً كإعلان لقدراتها داخل مجتمع الأمن. يؤكد هذا التحليل على القلق المتزايد بشأن الطبيعة ذات الاستخدام المزدوج للنماذج المتقدمة للذكاء الاصطناعي وإمكانية تضخيم التهديدات السيبرانية.

arxiv arXiv cs.CL · منذ 3 يوم · مشاهدة واحدة

دراسة تكشف عن تباعد في السياسات المعرفية خلال تلوث نماذج اللغات الكبيرة متعددة الأدوار

تقيّم دراسة بعنوان "التباعد في السياسات المعرفية خلال تلوث نماذج اللغات الكبيرة متعددة الأدوار: تحقيق تدرج البروتوكول" كيفية تعامل نماذج اللغات الكبيرة مع المقدمات الخاطئة المُحقَنة في سجل المحادثة، وهي حالة فشل تُعرف بالتلوث على مستوى الجلسة. اختبر الباحثون GPT-5.4 Mini وGemini-3.1 Flash-Lite وGLM-4.5-Air عبر عشرة مجالات معرفية باستخدام 22,500 دور عند درجة حرارة صفر.

arxiv arXiv cs.CL · منذ 9 يوم · 19 مشاهدة

TelecomGPT-R1: تدريب موحد ما بعد التدريب للاستدلال عبر مهام اتصالات متنوعة

يقدم الباحثون TelecomGPT-R1، وهو عائلة من نماذج استدلال الاتصالات المفتوحة المصدر والموحدة، مصممة لأتمتة المهام الهندسية من خلال الاستدلال على المعايير والتكوينات والسجلات. يتناول النموذج قيود نماذج الذكاء الاصطناعي التوليدية العامة والمتخصصة الحالية من خلال نهج هيكلي يغطي محاور البروتوكول والمعرفة والنمذجة والأعطال.

arxiv arXiv cs.LG · منذ 10 يوم HealthBench · 50.1% · 13 مشاهدة

Fathom-Vaidya يحسّن الاستدلال الطبي باستخدام مكافآت قائمة على المعايير

يقدم المؤلفون Fathom-Vaidya، وهو نموذج بـ 30B معلمة يستخدم بيانات اصطناعية وتعلّم التعزيز القائم على المعايير لتعزيز الاستدلال التشخيصي والسريري في الرعاية الصحية. يطبق إطار التدريب أولاً RL الموجه بالقواعد على الأسئلة المستمدة من MedBullets للتشخيص، ثم يستخدم 5.3k سيناريوهات اصطناعية متعددة الأدوار بمعايير متعددة الأبعاد لمهام سريرية تفاعلية.

media r/LocalLLaMA · منذ 13 يوم · 28 مشاهدة

يقوم ZCode بتحميل سجل Git الكامل ومساحة العمل بصمت إلى Aliyun OSS

تم العثور على تطبيق الترميز الرسمي بالذكاء الاصطناعي من Zhipu، وهو ZCode، يقوم بتعبئة وتحميل مساحات العمل الكاملة للمستخدمين عند تسجيل الدخول. تتضمن هذه العملية تشفير البيانات وإرسالها مباشرة إلى Aliyun OSS.

arxiv arXiv cs.CL · منذ 15 يوم · 24 مشاهدة

تقييم نماذج الحدود العليا في لعبة أسئلة log(N) عبر ويكيبيديا

تقيّم دراسة ستة نماذج لغوية حدودية عليا في مهمة اتصال بين وكيلين، حيث يحدد مُطرح الأسئلة هدفاً من بين N فقرة من ويكيبيديا باستخدام بالضبط log2(N) من أسئلة نعم/لا. جرت التجربة على 408 لعبة عبر مجموعات وثائق تتراوح من 4 إلى 1024 فقرة، وكشفت عن تفاوتات أداء كبيرة بين النماذج المختبرة.

media r/LocalLLaMA · منذ 18 يوم · 25 مشاهدة

InternLM تُطلق نموذج Intern-S2-397B متعدد الوسائط للذكاء العلمي

أعلنت InternLM عن إطلاق Intern-S2-397B، وهو نموذج أساسي متعدد الوسائط يحتوي على 397 مليار معلمة، صُمم خصيصاً للذكاء العلمي والوكلاء ذوي الأفق الزمني الطويل. يمتد نطاق النموذج عبر التدريب المسبق وتغطية مهام التعلم المعزز وبيئات الوكلاء التفاعلية لتعزيز قدرات الاستدلال العام والوكيل.

arxiv arXiv cs.CL · منذ 22 يوم · 33 مشاهدة

هجوم أحادي الاتجاه على GLM-5.3-Flash يكشف عن هشاشة محاذاة السلامة في نماذج MoE

أظهر الباحثون أن الحذف الاتجاهي، وهو هجوم ذو صندوق أبيض يزيل الرفض من خلال إسقاط اتجاه واحد من الأوزان، يبقى فعالاً على نماذج المزج المتقدمة (MoE) مثل GLM-5.3-Flash. تُظهر الدراسة أنه بينما ينجو الهجوم من البنية المعمارية، فإن آثاره موزعة عبر كتّاب الانتباه والكثيفين والخبراء الموجهين بدلاً من تركيزها في موقع واحد.