المختبر · Zhipu AI
media Interconnects · منذ 4 ساعة

Z.ai تطلق GLM-5.3 مع تدريب ما بعد الامتداد

أعلنت Z.ai عن GLM-5.3، وهو نموذج جديد يحقق أداءً متقدمًا في معايير برمجة الوكلاء من خلال توسيع تدريب ما بعد النموذج الأساسي GLM-5.2. يتفوق النموذج ذو ~750B معلمة حاليًا على Kimi K3 ويساوي أو يتجاوز Claude Fable 5 و GPT-5.6-Sol في معايير مختلفة.

media MarkTechPost · منذ 14 ساعة · مشاهدتان

Z.ai تطلق GLM-5.3 مع تحسينات في البرمجة والأمن السيبراني عبر التدريب اللاحق

أطلقت Z.ai نموذج GLM-5.3، وهو تحديث لنموذجها الذي يحتوي على 743B معامل، يحقق مكاسب في الأداء من خلال توسيع نطاق التدريب اللاحق بدلاً من إعادة تدريب النموذج الأساسي. الإصدار متاح حالياً عبر واجهة برمجة التطبيقات (API) الخاصة بـ Z.ai، وخطة GLM Coding، وZCode، مع جدولة نشر الأوزان العامة بعد أسبوعين تقريباً من الإطلاق عقب تقييمات السلامة.

arxiv arXiv cs.LG · منذ 2 يوم HealthBench · 51.9% · 5 مشاهدات

نظام VITA للرAG السريري يساوي أو يتفوق على نماذج LLM المتقدمة في HealthBench

تم تقييم نظام توليد معزز بالاسترجاع (RAG) المصمم خصيصًا والمسمى VITA، والمخصص للبيئات منخفضة ومتوسطة الدخل، مقابل نماذج لغوية كبيرة لأغراض عامة على معيار HealthBench. من بين 4023 سؤالًا تم تقييمها بواسطة حكم GPT-4.1، احتل VITA المرتبة الأولى بنسبة 51.9% من نقاط المعايير الممكنة، متفوقًا على GPT-5.4 و o4-mini و Gemini 3.1 Pro و Claude Sonnet 4.6.

arxiv arXiv cs.LG · منذ 4 يوم · مشاهدتان

Macaron-V1 يُطلق عائلة نماذج وكلاء مفتوحة المصدر باستخدام Mixture-of-LoRA للتعلم المستمر

يُعد Macaron-V1 عائلة نماذج وكلاء مفتوحة المصدر مصممة للذكاء التجريبي، مما يتيح التعلم من البيئات الحقيقية والاستمرار في التعلم بعد النشر. يركز النظام على هدفين: التكيف من خلال التحسين المتكرر لأزواج النموذج-المقصودة، والتعاون عبر بنية Mixture-of-LoRA (MoL) التي تختار محولات LoRA المتخصصة لكل دور للمستخدم.

arxiv arXiv cs.CL · منذ 4 يوم · 10 مشاهدات

Macaron-V1 يُطلق عائلة نماذج وكلاء مفتوحة المصدر باستخدام مزيج من LoRA للتعلم المستمر

يُعد Macaron-V1 عائلة نماذج وكلاء مفتوحة المصدر مصممة للذكاء التجريبي، مما يتيح للنظم التعلم من تجارب العالم الحقيقي والاستمرار في التحسين بعد النشر. يركز العمارة على هدفين رئيسيين: التكيف من خلال التحسين الذاتي المتكرر لأزواج النموذج-المُجَهِّز، والتعاون عبر نظام مزيج من LoRA (MoL) الذي يختار محولات متخصصة لكل دور للمستخدم.

arxiv arXiv cs.CL · منذ 15 يوم · 4 مشاهدات

OSReward تقدم تقييماً موحداً لنماذج المكافآت للاستخدام الحاسوبي عبر المنصات

يقدم الباحثون OSReward، وهو معيار واقعي مصمم لتقييم موثوقية نماذج الرؤية واللغة (VLMs) التي تعمل كحكم لمسارات وكلاء الاستخدام الحاسوبي. تكشف الدراسة أن أحدث نماذج VLM تعاني من تحيز التساهل المنهجي وغالباً ما تكون مكلفة جداً للتوسع، بينما تؤدي النماذج المفتوحة الميسورة التكلفة أداءً ضعيفاً.

media TLDR AI · منذ 16 يوم · 34 مشاهدة

xAI تطلق وضع البناء؛ باحثون يطالبون باتفاق لتباطؤ الذكاء الاصطناعي

أطلقت xAI "وضع البناء" لمشتركي SuperGrok Heavy، مما يمكّن المستخدمين من إنشاء مواقع الويب والتطبيقات والألعاب ولوحات المعلومات ومراجعتها ونشرها مباشرة من الدردشة دون إعداد مسبق. وفي الوقت نفسه، وقع أكثر من ألف موظف من شركات الذكاء الاصطناعي المتقدمة على بيان يطلب من الحكومة الأمريكية دعم جهد دولي لتطوير أدوات لتسريع تطوير الذكاء الاصطناعي الآلي عمدًا.

media AI News (smol.ai) · منذ 17 يوم · مشاهدتان

مونشوت تطلق نموذج Kimi K3 مفتوح الأوزان والبنية التحتية

أطلقت مونشوت التفاصيل الكاملة والأوزان والبنية التحتية الداعمة لنموذج Kimi K3، وهو نموذج Mixture-of-Experts بـ 2.8T معامل، مع حوالي 104B معامل نشط لكل توكن. يتضمن الإطلاق تقارير تقنية تفصل عن مكدس السياق الطويل الهجين وأدوات جديدة مثل MoonEP وFlashKDA وAgentEnv.

arxiv arXiv cs.CL · منذ 18 يوم · 3 مشاهدات

تشارك PIVOT مسوحات البادئة عبر مجموعات الاستعلام لتسريع الانتباه المتناثر على مستوى الرموز

PIVOT (الفهرسة الوسيطة عبر اجتياز بادئة كاملة) هي بديل جاهز للاستخدام لا يتطلب تدريبًا، لفهرس DeepSeek Sparse Attention (DSA)، ويقلل من التكرار الحسابي عن طريق مشاركة مسح بادئة واحدة عبر مجموعة من الاستعلامات القريبة. وبدلاً من تقييم كل رمز سابق لكل استعلام على حدة، تجمع PIVOT المجموعة في استعلام وسيط واحد للحصول على مجموعة مرشحة، يتم منها اختيار أفضل k رموز لكل استعلام.

arxiv arXiv cs.CL · منذ 18 يوم · مشاهدتان

إطار عمل Zing يعزز الذكاء الاجتماعي لنماذج اللغات الكبيرة عبر معيار SoMBench وترسيخ Actio

يقدم التقرير إطار عمل Zing، وهو إطار متكامل مصمم لتعزيز الذكاء الاجتماعي للنماذج اللغوية الكبيرة من خلال قياس القدرات الاجتماعية واستيعابها وترسيخها. يقدم المؤلفون معيار SoMBench، وهو معيار مدعوم بعلم النفس يمتد عبر 17 بُعداً ثانوياً و3,481 حالة تم التحقق منها من قبل خبراء، والذي يكشف أن النماذج اللغوية الكبيرة الحالية لديها مجال كبير للتحسين دون أن يصل أي نموذج إلى أداء قريب من الذروة.

media MarkTechPost · منذ 27 يوم SWE-bench Verified · 80.6% · 24 مشاهدة

مقارنة بين Kimi K3 وDeepSeek V4 Pro وGLM-5.2 من حيث المقاييس، الترخيص، وتكلفة التشغيل

تُقيّم مقارنة ثلاثة نماذج مفتوحة الوزن من نوع Mixture-of-Experts ذات بنية متفرقة—وهي Kimi K3 من Moonshot AI، وDeepSeek V4 Pro، وGLM-5.2 من Zhipu AI—قدراتها وشروط ترخيصها وتكاليف تشغيلها لأعمال البرمجة طويلة المدى وأعباء العمل الوكيلية.