Multimodal
media MarkTechPost · منذ 4 يوم · مشاهدة واحدة

إنفيديا تطلق Alpamayo 2 Super، نموذج VLA مفتوح المصدر بـ34 مليار معلمة للقيادة الذاتية

أطلقت إنفيديا Alpamayo 2 Super، وهو نموذج رؤية-لغة-فعل (VLA) بـ34 مليار معلمة مصمم لتاكسيات الروبوت والقيادة الذاتية بموجب ترخيص OpenMDW-1.1. يستهدف النموذج الأحداث ذات الذيل الطويل من خلال دمج العمود الفقري Cosmos 3 Super Reasoner المكون من 32 مليار معلمة مع فاعل انتشار مبني على الانتشار بحجم 2.3 مليار معلمة لتوليد المسارات، والتفسيرات السببية، والإجراءات الوصفية من مقاطع الفيديو متعددة الكاميرات.

arxiv arXiv cs.AI · منذ 4 يوم

Video-DeepResearch يقدم وكيلًا متعدد الوسائط لتدفقات الفيديو المستمرة

يقدم الباحثون Video-DeepResearch (Video-DR)، وهو إطار عمل يمدد الوكلاء متعددي الوسائط من الصور الثابتة إلى تدفقات الفيديو المستمرة، مما يعالج تحيز الوسائط وتسرب المعرفة البارامترية. يعتمد النظام على خط أنابيب لفصل الاستكشاف عن الإدراك مع فتح الأدوات تدريجيًا لضمان التأسيس البصري عبر الإطارات قبل البحث في الويب.

lab Mistral AI News · منذ 5 يوم · 3 مشاهدات

Shieldstral يُطلق مصنف أمان متعدد الوسائط بحجم 3 مليار معلمة يتكيف مع السياسات

يُعد Shieldstral مصنف أمان متعدد الوسائط مفتوح الأوزان بحجم 3 مليار معلمة، يصوّر وسيط المحتوى كمهمة إجابة على أسئلة تتكيف مع السياسات، مما يتيح له قبول سياسات بلغة طبيعية أثناء الاستدلال دون الحاجة إلى إعادة التدريب. يُوحد تقييم أمان النصوص والصور ويقدّم درجات أمان معايرة عبر معايير متنوعة بينما يعمل بكفاءة على بطاقة NVIDIA GPU واحدة بسعة 16GB.

media MarkTechPost · منذ 6 يوم GPQA Diamond · 89.5% · مشاهدة واحدة

مختبر الآلات المفكرة يُصدر Inkling-Small، وهو نموذج MoE متعدد الوسائط بوزن مفتوح يتكون من 276 مليار معلمة

أطلق مختبر الآلات المفكرة (Thinking Machines Lab) نموذج Inkling-Small، وهو نموذج مزيج من الخبراء (Mixture-of-Experts) بوزن مفتوح يحتوي على إجمالي 276 مليار معلمة و12 مليار معلمة نشطة. تم تدريب النموذج على الاستدلال بشكل أصلي عبر النصوص والصور والصوت، ويتميز بنافذة سياق تتكون من مليون رمز (token) وجهد تفكير قابل للتعديل.

media AI News (smol.ai) · منذ 9 يوم · مشاهدتان

OpenAI تخفض أسعار GPT-5.6، Thinking Machines تُطلق Inkling-Small، وGoogle تُطلق Gemini Robotics 2

تغطي هذه الجولة من أخبار الذكاء الاصطناعي تطورات كبيرة في التسعير والنماذج مفتوحة الأوزان والبنية التحتية للروبوتات. خفضت OpenAI تكاليف GPT-5.6 بشكل عدواني، بينما أطلقت Thinking Machines نموذجاً متعدد الوسائط مضغوطاً، ووسّعت Google DeepMind قدراتها في مجال الروبوتات.

media r/LocalLLaMA · منذ 12 يوم · 5 مشاهدات

مايكروسوفت تطلق Mage-VL، نموذجًا متعدد الوسائط للبث الأصلي المشفر

أطلقت مايكروسوفت Mage-VL، وهو نموذج أساسي متعدد الوسائط بكفاءة عالية يحتوي على 4 مليار معلمة لفهم الصور والفيديو، يعتمد على نهج مشفر أصلي لتبسيط المعالجة البصرية. يفصل النظام تدفقات الفيديو إلى إطارات مرجعية (I) وإطارات متوقعة (P)، مع الاحتفاظ فقط بالبقع التي تخصص لها المشفر بتات لتقليل استهلاك الرموز البصرية بنسبة تزيد عن 75%.

lab NVIDIA Research · منذ 12 يوم · 8 مشاهدات

إنفيديا تطرح Spatial-IQ، إطار تشخيصي هرمي للاستدلال المكاني في النماذج متعددة الوسائط

أطلق باحثو إنفيديا إطار Spatial-IQ التشخيصي المصمم لتحليل الذكاء المكاني للنماذج اللغوية الكبيرة متعددة الوسائط (MLLMs). وعلى عكس المقاييس الحالية التي تعامل النماذج كصناديق سوداء، يقوم هذا النهج بتحليل عدّ الأجسام في الهياكل ثلاثية الأبعاد المتراكمة إلى تسعة مهام فرعية إدراكية ومعرفية متوافقة مع مراحل النمو البشري.

arxiv arXiv cs.AI · منذ 12 يوم · مشاهدة واحدة

ClinFusion يقدم نموذجًا لغويًا متعدد الوسائط كبيرًا يركز على الرؤية للفهم الطبي الشامل

يقدم الباحثون ClinFusion، وهو نموذج لغوي متعدد الوسائط كبير يركز على الرؤية، مصمم لمعالجة تحديات نشر الذكاء الاصطناعي في الممارسة السريرية من خلال توحيد فهم الصور الطبية ثنائية وثلاثية الأبعاد. يتميز النظام بمُشفِّر رؤية متدرج مركب يتضمن عامل دمج محلي مكاني متسلسل واعٍ، ويتضمن إطار تقييم جديدًا يتكون من MedIF-Bench ومقاييس مبنية على منطقة الاهتمام.

arxiv arXiv cs.CL · منذ 12 يوم · مشاهدة واحدة

ClinFusion: نموذج لغوي متعدد الوسائط يركز على الرؤية يحقق حالة فنية جديدة في المعايير الطبية

يقدم الباحثون ClinFusion، وهو نموذج لغوي كبير متعدد الوسائط يركز على الرؤية ومصمم للفهم الطبي الشامل الذي يوحّد تحليل الصور ثنائية الأبعاد والصور ثلاثية الأبعاد الأصلية. يستخدم النظام مشفر رؤية متدرج مركب مع عامل دمج محلي مكاني متسلسل لمعالجة تحديات التصوير الطبي غير المتجانس.

lab NVIDIA Research · منذ 13 يوم · 3 مشاهدات

تحليل الذكاء الاصطناعي متعدد الوسائط للتواصل غير اللفظي في دلتا فورس

يقوم الباحثون بتحليل مقاطع فيديو اللعب من لعبة التصويب التنافسية دلتا فورس لاستخراج وفهم التواصل غير اللفظي الناشئ، مثل الإيماءات وأنماط الحركة. يتناول هذا العمل فجوة في الدراسات السابقة التي ركزت بشكل كبير على ألعاب MOBA أو التنسيق اللفظي في ألعاب التصويب الأخرى.

github llama.cpp · منذ 13 يوم · 3 مشاهدات

يضيف llama.cpp b10142 دعماً أولياً لرؤية MiniMax-M3

أصدر مشروع llama.cpp الإصدار b10142، الذي يقدم دعماً أولياً للرؤية لنموذج MiniMax-M3. يطبق هذا التحديث نسخة تعتمد على النص فقط وتعيد استخدام المكونات الموجودة من MiniMax-M2، بما في ذلك GQA مع تطبيع QK لكل رأس ودوران جزئي، وخبراء بأسلوب DeepSeek-V3، وتنشيط swigluoai.

media MarkTechPost · منذ 13 يوم · مشاهدة واحدة

Black Forest Labs تطلق FLUX 3، نموذج تدفق متعدد الوسائط للتنبؤ بالصور والفيديو والصوت وحركات الروبوت

أطلقت Black Forest Labs FLUX 3، وهو نموذج أساسي متعدد الوسائط يتعلم من الصور ومقاطع الفيديو والصوت ضمن بنية واحدة. إنه أول نموذج FLUX يُصدر التنبؤ بالفيديو والصوت والحركة من مجموعة واحدة من الأوزان.

media MarkTechPost · منذ 14 يوم · مشاهدتان

مختبرات الحث تُصدر فوتون-1، نموذج تخيل مُدرَّب على 18 عاماً من الفيديو

أطلقت مختبرات الحث (Induction Labs) نموذج فوتون-1، وهو محوّل مزيج خبراء متناثر بحجم 106B-A5B يتعلّم محاكاة بيئات سطح المكتب ولعب الألعاب من خلال التنبؤ بالإطارات المستقبلية من الفيديو الخام دون تسميات الإجراءات. يستخدم النموذج الكمّنة القياسية المحدودة لضغط كل إطار إلى 960 رمزاً منفصلاً، محقّقاً ضغطاً أفضل بمئة مرة مقارنةً بالتمثيلات الحالية مع الحفاظ على تفاصيل النص والتنسيق.