Multimodal
arxiv arXiv cs.CL · منذ 7 ساعة · 11 مشاهدة

Qwen تطلق Qwen3.8-Omni-Flash، نموذجًا متعدد الوسائط أصليًا مع سياق مكون من مليون رمز

أعلنت Alibaba Cloud عن إطلاق Qwen3.8-Omni-Flash، وهو نموذج متعدد الوسائط أصليًا مصمم لمهام الإنتاجية في العالم الحقيقي، والذي يحسّن بشكل كبير الفهم والاستدلال متعدد الوسائط مقارنة بالنماذج السابقة.

media MarkTechPost · منذ 3 يوم · 18 مشاهدة

فريق علي بابا كوين يُصدر Qwen3.8-LiveTranslate ببنية Interleave

أطلق فريق علي بابا كوين نموذج Qwen3.8-LiveTranslate، وهو نموذج ترجمة متزامنة فورية من الجيل التالي يستمع إلى الكلام الحي ويعيد النص المترجم والصوت أثناء استمرار المتحدث في الحديث. يُقدّم هذا الإصدار بنية Interleave جديدة مصممة لتقليل زمن الانتظار وتحسين جودة الترجمة.

media r/LocalLLaMA · منذ 5 يوم · 36 مشاهدة

إينكلوجن AI تطلق Realtime-Venus، نموذج تفاعل صوتي بصري بحجم 9B

أطلقت إينكلوجن AI نظام Realtime-Venus على منصة Hugging Face، والذي يتضمن نقطتي فحص: Realtime-Venus-Omni وRealtime-Venus-Audio. يُعد نقطة Omni نموذج تفاعل صوتي بصري بحجم 9B مُعدّل من MiniCPM-o 4.5، يراقب ويستمع باستمرار ليقرر متى يستجيب.

media MarkTechPost · منذ 5 يوم · 24 مشاهدة

أليبا Qwen تطلق Qwen3.8-Omni-Flash، نموذجًا متعدد الوسائط ذاتيًا مع سياق يصل إلى 1 مليون رمز

أطلقت فريق Qwen التابع لشركة أليبا الإصدار Qwen3.8-Omni-Flash، وهو أول نموذج متعدد الوسائط مصمم حول القدرات الذاتية للاستخدام في فهم الصوت والفيديو واستخدام الأدوات. يقبل النموذج مدخلات نصية وصورًا وصوتًا وفيديو لإرجاع مخرجات نصية، ويتميز بنافذة سياق تتسع لـ 1 مليون رمز ودعم استدعاء الوظائف بشكل أصلي.

lab Tencent Hunyuan (HF) · منذ 6 يوم · 64 مشاهدة

تيانتينغ تطلق WeVisDoc-4B، محلل مستندات من البداية للنهاية

أطلقت تيانتينغ WeVisDoc-4B، وهو محلل مستندات من البداية للنهاية لصور الصفحات يحول الصفحات إلى Markdown هيكلي مع صيغ LaTeX وجداول HTML. تم ضبطه بدقة من Qwen3-VL-4B-Instruct، حقق النموذج درجة إجمالية تبلغ 95.38 على OmniDocBench v1.6 ويتصدر المراكز بين محللات المستندات المقارنة في جميع الإعدادات الأربعة المذكورة.

media r/LocalLLaMA · منذ 10 يوم · 20 مشاهدة

InternLM تُطلق نموذج Intern-S2-397B متعدد الوسائط للذكاء العلمي

أعلنت InternLM عن إطلاق Intern-S2-397B، وهو نموذج أساسي متعدد الوسائط يحتوي على 397 مليار معلمة، صُمم خصيصاً للذكاء العلمي والوكلاء ذوي الأفق الزمني الطويل. يمتد نطاق النموذج عبر التدريب المسبق وتغطية مهام التعلم المعزز وبيئات الوكلاء التفاعلية لتعزيز قدرات الاستدلال العام والوكيل.

lab IBM Research (Granite) · منذ 13 يوم · 24 مشاهدة

IBM وNasa تطلقان نموذج القمر الأساسي NASA-IBM Lunar Foundation Model كمصدر مفتوح

أطلقت IBM وNasa نموذج القمر الأساسي NASA-IBM Lunar Foundation Model كمصدر مفتوح، وهو نظام ذكاء اصطناعي يدمج عقوداً من البيانات القمرية متعددة الوسائط من المهمات الأمريكية واليابانية في تمثيل واحد. بُني النموذج على بنية TerraMind الخاصة بشركة IBM، ودمج الملاحظات بمقاييس وزوايا رؤية مختلفة لمعالجة تحديات مثل الإضاءة المعقدة ودقة البيانات.

lab DeepSeek API Docs · منذ 13 يوم Codeforces (Elo) · 3471.0Elo · 51 مشاهدة

ديب سيك تطلق نموذج V4.1-Flash بدعم متعدد الوسائط الأصلي

أطلقت ديب سيك رسميًا نموذج DeepSeek-V4.1-Flash، والذي يعتبر أصغر عضو في عائلة المعماريات الجديدة ويتميز بالفهم البصري متعدد الوسائط الأصلي. تم تصميم هذه المعمارية الجديدة لتقديم سقف قدرة أعلى، وسرعات استنتاج أسرع، وإنتاجية أعلى، وإمكانية توسع أفضل للنماذج الأكبر.

media MarkTechPost · منذ 18 يوم · 33 مشاهدة

جوجل تطلق الفهم الواعي للفيديو لنماذج Gemini Flash

أطلقت جوجل الفهم الواعي للفيديو عبر نماذج Gemini Flash الخاصة بها، مستبدلةً طريقة المعالجة الثابتة السابقة بنظام يتنقل في خطوط الزمن الفيديوية عند الطلب. يتيح هذا التغيير للنموذج أن يقرر ما يشاهده، وبأي معدل إطارات، وعن طريق أي وسيط، بدلاً من استيعاب خط الزمن بأكمله بمعدل ثابت قدره إطار واحد في الثانية.

arxiv arXiv cs.CL · منذ 19 يوم · 36 مشاهدة

VisCAD تطلق مجموعة نماذج أساسية بذكاء هندسي صناعي متعدد الوسائط

يقدم الباحثون VisCAD، وهي مجموعة نماذج أساسية مصممة لتقديم تعميم واسع وقدرة قوية لتصميم المنتجات الصناعية الواقعية. تتناول المجموعة تحديات توليد الأجزاء من مدخلات متنوعة مثل الصور المولدة والنصوص، وكذلك التوليد على مستوى التجميع الذي يتضمن أجزاءً متفاعلة.

lab Hugging Face Blog · منذ 20 يوم · 34 مشاهدة

NeoMME تُطلق مشفرات متعددة الوسائط فعّالة مع استرجاع كثيف وتأخيري التفاعل

يقدم الباحثون NeoMME، وهو مجموعة من المشفرات متعددة الوسائط متعددة اللغات بحجم 260M و800M تعالج النص ومقاطع الصور الخام باستخدام محوّل ثنائي الاتجاه واحد. وعلى عكس نماذج اللغة البصرية التوليدية، لا يعتمد NeoMME على أبراج رؤية مُدرَّبة مسبقاً بشكل منفصل أو فكوك سببية، بل يتم تدريب النموذج بأكمله من الصفر باستخدام هدف الانتشار المنفصل المقنع.