الموضوع · Multimodal
lab DeepSeek API Docs · منذ 21 يوم Codeforces (Elo) · 3471.0Elo · 67 مشاهدة

ديب سيك تطلق نموذج V4.1-Flash بدعم متعدد الوسائط الأصلي

أطلقت ديب سيك رسميًا نموذج DeepSeek-V4.1-Flash، والذي يعتبر أصغر عضو في عائلة المعماريات الجديدة ويتميز بالفهم البصري متعدد الوسائط الأصلي. تم تصميم هذه المعمارية الجديدة لتقديم سقف قدرة أعلى، وسرعات استنتاج أسرع، وإنتاجية أعلى، وإمكانية توسع أفضل للنماذج الأكبر.

lab Microsoft Research Blog · منذ 23 ساعة · 3 مشاهدات

أبحاث مايكروسوفت تقدم Quine، نظام ذكاء اصطناعي لأبحاث الأحياء متعددة الوسائط

أعلنت أبحاث مايكروسوفت عن إطلاق Quine، وهو جهد بحثي جديد مصمم لإنشاء نموذج عالمي متعدد الوسائط للأحياء وأداة تفاعلية تربط بين النماذج والأدوات العلمية والأدبيات البحثية والباحثين. يهدف النظام إلى سد الفجوة بين النمذجة الحاسوبية والتجارب الواقعية من خلال تمكين العلماء من توليد مقترحات تُختبر في بيئات المختبرات الرطبة، مع تغذية النتائج مرة أخرى لتحسين الأسئلة المستقبلية.

media MarkTechPost · منذ 12 يوم · 35 مشاهدة

أليبا Qwen تطلق Qwen3.8-Omni-Flash، نموذجًا متعدد الوسائط ذاتيًا مع سياق يصل إلى 1 مليون رمز

أطلقت فريق Qwen التابع لشركة أليبا الإصدار Qwen3.8-Omni-Flash، وهو أول نموذج متعدد الوسائط مصمم حول القدرات الذاتية للاستخدام في فهم الصوت والفيديو واستخدام الأدوات. يقبل النموذج مدخلات نصية وصورًا وصوتًا وفيديو لإرجاع مخرجات نصية، ويتميز بنافذة سياق تتسع لـ 1 مليون رمز ودعم استدعاء الوظائف بشكل أصلي.

github llama.cpp · منذ 2 يوم · 3 مشاهدات

يضيف llama.cpp b11240 دعم الإدخال متعدد الوسائط المtyped إلى /v1/embeddings

يدعم خادم llama.cpp الآن إدخال محتوى مtyped (رؤية، صوت، فيديو) لنقطة النهاية /v1/embeddings. يتيح هذا التحديث طلبات تضمين متعددة الوسائط عن طريق قبول مصفوفات المحتوى المغلفة على طراز OpenAI، مما يسمح بمعالجة أجزاء النص وimage_url معًا.

media MarkTechPost · منذ 5 يوم · 15 مشاهدة

Liquid AI تطلق LFM2.5-VL-3B-DSpark كمسوّق تخميني لتسريع فك التشفير بنسبة تصل إلى 3.13x

أطلقت Liquid AI نموذج LFM2.5-VL-3B-DSpark، وهو نموذج مسوّق تجريبي لفك التشفير التخميني الخاص بنموذجها اللغوي-البصري LFM2.5-VL-3B. يضيف المسوّق حوالي 280 مليون معامل ويسرّع توليد الرموز دون تغيير توزيع مخرجات النموذج.

lab Hugging Face Blog · منذ 6 يوم · 13 مشاهدة

Liquid AI تطلق LFM2.5-VL-DSpark لتسريع استنتاج نماذج الرؤية واللغة

أطلقت Liquid AI نموذج LFM2.5-VL-DSpark المسود، وهو مُعدّ للفك التأملي مصمم لتسريع الاستدلال لنموذج الرؤية واللغة LFM2.5-VL-3B. يلتقط المُعدّ الحالات المخفية من الطبقات الثابتة للنموذج المستهدف لتوليد رموز مرشحة، مضيفاً فقط 280M معامل (فائض بنسبة 8.9%) مع الحفاظ على أبعاد متطابقة عبر الوسائط.

media r/LocalLLaMA · منذ 7 يوم · 43 مشاهدة

أبل تطلق LensVLM-9B، وهو نموذج VLM يوسع بشكل انتقائي صور النص المضغوطة

أطلقت أبل LensVLM-9B، وهو نموذج لغة مرئي يحتوي على 9 مليارات معلمة مصمم لمعالجة صور النص المضغوطة بكفاءة أكبر. يقوم النموذج بمسح هذه المدخلات المضغوطة ويستخدم أدوات تم تعلمها لتوسيع الصفحات ذات الصلة فقط بشكل انتقائي إلى شكلها غير المضغوط.

arxiv arXiv cs.CL · منذ 8 يوم · 19 مشاهدة

Qwen تطلق Qwen3.8-Omni-Flash، نموذجًا متعدد الوسائط أصليًا مع سياق مكون من مليون رمز

أعلنت Alibaba Cloud عن إطلاق Qwen3.8-Omni-Flash، وهو نموذج متعدد الوسائط أصليًا مصمم لمهام الإنتاجية في العالم الحقيقي، والذي يحسّن بشكل كبير الفهم والاستدلال متعدد الوسائط مقارنة بالنماذج السابقة.

media MarkTechPost · منذ 10 يوم · 28 مشاهدة

فريق علي بابا كوين يُصدر Qwen3.8-LiveTranslate ببنية Interleave

أطلق فريق علي بابا كوين نموذج Qwen3.8-LiveTranslate، وهو نموذج ترجمة متزامنة فورية من الجيل التالي يستمع إلى الكلام الحي ويعيد النص المترجم والصوت أثناء استمرار المتحدث في الحديث. يُقدّم هذا الإصدار بنية Interleave جديدة مصممة لتقليل زمن الانتظار وتحسين جودة الترجمة.

media r/LocalLLaMA · منذ 12 يوم · 55 مشاهدة

إينكلوجن AI تطلق Realtime-Venus، نموذج تفاعل صوتي بصري بحجم 9B

أطلقت إينكلوجن AI نظام Realtime-Venus على منصة Hugging Face، والذي يتضمن نقطتي فحص: Realtime-Venus-Omni وRealtime-Venus-Audio. يُعد نقطة Omni نموذج تفاعل صوتي بصري بحجم 9B مُعدّل من MiniCPM-o 4.5، يراقب ويستمع باستمرار ليقرر متى يستجيب.

lab Tencent Hunyuan (HF) · منذ 13 يوم · 78 مشاهدة

تيانتينغ تطلق WeVisDoc-4B، محلل مستندات من البداية للنهاية

أطلقت تيانتينغ WeVisDoc-4B، وهو محلل مستندات من البداية للنهاية لصور الصفحات يحول الصفحات إلى Markdown هيكلي مع صيغ LaTeX وجداول HTML. تم ضبطه بدقة من Qwen3-VL-4B-Instruct، حقق النموذج درجة إجمالية تبلغ 95.38 على OmniDocBench v1.6 ويتصدر المراكز بين محللات المستندات المقارنة في جميع الإعدادات الأربعة المذكورة.

media r/LocalLLaMA · منذ 17 يوم · 25 مشاهدة

InternLM تُطلق نموذج Intern-S2-397B متعدد الوسائط للذكاء العلمي

أعلنت InternLM عن إطلاق Intern-S2-397B، وهو نموذج أساسي متعدد الوسائط يحتوي على 397 مليار معلمة، صُمم خصيصاً للذكاء العلمي والوكلاء ذوي الأفق الزمني الطويل. يمتد نطاق النموذج عبر التدريب المسبق وتغطية مهام التعلم المعزز وبيئات الوكلاء التفاعلية لتعزيز قدرات الاستدلال العام والوكيل.

lab IBM Research (Granite) · منذ 20 يوم · 25 مشاهدة

IBM وNasa تطلقان نموذج القمر الأساسي NASA-IBM Lunar Foundation Model كمصدر مفتوح

أطلقت IBM وNasa نموذج القمر الأساسي NASA-IBM Lunar Foundation Model كمصدر مفتوح، وهو نظام ذكاء اصطناعي يدمج عقوداً من البيانات القمرية متعددة الوسائط من المهمات الأمريكية واليابانية في تمثيل واحد. بُني النموذج على بنية TerraMind الخاصة بشركة IBM، ودمج الملاحظات بمقاييس وزوايا رؤية مختلفة لمعالجة تحديات مثل الإضاءة المعقدة ودقة البيانات.