الموضوع · Multimodal
lab Google DeepMind Blog · منذ 3 يوم · 13 مشاهدة

جوجل ديب مايند تطلق نموذج SL2T لتحويل لغة الإشارة إلى نص لـ Gboard وLive Transcribe

أعلنت جوجل ديب مايند وأندرويد عن إطلاق SL2T، وهو نموذج ترجمة ضخم متعدد اللغات من لغة الإشارة إلى النص (SL2T)، يُدخل ذكاء اصطناعي خاصًا بلغة الإشارة إلى المنتجات الاستهلاكية لأول مرة. تعمل هذه التقنية على إملاء تحويل الإشارات إلى نص في Gboard وLive Transcribe على أجهزة Pixel 11، بدءًا من لغة الإشارة الأمريكية (ASL) إلى الإنجليزية.

lab Google — The Keyword (AI) · منذ 3 يوم · 40 مشاهدة

جوجل تُظهر قدرات الاستشارة السريرية بالفيديو في الوقت الفعلي باستخدام AMIE

قدمت Google Research وGoogle DeepMind تقدمًا في نظام الذكاء الاصطناعي الطبي الخاص بها للبحث، AMIE، لإظهار قدرات الاستشارة السريرية بالفيديو في الوقت الفعلي في دراسة من نوعها لأول مرة. تم بناء النظام على Gemini وProject Astra باستخدام بنية متعددة الوكلاء، حيث يفسر الإشارات البصرية والسمعية، ويوجه الفحوصات الجسدية الافتراضية، ويقوم بالاستدلال التشخيصي في الوقت الفعلي.

lab Microsoft Research Blog · منذ 2 يوم · 24 مشاهدة

أبحاث مايكروسوفت تقدم معيار MindTopo لتقييم الاستدلال المكاني لنماذج VLMs

أطلقت أبحاث مايكروسوفت معيار MindTopo، وهو معيار جديد صُمّم لتقييم ما إذا كانت النماذج اللغوية الكبيرة متعددة الوسائط تمتلك حدساً طوبولوجياً فيما يتعلق بالاتصال، والإحاطة، والترتيب، والفصل، والعقد.

lab Microsoft Research Blog · منذ 3 يوم · 11 مشاهدة

أبحاث مايكروسوفت تقدم CARE-X، نموذج رؤية ولغة موحد لأشعة الصدر مع إشراف مساعد وقياس مدعوم بالأدوات

قدمت أبحاث مايكروسوفت CARE-X، وهو نموذج بحثي مصمم لسد الفجوات في نماذج الرؤية واللغة الحالية في مجال الأشعة من خلال الجمع بين كتابة التقارير التوليدية والتنبؤات التشخيصية المعايرة. يستخدم النظام التعلم التعزيزي (DAPO) لمكافأة الدقة السريرية، ويقوم بربط نموذج Qwen3-VL-4B-Instruct بأدوات قياس حتمية لتقييم الأداء على الحالات التي تتطلب حسابات دقيقة.

lab NVIDIA Research · منذ 4 يوم · 3 مشاهدات

يقوم GenRecal بتقطير نماذج الرؤية واللغة الكبيرة إلى صغيرة عبر إعادة معايرة

يقدم الباحثون GenRecal، وهو إطار عمل لتقطير الأغراض العامة ينقل المعرفة من نماذج الرؤية واللغة الكبيرة (VLM) إلى نظائرها الأصغر والأكثر كفاءة. تتناول الطريقة تحدي معماريات VLM غير المتجانسة باستخدام مُعيد معايرة لمحاذاة وتكييف تمثيلات الميزات عبر أنواع النماذج المختلفة.

lab NVIDIA Research · منذ 4 يوم

Hide to See تقدم قناع بادئة الاستدلال لتقطير VLM

يقترح الباحثون إطار عمل جديد لتقطير التفكير-الإجابة يحسن قدرة النماذج اللغوية البصرية المدمجة على استخدام الأدلة المرئية من خلال قناع بادئات الاستدلال البارزة. يعالج هذا النهج مشكلة "النسيان البصري" الشائعة في مسارات التفكير-الإجابة الطويلة، حيث يفقد الطلاب التركيز على الإشارات المرئية أثناء الاستدلال المطول.

lab NVIDIA Research · منذ 18 يوم · 9 مشاهدات

إنفيديا تطرح Spatial-IQ، إطار تشخيصي هرمي للاستدلال المكاني في النماذج متعددة الوسائط

أطلق باحثو إنفيديا إطار Spatial-IQ التشخيصي المصمم لتحليل الذكاء المكاني للنماذج اللغوية الكبيرة متعددة الوسائط (MLLMs). وعلى عكس المقاييس الحالية التي تعامل النماذج كصناديق سوداء، يقوم هذا النهج بتحليل عدّ الأجسام في الهياكل ثلاثية الأبعاد المتراكمة إلى تسعة مهام فرعية إدراكية ومعرفية متوافقة مع مراحل النمو البشري.

lab NVIDIA Research · منذ 18 يوم · 8 مشاهدات

تحليل الذكاء الاصطناعي متعدد الوسائط للتواصل غير اللفظي في دلتا فورس

يقوم الباحثون بتحليل مقاطع فيديو اللعب من لعبة التصويب التنافسية دلتا فورس لاستخراج وفهم التواصل غير اللفظي الناشئ، مثل الإيماءات وأنماط الحركة. يتناول هذا العمل فجوة في الدراسات السابقة التي ركزت بشكل كبير على ألعاب MOBA أو التنسيق اللفظي في ألعاب التصويب الأخرى.

lab Google — The Keyword (AI) · منذ 24 يوم · مشاهدة واحدة

جوجل توسع مهام أتمتة ذكاء جيمينى وتقدم تطبيق Notebook إلى أجهزة Galaxy

في حدث Galaxy Unpacked 2026، أعلنت جوجل عن ثلاث تحديثات لهواتف Samsung Galaxy Z Fold8 Ultra وFold8 وFlip8 الجديدة، والتي تركز على إطلاق Gemini Intelligence. تقوم الشركة بتوسيع قدراتها في أتمتة المهام لدعم أكثر من 40 تطبيقًا شائعًا، وتقدم تطبيق Gemini Notebook مباشرة إلى هذه الأجهزة.

lab Hugging Face Blog · منذ 5 يوم · 3 مشاهدات

ميتا تطلق النموذج متعدد الوسائط مفتوح المصدر Muse Glimmer 30B

أطلقت ميتا نموذج Muse Glimmer، وهو نموذج متعدد الوسائط كثيف يحتوي على 30 مليار معلمة، متاحًا كمصدر مفتوح على Hugging Face Hub. يتكون الهيكل من فك تشفير نصي بحجم 28 مليار ومعرف إدراك (Perception Encoder) على طراز ViT بحجم 2 مليار لمهام الرؤية.

lab Mistral AI News · منذ 11 يوم · 4 مشاهدات

Shieldstral يُطلق مصنف أمان متعدد الوسائط بحجم 3 مليار معلمة يتكيف مع السياسات

يُعد Shieldstral مصنف أمان متعدد الوسائط مفتوح الأوزان بحجم 3 مليار معلمة، يصوّر وسيط المحتوى كمهمة إجابة على أسئلة تتكيف مع السياسات، مما يتيح له قبول سياسات بلغة طبيعية أثناء الاستدلال دون الحاجة إلى إعادة التدريب. يُوحد تقييم أمان النصوص والصور ويقدّم درجات أمان معايرة عبر معايير متنوعة بينما يعمل بكفاءة على بطاقة NVIDIA GPU واحدة بسعة 16GB.

media MarkTechPost · منذ 26 يوم · 7 مشاهدات

أليباবা تستعرض Qwen3.8-Max، نموذج متعدد الوسائط يحتوي على 2.4 تريليون معلمة

في 19 يوليو، استعرض فريق Qwen التابع لأليباबा النسخة الأولية من Qwen3.8-Max-Preview، وهو نموذج جديد رائد متعدد الوسائط يحتوي على 2.4 تريليون معلمة. أُعلن عن ذلك خلال مؤتمر الذكاء الاصطناعي العالمي في شنغهاي، وذلك بعد يومين من إطلاق Moonshot AI لنموذج Kimi K3.

arxiv arXiv cs.LG · منذ 22 ساعة · 3 مشاهدات

Intern-S2-Preview: نموذج أساسي علمي ذو وكيل

يقدم المؤلفون Intern-S2-Preview، وهو سلسلة من النماذج الأساسية العلمية ذات الوكلاء مصممة لدعم الفهم متعدد الوسائط العلمي، والاستدلال، والتوليد، والمهام طويلة المدى. تبدأ خط أنابيب التدريب بالتدريب المسبق متعدد الوسائط العلمي على المستندات العلمية المُصاغة، والبيانات المتداخلة للصور والنصوص، ومجموعات البيانات العلمية المتنوعة.

media MarkTechPost · منذ 1 يوم IFEval · 82.3% · مشاهدة واحدة

Liquid AI تطلق LFM2.5-VL-3B، نموذج رؤية ولغة بحجم 3 مليار معامِل يعمل على الجهاز مع استدعاء الأدوات

أطلقت Liquid AI نموذج LFM2.5-VL-3B، وهو نموذج رؤية ولغة يحتوي على 3.1 مليار معامِل صُمّم لنشره بكفاءة على الأجهزة الطرفية. يقرأ النموذج الشاشات الرقمية عبر بيئات الهاتف المحمول والويب وسطح المكتب، ويربط الكائنات بإحداثياتها، ويحلل المستندات، وينفذ استدعاءات الأدوات من مدخلات نصية أو صور.

arxiv arXiv cs.AI · منذ 2 يوم · 3 مشاهدات

تحسّن SCOUT الاستدلال المكاني في نماذج اللغة والرؤية عبر التفكير المتسلسل المهيكل والتعلم التعزيزي المشرف على العملية

يقترح الباحثون إطار عمل SCOUT الذي يعزز الاستدلال المكاني لنماذج اللغة والرؤية من خلال دمج التفكير المتسلسل المهيكل مع التعلم التعزيزي متعدد الأهداف والمشرف على العملية. يتناول هذا النهج مشكلات تعيين الائتمان في طرق التعلم التعزيزي الحالية ودمك إدراك العمق لفهم شامل للبيئة ثلاثية الأبعاد.

lab Hugging Face Blog · منذ 3 يوم · 14 مشاهدة

Liquid AI تطلق LFM2.5-VL-3B لقدرات رؤية على الحافة أسرع

أطلقت Liquid AI نموذج LFM2.5-VL-3B، وهو نموذج لغوي-رؤية يحتوي على 3 مليارات معلمة، صُمم لتقديم أداء محسّن وأسرع على أجهزة الحافة. يجمع النموذج بين مشفر رؤية SigLIP2 400M NaFlex مع العمود الفقري لنسخته النصية فقط، وتم تدريبه على حوالي 34 تريليون رمز، بما في ذلك أربعة أضعاف بيانات الرؤية مقارنة بالإصدارات السابقة.

lab Liquid AI · منذ 3 يوم Berkeley Function-Calling Leaderboard · 32.5% · 15 مشاهدة

LFM2.5-VL-3B يحسّن فهم الشاشة واستدعاء الوظائف للنشر على الحافة

يُعد LFM2.5-VL-3B نموذجًا جديدًا للغة والرؤية يقدم أداءً تنافسيًا أمام النماذج الأكبر مع الحفاظ على زمن استجابة منخفض لتطبيقات الوقت الحقيقي والأجهزة الطرفية. وهو يعتمد على الإصدار السابق LFM2-VL-3B مع تحسينات كبيرة في فهم الشاشة، والتأريض، واستدعاء الوظائف، وقدرات الإدخال متعدد الصور.

arxiv arXiv cs.AI · منذ 4 يوم

AMIE (Video) يحقق أداءً على مستوى الخبراء في الاستشارات الطبية في الوقت الفعلي

أظهر الباحثون أول نظام ذكاء اصطناعي على مستوى الخبراء للاستشارات السريرية بالفيديو في الوقت الفعلي باستخدام AMIE (Video)، وهو نظام متعدد الوكلاء يعتمد على Gemini يدمج الحوار منخفض التأخير مع الإدراك السمعي البصري في الوقت الفعلي. في دراسة فحص سريري موضوعي عشوائية شملت 30 طبيب رعاية أولية و100 سيناريو، قيّم المقيّمون السريريون النظام بأنه يعادل أو يتفوق على الأطباء في أخذ التاريخ المرضي، والتشخيص، والإدارة، والملاحظة الجسدية.

arxiv arXiv cs.CL · منذ 4 يوم

AMIE (Video) يحقق أداءً على مستوى الخبراء في الاستشارات الطبية في الوقت الفعلي

أظهر الباحثون أول نظام ذكاء اصطناعي على مستوى الخبراء للاستشارات السريرية عبر الفيديو في الوقت الفعلي باستخدام AMIE (Video)، وهو نظام متعدد الوكلاء يعتمد على Gemini يدمج الحوار منخفض التأخير مع الإدراك السمعي البصري في الوقت الفعلي.