المختبر · NVIDIA
lab NVIDIA Research · منذ 4 ساعة · مشاهدة واحدة

يستخدم HorizonRelight التكييف الذاتي المقنع لإعادة الإضاءة المتسقة للفيديو طويل المدى

يتناول الباحثون الانقطاعات الزمنية في إعادة إضاءة الفيديو طويل المدى عن طريق إعادة صياغة المهمة على أنها ترجمة مجال كامن مشروط زمنيًا. يفرض الإطار استمرارية عبر القطع عن طريق نشر كميات المجال المستهدف عبر الحدود ويستخدم التكييف الذاتي المقنع للمجال المستهدف لجعل هذا السلوك قابلاً للتعلم.

lab NVIDIA Research · منذ 4 ساعة · مشاهدتان

إنفيديا تقدم FusionRelight لإعادة إضاءة البورتريه في الوقت الفعلي عبر دمج المعرفة الهجينة للمجال

قدم باحثو إنفيديا FusionRelight، وهي طريقة لإعادة إضاءة البورتريه تجمع بين نقل الإضاءة المادي المعقول والحفاظ على الهوية والاستدلال في الوقت الفعلي المضغوط. تستخدم هذه الطريقة دمج المعرفة الهجينة للمجال (HDKF)، وهو إطار تدريبي يستخلص مسبقاً من الفيزياء والانعكاسية والواقعية من البيانات الاصطناعية، وواحدة-ضوء-في-الوقت (OLAT)، والبيانات في البرية، لنموذج طالب.

lab NVIDIA Research · منذ 3 يوم · 10 مشاهدات

إنفيديا تطلق نموذج العالم التوليدي في الوقت الفعلي OmniDreams لمحاكاة المركبات ذاتية القيادة

أعلنت إنفيديا عن إطلاق OmniDreams، وهو نموذج عالمي توليدي أساسي صُمم لمعالجة الاختناقات في تقييم سياسات القيادة الذاتية ضمن المحاكاة الحلقية المغلقة. تم تدريبه في مرحلتي ما قبل وبعد التدريب باستخدام نموذج Cosmos الانتشاري على 21k ساعة من سيناريوهات القيادة، حيث يولد مقاطع فيديو مشروطة بالإجراءات بشكل تسلسلي ذاتي وفي الوقت الفعلي.

lab NVIDIA Research · منذ 18 يوم · 9 مشاهدات

إنفيديا تطرح Spatial-IQ، إطار تشخيصي هرمي للاستدلال المكاني في النماذج متعددة الوسائط

أطلق باحثو إنفيديا إطار Spatial-IQ التشخيصي المصمم لتحليل الذكاء المكاني للنماذج اللغوية الكبيرة متعددة الوسائط (MLLMs). وعلى عكس المقاييس الحالية التي تعامل النماذج كصناديق سوداء، يقوم هذا النهج بتحليل عدّ الأجسام في الهياكل ثلاثية الأبعاد المتراكمة إلى تسعة مهام فرعية إدراكية ومعرفية متوافقة مع مراحل النمو البشري.

lab NVIDIA Research · منذ 18 يوم · 13 مشاهدة

تكميم دفتر أكوام متجمع لضغط الصور القائم على غاوس ثنائي الأبعاد

يقدم الباحثون تكميم المتجه الموجه بالعناقيد (CGVQ)، وهي طريقة مصممة لتحسين أداء معدل التشويه في ضغط الصور القائم على البدع الغاوسية. يقسم النهج معاملات غاوس إلى مجموعات متجانسة قبل التكميم، مما يعالج عدم الكفاءة الناتجة عن تخزين أعداد كبيرة من معاملات النقطة العائمة لكل بدعة.

lab NVIDIA Research · منذ 18 يوم · 7 مشاهدات

تحليل الذكاء الاصطناعي متعدد الوسائط للتواصل غير اللفظي في دلتا فورس

يقوم الباحثون بتحليل مقاطع فيديو اللعب من لعبة التصويب التنافسية دلتا فورس لاستخراج وفهم التواصل غير اللفظي الناشئ، مثل الإيماءات وأنماط الحركة. يتناول هذا العمل فجوة في الدراسات السابقة التي ركزت بشكل كبير على ألعاب MOBA أو التنسيق اللفظي في ألعاب التصويب الأخرى.

lab NVIDIA Research · منذ 18 يوم · مشاهدة واحدة

باحثو إنفيديا يقترحون تجارب ميدانية في بطولات روكيت ليغ

يعالج باحثو إنفيديا صعوبة جدولة اللعب الجماعي التنافسي وإعادة إنشاء بيئات المختبر من خلال اعتماد منهجية التجارب الميدانية. يدمج هذا النهج التجارب مباشرةً في هياكل البطولات، مما يخلق بطولات-تجارب هجينة.

lab NVIDIA Research · منذ 21 يوم · مشاهدة واحدة

إطار عمل AITE يكتشف خوارزميات لاسلكية بشكل مستقل عبر بحث مدفوع بـ LLM

يقدم الباحثون The AI Telco Engineer (AITE)، وهو إطار عمل يستخدم البحث التطوري المدعوم بنماذج لغوية كبيرة لتصميم الخوارزميات بشكل مستقل لمشاكل الاتصالات المعقدة مع التنقل بين مقايضات الأداء والتعقيد.

media TLDR AI · منذ 18 يوم · 5 مشاهدات

أنثروبيك تطلق كلود أوبوس 5؛ إنفيديا تدعو إلى سياسات الأوزان المفتوحة

أعلنت أنثروبيك عن إطلاق كلود أوبوس 5 كنموذج أكثر كفاءة يقترب من قدرات كلود فابل 5 بنصف السعر، ليصبح الخيار الافتراضي لكلود ماكس. وفي الوقت نفسه، تدعو إنفيديا الحكومة الأمريكية إلى تبني سياسات تدعم نماذج الذكاء الاصطناعي ذات الأوزان المفتوحة لتعزيز الابتكار وتعزيز القيادة الأمريكية في هذا القطاع.

lab Hugging Face Blog · منذ 25 يوم · مشاهدة واحدة

إنفيديا تطلق Cosmos 3 Edge، نموذجًا بـ4 مليارات معلمة للتحكم في الروبوتات في الوقت الفعلي على الأجهزة الطرفية

أطلقت إنفيديا Cosmos 3 Edge، وهو نموذج عالم مفتوح بـ4 مليارات معلمة مصمم لتقديم أداء بمستوى مراكز البيانات على الأنظمة الطرفية ذات الذاكرة المحدودة. يمكّن النموذج الروبوتات ووكلاء الذكاء الاصطناعي للرؤية من فهم محيطهم، والاستدلال في الوقت الفعلي، وتوليد الإجراءات مباشرةً على أجهزة مثل وحدات NVIDIA Jetson.

lab Hugging Face Blog · منذ 29 يوم · 8 مشاهدات

إنفيديا تطلق نماذج Nemotron 3 Embed التي تحتل المرتبة الأولى على RTEB

أطلقت إنفيديا (NVIDIA) مجموعة Nemotron 3 Embed، وهي مجموعة من نماذج التضمين المفتوحة والمتاحة تجارياً والمصممة لتحسين جودة الاسترجاع لتطبيقات RAG على نطاق الإنتاج، والاسترجاع الوكيل، واسترجاع الأكواد، وذاكرة الوكلاء. تتضمن المجموعة نموذجاً بحجم 8B يحتل المرتبة الأولى بشكل عام على لوحة المتصدرين في RTEB، جنباً إلى جنب مع متغيرات 1B الفعالة والمُحسّنة للنشر.

media MarkTechPost · منذ 3 يوم · مشاهدة واحدة

إنفيديا تطلق نموذج Nemotron 3.5 Lightning وموجّه NeMo Switchyard

أطلقت إنفيديا أثاثين مفتوحَي المصدر مصمَّمين لبناء وكلاء ذكاء اصطناعي يعملون باستمرار: نموذج Nemotron 3.5 Lightning ومكتبة التوجيه NeMo Switchyard. تتناول هذه الأدوات التكلفة العالية وزمن الاستجابة في إرسال كل خطوة من سير عمل الوكلاء طويلي التشغيل إلى نماذج الاستدلال المتقدمة، من خلال توفير قدرات تنفيذ وتوجيه متخصصة.

lab Hugging Face Blog · منذ 4 يوم · 8 مشاهدات

إضافة Magpie TTS من NVIDIA للعربية والكورية والبرتغالية وتحسين الجودة

أطلقت NVIDIA تحديثًا لنموذجها متعدد اللغات Magpie Multilingual TTS، حيث توسع الدعم ليشمل اثني عشر لغة بإضافة العربية الفصحى الحديثة والكورية والبرتغالية البرازيلية. يتضمن التحديث أيضًا تحسينات في الجودة عبر اللغات الحالية من خلال بيانات تدريب محدثة وتغييرات معمارية.

lab NVIDIA Technical Blog · منذ 4 يوم · 8 مشاهدات

Meta تطلق Muse Glimmer، نموذج بوزن مفتوح بحجم 30B للذكاء الاصطناعي الوكيل المحلي

أطلقت Meta نموذج Muse Glimmer، وهو نموذج كثيف يحتوي على 30 مليار معامل مع نافذة سياق تزيد عن 120 ألف رمز مصمم لأعمال الذكاء الاصطناعي الوكيل المحلي. تم تحسينه للعمل عبر منصات NVIDIA الطرفية وأجهزة سطح المكتب ومحطات العمل، ويوفر النموذج سرعة معالجة تبلغ 20 ألف رمز/ثانية على بطاقة GPU واحدة.

media MarkTechPost · منذ 5 يوم · 13 مشاهدة

إطلاق NVIDIA لـ NemotronLabs VoiceChat 11B، نموذج مفتوح المصدر للتحويل من الكلام إلى كلام بكامل الاتجاه مع تبديل أدوار يستغرق حوالي 450 مللي ثانية

أطلقت NVIDIA نموذج NemotronLabs VoiceChat 11B، وهو نموذج مفتوح المصدر يتكون من 11 مليار معامل لتحويل الكلام إلى كلام بشكل متكامل، ومصمم للمحادثات في الوقت الفعلي وبكامل الاتجاه. وعلى عكس السلاسل المتسلسلة التي تربط بين نماذج التعرف على الكلام (ASR)، والنماذج اللغوية الكبيرة (LLM)، وتوليف الكلام (TTS)، يقوم هذا الشبكة الموحدة بفهم الكلام وتوليده بشكل متدفق في آن واحد، محققةً زمن تبديل أدوار سلساً مقاساً يبلغ 448 مللي ثانية على معيار Full-Duplex-Bench 1.0.

media MarkTechPost · منذ 7 يوم · 4 مشاهدات

إطلاق NVIDIA لـ NOOA، إطار عمل كائني التوجه بلغة بايثون لبناء وكلاء الذكاء الاصطناعي

أطلقت مختبرات NVIDIA مشروع NOOA (وكلاء NVIDIA الكائنيي التوجه) كمصدر مفتوح، وهو إطار عمل بلغة بايثون لا يعتمد على نموذج معين، يجمع تطوير الوكلاء في فئة بايثون واحدة. يحل هذا النهج محل سير العمل المجزأ الذي يتضمن قوالب المطالبات ورسوم بيانية للعملية من خلال ربط الأساليب بالأفعال، والحقول بالحالة، وتعليقات التوثيق بالمطالبات، والتعليقات النوعية بالعقود المفروضة.