الموضوع · Inference efficiency
lab Microsoft Research Blog · منذ 7 يوم · 28 مشاهدة

أبحاث مايكروسوفت تُظهر أن نقل استنتاج الذكاء الاصطناعي المادي يحسن أداء الروبوت وعمر البطارية

تتحدى أبحاث مايكروسوفت الافتراض القائل بأن استنتاج الذكاء الاصطناعي المادي يجب أن يعمل حصريًا على وحدات معالجة الرسومات (GPUs) المثبتة داخل الروبوت، وتُظهر أن نقله إلى البنية التحتية الطرفية أو السحابية يعزز بشكل كبير أعباء العمل الخاصة بالتلاعب المتنقل. تكشف دراستهم المنهجية لأعباء عمل الروبوتات أن الاعتماد على الحوسبة المدمجة يحد من الأداء وعمر البطارية والقابلية للتوسع.

lab OpenAI News · منذ 8 يوم · 24 مشاهدة

تقليل وقت البحث والتكلفة إلى النصف باستخدام GPT-6 Astra

قامت Parallel بدمج GPT-6 Astra من OpenAI في بنية وكلاء الذكاء الاصطناعي الخاصة بها، محققةً انخفاضاً بنسبة 50% في كل من وقت البحث وتكاليف البرمجيات مقارنة بالنماذج السابقة. تبلغ الشركة أن النموذج الجديد يسمح للوكلاء بإكمال أعمال المعرفة المعقدة بشكل أسرع بكثير مع الحفاظ على جودة عالية للإخراج.

lab NVIDIA Research · منذ 16 يوم · 20 مشاهدة

FastGen-PDD تقدم التلخيص بالتفريغ المتوازي لتوليد الفيديو والصور بسرعة

يقدم الباحثون التفريغ بالتفريغ المتوازي (PDD)، وهي طريقة مبسطة تعتمد على المسارات لتسريع الاستدلال في نماذج الانتشار ومطابقة التدفق. وعلى عكس الأساليب الحالية التي تعتمد على تفريغ الدرجات التبايني الصعب التحسين والخسائر التنافسية، يتنبأ PDD بعدة خطوات إزالة الضوضاء لكل تقييم للشبكة.

lab NVIDIA Research · منذ 19 يوم · 24 مشاهدة

Onyx يحقق تكلفة أقل بنسبة 1.7-9.9 مرة وزمن استجابة أقل بنسبة 2.3-12.3 مرة لبحث ANN غير المدرك للقرص

يقترح الباحثون Onyx، وهو نهج فعال من حيث التكلفة لبحث الجيران الأقربين التقريبي (ANN) غير المدرك للقرص، يوازن بين عرض النطاق وعدد الوصولات عن طريق عكس تصميم أنظمة ORAM-ANN الأكثر تقدمًا.

lab NVIDIA Research · منذ 19 يوم · 28 مشاهدة

إنفيديا تطلق GPIR للاسترجاع الخاص للمعلومات المسرّع بواسطة وحدة معالجة الرسومات

قدم باحثون من إنفيديا نظام GPIR، الذي يسرّع الاسترجاع الخاص للمعلومات (PIR) على وحدات معالجة الرسومات من خلال معالجة الحساب العالي على جانب الخادم وحركة مرور الذاكرة الكامنة في البروتوكولات القائمة على الشبكات. يستخدم النظام نموذج تنفيذ هجينًا يدرك المراحل، حيث يبدل ديناميكيًا بين kernels على مستوى العملية وعلى مستوى المرحلة لتعظيم إعادة استخدام البيانات داخل الشريحة.

lab NVIDIA Research · منذ 19 يوم · 26 مشاهدة

NVIDIA تميز أداء وتكلفة MPC و FHE لـ PPML

تقدم دراسة جديدة توصيفًا موحدًا على مستوى النظام للحوسبة الآمنة متعددة الأطراف (MPC) والتشفير المتجانس الكامل (FHE) لاستدلال تعلم الآلة الذي يحافظ على الخصوصية. تقيم العمل متغيرين لـ MPC — تحويل المشاركة الحسابية/الثنائية ومشاركة الدوال السرية — جنبًا إلى جنب مع FHE عبر نماذج CNN و Transformer متعددة.

lab OpenAI News · منذ 19 يوم · 37 مشاهدة

توسع OpenAI في خدمة تخزين Habitat لتصل إلى 70 مليون طلب في الثانية

قامت OpenAI بتوسيع منصتها الداخلية للتخزين عبر الإنترنت، المسماة Habitat، للتعامل مع أكثر من 70 مليون طلب في الثانية لأكثر من مليار مستخدم أسبوعيًا لـ ChatGPT عبر ما يقرب من 40 منطقة جغرافية. الآن يقدم النظام أكثر من 500 بيتابايت من البيانات، متطورًا من مكتبة بسيطة تعمل على جانب العميل إلى خدمة موزعة معقدة.

media AI News (smol.ai) · منذ 18 يوم · 51 مشاهدة

ديب سيك تطلق V4.1-Flash، نموذج ذو أوزان مفتوحة يركز على كفاءة الاستنتاج القصوى

أطلقت ديب سيك V4.1-Flash، وهو نموذج رائد جديد ذو أوزان مفتوحة مصمم لكفاءة استنتاج قصوى وتكلفة منخفضة. يستخدم النموذج بنية مشفر-مفكك سببية لتقليل الحساب النشط وتكاليف KV/الذاكرة المؤقتة بشكل كبير.

media MarkTechPost · منذ 20 يوم · 55 مشاهدة

ديب سيك تطلق DeepSeek-V4.1-Flash بسياق من 1 مليون وتخزين مؤقت KV بدقة FP4

أعلنت ديب سيك أيه آي عن إطلاق DeepSeek-V4.1-Flash، وهو نموذج مختلط الخبراء متعدد الوسائط يتميز بنافذة سياق تتكون من مليون رمز وتخزين مؤقت KV بدقة FP4 يقلل من حجم التخزين المؤكي العالمي إلى 890 بايت لكل رمز. يعتمد النموذج على بنية مشفر-مفكك سببية وCompressed Sparse Attention 2 (CSA2) لخفض متطلبات الذاكرة بشكل كبير مع الحفاظ على الأداء.

media Hugging Face Forums · الآن · مشاهدة واحدة مباشر

ThermaCompute AI تطلق CrashLens لتصنيف سجلات تعطل GPU المحلية

أطلقت ThermaCompute AI أداة CrashLens، وهي أداة مجانية ومحلية مصممة لمساعدة المهندسين على التحقيق في تعطل وحدات معالجة الرسومات من خلال تحليل ملفات السجلات. تحدد الأداة أنماط الفشل المعروفة داخل السجلات وتقترح خطوات محددة للتحقيق.

github llama.cpp · منذ 9 ساعة · مشاهدة واحدة

يحدد llama.cpp b11282 CUDA_ARCH لمرور جهاز MUSA

أصدر مشروع llama.cpp الإصدار b11282، الذي يتضمن إصلاحًا لتعريف ماكرو `CUDA_ARCH` لمرور جهاز MUSA. سابقًا، لم يحدد رأس مورد MUSA هذه المتغير، مما تسبب في تقييم اختبارات الهندسة المعمارية في مصادر ggml-cuda المشتركة إلى صفر ونتج عن ذلك أجسام نواة فارغة.