Hardware & chips
media r/LocalLLaMA · منذ 1 يوم · 11 مشاهدة

أليبا تخطط لنموذج ذكاء اصطناعي يحتوي على 5 إلى 10 تريليون معلمة وتكشف عن شريحة جديدة

أعلنت أليبا عن خطط لتطوير نموذج ذكاء اصطناعي يحتوي على ما بين 5 إلى 10 تريليون معلمة. وإلى جانب هذا المسار، كشفت الشركة أيضًا عن شريحة مخصصة جديدة مصممة لدعم احتياجات البنية التحتية.

media r/LocalLLaMA · منذ 2 يوم · 11 مشاهدة

هواوي تعلق طرح شرائح الذكاء الاصطناعي عالمياً بينما يتجاوز الطلب المحلي في الصين العرض

أوقفت هواوي توسعها الدولي في شرائح الذكاء الاصطناعي لأن الطلب المحلي داخل الصين يتجاوز المعروض المتاح. يعني هذا التحول الاستراتيجي أن المنافسين AMD وNvidia لم يعودا يواجهان ضغطاً فورياً من دخول هواوي إلى السوق العالمية.

github llama.cpp · منذ 3 يوم · 20 مشاهدة

إضافة llama.cpp b11059 دعم F16 لنواة FWHT الخاصة بـ Metal

أصدر مشروع llama.cpp الإصدار b11059، الذي يقدم تحديثات كبيرة للخلفية Metal لأجهزة Apple Silicon. يتمثل التغيير الرئيسي في إضافة دعم الإدخال F16 لنواة التحويل السريع لوالش-هادامارد (FWHT)، مما يتيح لها قراءة مصادر F16 مباشرة دون الحاجة إلى نسخة محولة.

github llama.cpp · منذ 5 يوم · 21 مشاهدة

يرفع llama.cpp حد خبراء mul_mat_id الخاص بـ Vulkan إلى 1024

زاد مشروع llama.cpp الحد المرفوع لـ row-id لعملية Vulkan mul_mat_id من 256 إلى 1024 خبيرًا. يعالج هذا التغيير اختناقات الأداء في النماذج ذات أعداد الخبراء الكبيرة، مثل Qwen3.8-Flash-Next، الذي كان يعمل سابقًا على مسار كود أبطأ بسبب قيود حجم المصفوفة المشتركة.

github llama.cpp · منذ 7 يوم · 20 مشاهدة

يصلح llama.cpp b10994 خطأ NaN في Metal ضمن mul_mm_id للتنشيطات الكبيرة

يتضمن إصدار llama.cpp b10994 إصلاحًا لخلفية Metal يحل مخرجات NaN في عملية `mul_mm_id` عندما تتجاوز قيم التنشيط نطاق f16. كان هذا العيب يسبب سابقًا إنتاج نماذج مثل Mistral Small 4 لمفردات مكونة بالكامل من NaN خلال خطوات التعبئة المسبقة التي تبلغ 32 رمزًا أو أكثر على أجهزة Apple Silicon.

lab NVIDIA Research · منذ 7 يوم · 16 مشاهدة

يتيح ShareMMU مشاركة ترجمة العناوين بأمان بين المسرعات غير الموثوقة بتكلفة إضافية منخفضة

يقدم الباحثون تصميم ShareMMU، وهو تصميم لـ IOMMU يسمح للعديد من المسرعات غير الموثوقة بإعادة استخدام العناوين المترجمة مسبقًا بشكل آمن ضمن مساحة عنوان افتراضية مشتركة. يخفف هذا النهج من مخاطر القنوات الجانبية المرتبطة بمخازن المؤقتة الكبيرة للبحث عن الترجمات المشتركة (TLBs) مع الحفاظ على أداء عالٍ.

media Hugging Face Forums · منذ 9 يوم · 18 مشاهدة

MOLT يحقق تسريعًا بنسبة 23% في ضبط Qwen 1.5B QLoRA الدقيق مقارنة بـ Unsloth على RTX 4060 Laptop

قام المؤلف بإنشاء MOLT، وهو بيئة تشغيل تركز على نظام ويندوز لضبط QLoRA الدقيق الواعي بالحرارة على وحدات معالجة الرسومات الاستهلاكية من NVIDIA، وقام بمقارنته مع Unsloth باستخدام مليون هدف تدريب لـ Qwen 1.5B على وحدة RTX 4060 Laptop GPU.

media Hugging Face Forums · منذ 11 يوم · 13 مشاهدة

اقتراح لتشغيل ذكاء اصطناعي محايد للبائعين مع تنفيذ واعٍ لميزانية الذاكرة

توضح مقترح على منتديات Hugging Face طبقة مشتركة لتنفيذ وحدات معالجة الرسومات وإدارة الذاكرة مصممة لفصل كود التطبيق عن بائعي الأجهزة المحددين مثل NVIDIA وAMD وIntel. الهدف هو السماح للمستخدمين بتحديد ميزانية ذاكرة بدلاً من تكوين أعلام خاصة بالخلفية الخلفية، أو خرائط الأجهزة، أو استراتيجيات الإخراج يدوياً.

lab NVIDIA Research · منذ 11 يوم · 20 مشاهدة

Onyx يحقق تكلفة أقل بنسبة 1.7-9.9 مرة وزمن استجابة أقل بنسبة 2.3-12.3 مرة لبحث ANN غير المدرك للقرص

يقترح الباحثون Onyx، وهو نهج فعال من حيث التكلفة لبحث الجيران الأقربين التقريبي (ANN) غير المدرك للقرص، يوازن بين عرض النطاق وعدد الوصولات عن طريق عكس تصميم أنظمة ORAM-ANN الأكثر تقدمًا.

lab NVIDIA Research · منذ 11 يوم · 21 مشاهدة

إنفيديا تطلق GPIR للاسترجاع الخاص للمعلومات المسرّع بواسطة وحدة معالجة الرسومات

قدم باحثون من إنفيديا نظام GPIR، الذي يسرّع الاسترجاع الخاص للمعلومات (PIR) على وحدات معالجة الرسومات من خلال معالجة الحساب العالي على جانب الخادم وحركة مرور الذاكرة الكامنة في البروتوكولات القائمة على الشبكات. يستخدم النظام نموذج تنفيذ هجينًا يدرك المراحل، حيث يبدل ديناميكيًا بين kernels على مستوى العملية وعلى مستوى المرحلة لتعظيم إعادة استخدام البيانات داخل الشريحة.

lab NVIDIA Research · منذ 11 يوم · 21 مشاهدة

NVIDIA تميز أداء وتكلفة MPC و FHE لـ PPML

تقدم دراسة جديدة توصيفًا موحدًا على مستوى النظام للحوسبة الآمنة متعددة الأطراف (MPC) والتشفير المتجانس الكامل (FHE) لاستدلال تعلم الآلة الذي يحافظ على الخصوصية. تقيم العمل متغيرين لـ MPC — تحويل المشاركة الحسابية/الثنائية ومشاركة الدوال السرية — جنبًا إلى جنب مع FHE عبر نماذج CNN و Transformer متعددة.

media Together AI Blog · منذ 13 يوم · 16 مشاهدة

تضيف Together GPU Clusters عقدًا قابلة للإنهاء بتكلفة 50%

تعلن Together AI عن النسخة التجريبية العامة للحوسبة القابلة للإنهاء (preemptible compute) لـ Together GPU Clusters على Kubernetes، مما يوفر خيارًا أقل تكلفة للأحمال العملية التي تتحمل الانقطاع. تستخدم العقد القابلة للإنهاء السعة المسرّعة من NVIDIA غير المستخدمة وتُفوتر بنسبة ثابتة تبلغ 50% من سعر الطلب المباشر (on-demand).

github llama.cpp · منذ 13 يوم · 19 مشاهدة

إصلاح llama.cpp b10891 لانهيار Vulkan على PowerVR بالرجوع إلى اختزال الذاكرة المشتركة

أصدر مشروع llama.cpp الإصدار b10891، الذي يعالج مشكلة استقرار حرجة على وحدات معالجة الرسومات PowerVR. يعدل التحديث الخلفية Vulkan للرجوع إلى اختزال الذاكرة المشتركة لعمليات ضرب المصفوفة المتجهية بعد فك التكميم (dmmv).

lab OpenAI News · منذ 15 يوم · 39 مشاهدة

نظام GPT-5.6 Sol التابع لمعهد ماساتشوستس للتكنولوجيا يؤتمت معايرة شرائح الكم عبر Codex

استخدمت بياتريس يانكليفيتش من مجموعة أنظمة الكم الهندسية في معهد ماساتشوستس للتكنولوجيا نظام GPT‑5.6 Sol، المتكامل مع Codex، لتشغيل وتحسين القياسات الروتينية على الكيوبتات فائقة التوصيل بشكل مستقل. يتيح هذا التكامل لوكيل الذكاء الاصطناعي تشغيل برامج المختبر، وتحليل النتائج، واتخاذ القرارات بشأن الخطوات التالية دون إشراف بشري مستمر.

media TLDR AI · منذ 15 يوم · 26 مشاهدة

أنثروبيك تضمن قدرة حوسبة بقيمة 517 مليار دولار؛ أوبن إيه آي تعد وكلاء مُدارين

لقد حصلت أنثروبيك على عقود إيجار لسعة الحوسبة بقيمة 517 مليار دولار خلال الأشهر الـ 11 الماضية، بما يعادل 14.8 جيجاواط، بشكل أساسي مع جوجل وأمازون ويب سيرفيسز. يشمل هذا التوسع صفقات كبيرة مع مزودي السحابة مثل أكاماي وفلويدستاك، واتفاق بقيمة 45 مليار دولار مع إنسكيل.

github llama.cpp · منذ 16 يوم · 44 مشاهدة

إصلاح llama.cpp b10839 لانهيارات الانزياح غير المحاذاة في عمليات GET_ROWS عبر Vulkan

أصدر مشروع llama.cpp الإصدار b10839، الذي يحل مشكلات الانهيار الحاد في الخلفية (backend) الخاصة بـ Vulkan الناتجة عن انزياحات غير محاذاة أثناء عمليات استرجاع صفوف الموترات. سابقاً، كانت نماذج مثل Qwen3-TTS وQwen3-VL تفشل عند استخدام `ggml_view` مع إزاحات عرض غير صفرية لأن الشادر (shader) كان يفرض شرط المحاذاة بالنسبة إلى `minStorageBufferOffsetAlignment`. يطبق هذا التحديث دعماً أصلياً للإزاحات المحاذاة في كل من المسارات الكمّية وغير الكمّية، مما يلغي الحاجة إلى التراجع إلى وحدة المعالجة المركزية.