Hardware & chips
github llama.cpp · منذ 2 يوم · مشاهدة واحدة

يضيف llama.cpp b10306 مسارًا مسطحًا لـ SYCL GLU ويوحّد النوى

تُقدّم إصدار llama.cpp b10306 تحسينات في الأداء للخلفية SYCL، مستهدفةً على وجه التحديد عمليات وحدة الخطية المقننة (GLU). يضيف التحديث مسارًا سريعًا متواصلًا لعمليات GLU المدمجة ويوحّد النوى المختلفة سابقًا لمشاركة مُطلق مشترك.

github llama.cpp · منذ 5 يوم · مشاهدتان

يمدد llama.cpp الإصدار b10255 مسار oneDNN SDPA ليشمل مخازن KV غير FP16

يُمدّ إصدار llama.cpp b10255 مسار oneDNN SDPA لدعم مخازن المفاتيح والقيم (KV) غير FP16، بما في ذلك صيغ الكمّ Q4_0–Q8_0 وFP32. يسمح هذا التحديث بتشغيل نواة systolic المدمجة بنفس طريقة المسار الأصلي FP16 من خلال فك الكمّ أو تحويل موترات K/V إلى FP16 كثيف على الجهاز قبل المعالجة.

media r/LocalLLaMA · منذ 10 يوم · مشاهدة واحدة

Lucebox و AMD يتفوقان على Nvidia DGX Spark بنسبة 3.63x في DeepSeek V4 Flash

أعلنت Lucebox عن شراكة مع AMD لعرض إعداد عتاد مستهلك غير متجانس يتفوق على Nvidia DGX Spark في سرعة الاستدلال. يجمع النظام بين وحدة معالجة الرسومات AMD Radeon AI PRO R9700 ومعالج Strix Halo لتشغيل نموذج DeepSeek V4 Flash الكامل بحجم 284B.

lab Hugging Face Blog · منذ 10 يوم · مشاهدتان

إدارة وحدات معالجة الرسومات: لماذا تعد وحدات المعالجة الخاملة هي الطائرات الأرضية الجديدة

تجادل المقالة بأن استغلال وحدات معالجة الرسومات، بدلاً من ذكاء النموذج، أصبح القيد الرئيسي في الذكاء الاصطناعي المؤسسي، مستخلصةً أوجه تشابه مع استغلال طائرات شركات الطيران حيث تتراكم التكاليف بالساعة بغض النظر عن الاستخدام.

media Hugging Face Forums · منذ 12 يوم · مشاهدة واحدة

باتiens سترونق تقترح بناء الشبكات العصبية كأجهزة أشباه موصلات

تجادل باتiens سترونق بأن الشبكات العصبية الحالية تستهلك طاقة حوسبة مفرطة عن طريق محاكاة الدوائر في البرمجيات بدلاً من تنفيذها كعتاد فيزيائي. تقترح الورقة استبدال هذه المحاكاة بجهاز أشباه موصلات حيث يتم تخزين الأوزان والانحيازات في ذاكرة غير متطايرة.

lab Hugging Face Blog · منذ 12 يوم

Ai2 تطلق منصة OlmoEarth للاستدلال الجغرافي المكاني على نطاق كوكبي

أطلقت Ai2 منصة OlmoEarth، وهي بنية تحتية مصممة لنقل نماذج أساسية لمراقبة الأرض من مرحلة الضبط الدقيق إلى الاستدلال واسع النطاق. تتعامل المنصة مع التحديات الهندسية لمعالجة تيرابايتات من البيانات الفضائية متعددة الوسائط عبر مزودين ودقة مختلفة.

media r/LocalLLaMA · منذ 13 يوم · مشاهدة واحدة

إسقاط أوزان Kimi K3؛ التخطيط لنشرها على A100 و H200 و B300

أطلقت Moonshot أوزان نموذج Kimi K3 الخاص بها على Hugging Face، بـ 2.8 تريليون معلمة وهندسة mixture-of-experts مع 16 خبير نشط لكل توكن. تخطط الفريق لنشر النموذج عبر وحدات GPU من نوع A100 و H200 و B300، مع توقع نتائج الاختبارات المرجعية هذا الأسبوع.

lab IBM Research (Granite) · منذ 16 يوم

آي بي إم تشتري مختبرات إتش آر إل لخبرتها في كيوبتات الدوران السيليكوني

وقعت آي بي إم اتفاقاً نهائياً لاقتناء مختبرات إتش آر إل، وهي مؤسسة بحثية تاريخية قدمت مساهمات علمية تمتد لنحو 80 عاماً. تهدف عملية الاستحواذ إلى تسريع رؤية آي بي إم في الحوسبة الكمومية من خلال دمج الخبرة المتقدمة لمختبرات إتش آر إل في هندسة كيوبتات الدوران السيليكوني.

media TLDR AI · منذ 17 يوم · مشاهدة واحدة

صفقة AMD وAnthropic: ستزود AMD بشرائح MI450 وتستثمر 5 مليارات دولار

وقعت كل من AMD وAnthropic اتفاقية كبرى تتضمن عشرات المليارات من الدولارات في خوادم الذكاء الاصطناعي، حيث ستقوم Anthropic بشراء ما يصل إلى 2 جيجاواط من شرائح Instinct MI450 من AMD بدءاً من النصف الأول من العام المقبل. بالتزامن مع ذلك، ستستثمر AMD ما يصل إلى 5 مليارات دولار في Anthropic مع استيفاء مراحل نشر محددة، بينما تتعاون الشركتان على تحديد مراكز البيانات المناسبة لهذا العتاد.

arxiv arXiv cs.AI · منذ 17 يوم · 4 مشاهدات

تمكّن SLAI T-Rex من التدريب اللاحق الكامل المعلمات لنموذج DeepSeek-V4 على Ascend SuperPOD

تُقدّم SLAI إطار عمل T-Rex، وهو إطار تحسين متكامل للتدريب اللاحق الكامل المعلمات لنماذج MoE ذات الحجم التريليوني من المعلمات على Ascend NPU SuperPOD. باستخدام عائلة نماذج DeepSeek-V4 كحملة عمل مستهدفة، يتعامل النظام مع ضغط الذاكرة وأعباء الاتصال من خلال التسامح المتوازي الهرمي وتحسينات تنفيذ النواة.

arxiv arXiv cs.CL · منذ 17 يوم · مشاهدة واحدة

تمكّن SLAI T-Rex من التدريب اللاحق الكامل المعاملات لنموذج DeepSeek-V4 على Ascend SuperPOD

تُقدّم SLAI إطار عمل T-Rex، وهو إطار تحسين متكامل من البداية للنهاية للتدريب اللاحق الكامل المعاملات لنماذج MoE ذات التريليون معامل على Ascend NPU SuperPOD. باستخدام عائلة نماذج DeepSeek-V4 كحملة عمل مستهدفة، يتعامل النظام مع ضغط الذاكرة وفوق استهلاك الاتصالات من خلال التوازي الهرمي وتحسينات تنفيذ النواة.

lab IBM Research (Granite) · منذ 17 يوم

آي بي إم تلتزم بتقديم 50 مليون دولار للوصول إلى الحوسبة الكمية لمهمة جينيسيس التابعة لوزارة الطاقة الأمريكية

تم اختيار شركة آي بي إم من قبل وزارة الطاقة الأمريكية (DoE) لقيادة مشروع ضمن طلب التطبيقات الخاص بمهمة جينيسيس، ملتزمةً بتقديم ما يصل إلى 50 مليون دولار من الوصول إلى الحوسبة الكمية لدعم المبادرة.

lab OpenAI News · منذ 18 يوم · مشاهدتان

OpenAI تحدد التزامات مشروع مركز بيانات كاميليا في مقاطعة إيفينغهام

أعلنت OpenAI عن تفاصيل مشروع كاميليا، وهو مشروع طويل الأمد لمركز بيانات في مقاطعة إيفينغهام بولاية جورجيا، موضحةً التزاماتها المجتمعية الأولية بشأن الطاقة والمياه والفوائد المحلية. تتعاقد الشركة مع شركة جورجيا باور للحصول على 3.2 غيغاواط من الطاقة سيتم تسليمها بين عامي 2028 و2032.

media Together AI Blog · منذ 20 يوم · مشاهدتان

توغير AI واي كومبينتور تطلقان مجموعة حواسيب GPU مخصصة لشركات واي كومبينتور الناشئة

أعلنت توغير AI واي كومبينتور عن شراكة لتقديم أول مجموعة حواسيب GPU مخصصة حصرياً لمحفظة شركات واي كومبينتور الناشئة في مجال الذكاء الاصطناعي. تهدف هذه المبادرة إلى حل الاختناق الحرج في الوصول إلى القدرة الحسابية من خلال توفير بنية تحتية مرنة وفعّالة من حيث التكلفة للتدريب والاستنتاج دون الحاجة إلى التزامات طويلة الأجل.

media r/LocalLLaMA · منذ 21 يوم · مشاهدتان

Moonshot AI تعلق الاشتراكات الجديدة والوصول المجاني بسبب نقص وحدات معالجة الرسومات

أصبحت شركة الذكاء الاصطناعي الصينية Moonshot AI الأولى في الصين التي نفدت منها قدرة وحدات معالجة الرسومات. ونتيجة لذلك، قررت الشركة تعليق الاشتراكات الجديدة وإلغاء الوصول المجاني للمستخدمين.

media Together AI Blog · منذ 24 يوم

توضيح Together AI لمعنى فترات التشغيل بنسبة 99% و99.9% و99.99% للاستدلال باستخدام وحدات معالجة الرسومات

تفصل Together AI المتطلبات المعمارية المحددة اللازمة لتحقيق مستويات موثوقية مختلفة للاستدلال باستخدام وحدات معالجة الرسومات، وتجادل بأن أرقام اتفاقيات مستوى الخدمة (SLA) القياسية غالباً ما تحجب مجالات الفشل الفعلية المغطاة.

lab NVIDIA Technical Blog · منذ 24 يوم · مشاهدتان

إنفيديا تقترح التصميم المشترك لـ BlueField لتوسيع مصانع الذكاء الاصطناعي الوكيل

توضح إنفيديا كيف يمكن للتصميم المشترك المتطرف مع معالجات BlueField الخاصة بها معالجة تحديات البنية التحتية التي تفرضها أعباء عمل الذكاء الاصطناعي الوكيل. تجادل الشركة بأنه مع قيام الأنظمة الوكيلية بتشغيل سلاسل معقدة من استدعاءات النماذج، وتفاعلات الأدوات، واستعلامات البيانات، فإن أنماط البنية التحتية التقليدية غير كافية للحفاظ على الأداء.

lab NVIDIA Technical Blog · منذ 24 يوم

NVIDIA CUDA 13.3 تضيف دعم الضرب الخالي من الحمل (carryless multiplication) بشكل أصلي

أضافت NVIDIA تعليمات PTX جديدة للضرب الخالي من الحمل في CUDA 13.3، مما يعالج فجوة طويلة الأمد حيث كانت وحدات معالجة الرسومات تفتقر إلى الدعم الأصلي لهذه العملية على الرغم من وجودها على معالجات x86 لأكثر من خمسة عشر عاماً.