Inference efficiency
github llama.cpp · منذ 1 ساعة · 10 مشاهدات مباشر

يخفي llama.cpp b11120 الرموز الداخلية لـ Vulkan لإصلاح تدمير الحالة

أصدر مشروع llama.cpp الإصدار b11120، الذي يعالج خطأً حرجاً في الخلفية البرمجية لـ Vulkan من خلال إخفاء الرموز الداخلية. يمنع هذا التغيير مشاكل تدمير حالة dlopen المزدوج التي حدثت عندما كانت الرموز الداخلية مُصدَّرة.

arxiv arXiv cs.AI · منذ 4 ساعة · 9 مشاهدات

يقلل CliffCompaction تكاليف وكلاء البرمجة بنسبة 50% مع الحفاظ على الأداء

يقدم الباحثون تقنية CliffCompaction، وهي طريقة ضغط تلقائي مصممة لتخفيض التكاليف لوكلاء البرمجة طويلي المدى بنسبة تصل إلى 50% ضمن سياق محدود. تحافظ الطريقة على الأداء أو تحسّنه في Terminal-Bench وتحقق نتائج متقدمة في KernelBench من خلال الحفاظ على دقة المعلومات المضغوطة عبر الاقتطاع بدلاً من إعادة الصياغة.

arxiv arXiv cs.LG · منذ 5 ساعة · 9 مشاهدات

يقلل CliffCompaction تكاليف وكلاء البرمجة طويلة المدى بنسبة تصل إلى 50% مع الحفاظ على الأداء

يقدم الباحثون تقنية CliffCompaction، وهي طريقة ضغط ذاتي مصممة للوكلاء الذين يتعاملون مع ملايين الرموز (tokens)، مما يقلل التكاليف بنسبة تصل إلى 50% ضمن سياق محدود. تحافظ الطريقة على الأداء أو تحسّنه في Terminal-Bench وتحقق نتائج رائدة في KernelBench من خلال الحفاظ على دقة المعلومات عبر الاقتطاع بدلاً من إعادة الصياغة.

lab OpenAI News · منذ 11 ساعة · 16 مشاهدة

تقليل وقت البحث والتكلفة إلى النصف باستخدام GPT-6 Astra

قامت Parallel بدمج GPT-6 Astra من OpenAI في بنية وكلاء الذكاء الاصطناعي الخاصة بها، محققةً انخفاضاً بنسبة 50% في كل من وقت البحث وتكاليف البرمجيات مقارنة بالنماذج السابقة. تبلغ الشركة أن النموذج الجديد يسمح للوكلاء بإكمال أعمال المعرفة المعقدة بشكل أسرع بكثير مع الحفاظ على جودة عالية للإخراج.

github llama.cpp · منذ 17 ساعة · 9 مشاهدات

إضافة llama.cpp دعم DFlash لـ HunyuanOCR وإصلاح تحويل المسودة

أضاف مشروع llama.cpp دعمًا لفك التشفير التخميني (speculative decoding) الخاص بـ DFlash مع نموذج HunyuanOCR من خلال كشف موترات إدخال الطبقة في الرسم البياني المستهدف. يسمح هذا التغيير لنموذج المسودة بقراءة تدفقات الباقي، مما يتيح تنفيذ طلبات الصور بنجاح بمعدل قبول مسودة يبلغ حوالي 0.5 وإخراج OCR مطابق تمامًا للبايت مقارنة بالعمليات غير التخمينية.

lab Hugging Face Blog · منذ 21 ساعة · 10 مشاهدات

إضافة مكتبة Transformers دعمًا لتنسيق GGUF عبر نوى ggml للاستدلال المحلي

تدعم الآن مكتبة Transformers التابعة لـ Hugging Face تحميل النماذج المُكمّمة بتنسيق GGUF، مستفيدةً من نوى ggml الأساسية لتحقيق أداء يقترب من llama.cpp. يتيح هذا التكامل للمطورين تشغيل نقاط التفتيش المُكمّمة مباشرةً داخل واجهة برمجة التطبيقات القياسية المعتمدة على PyTorch على الأجهزة المدعومة.

media Hugging Face Forums · منذ 1 يوم · 11 مشاهدة

مستخدم يبحث عن سير عمل لإزالة الرقابة من Llama-Krikri-8B-Instruct للاستخدام المحلي باليونانية

يخطط مستخدم لبناء نموذج لغوي كبير غير خاضع للرقابة، أصلي باللغة اليونانية، للنشر المحلي باستخدام نقطة التفتيش ilsp/Llama-Krikri-8B-Instruct. تتضمن الخطة المقترحة إزالة الرقابة عن النموذج باستخدام Heretic (heretic-llm)، وتحويله إلى تنسيق GGUF Q4_K_M، وتشغيل الاستدلال على جهاز GMKtec EVO-X3 المزود بمعالج AMD Ryzen AI MAX+ 395 عبر Vulkan.

media Together AI Blog · منذ 1 يوم · 11 مشاهدة

تطلق Together AI نشرات Canary لترقية النماذج في بيئة الإنتاج دون توقف

أعلنت Together AI عن نشرات Canary، وهي ميزة تنقل حركة المرور الحية من نموذج حالي إلى نقطة تفتيش جديدة على مراحل مقفلة. يقوم هذا النظام بأتمتة آلية الأمان لتبديل النماذج من خلال إجراء فحوصات الصحة وبوابات المقاييس الاختيارية قبل تحويل حركة المرور، مما يتيح الإيقاف المؤقت والعكس التلقائيين إذا تدهورت الأداء.

arxiv arXiv cs.AI · منذ 1 يوم · 9 مشاهدات

يقلل AgentRouter تكاليف سير العمل الوكيلّي بنسبة 72٪ عبر توجيه النماذج على مستوى الخطوات

يقترح الباحثون AgentRouter، وهو مصنف خفيف الوزن يحسّن سير العمل الوكيلّي متعدد الخطوات عن طريق توجيه خطوات المسار الفردية إلى طبقات نماذج مناسبة بدلاً من استخدام أحدث النماذج لكل مهمة. يعالج النظام عدم كفاءة الحلول الحالية التي تتجاهل تعقيد المهام الفرعية المتفاوتة داخل جلسة وكيل واحدة.

arxiv arXiv cs.CL · منذ 1 يوم · 11 مشاهدة

يقلل AgentRouter تكاليف سير العمل الوكيلّي بنسبة 72٪ عبر توجيه النماذج على مستوى الخطوة

يقترح الباحثون AgentRouter، وهو مصنف خفيف الوزن يحسّن سير العمل الوكيلّي متعدد الخطوات من خلال توجيه خطوات المسار الفردية إلى طبقات نماذج مناسبة بدلاً من استخدام نموذج حدودي واحد لجميع المهام. يعالج النظام عدم كفاءة الأنظمة المؤسسية التي تهدر 60-80٪ من ميزيتها الاستدلالية في مهام فرعية يمكن للنماذج الأصغر معالجتها بنفس الجودة.