Training methods
arxiv arXiv cs.LG · منذ 2 يوم

يُمكّن U-OPSD التنقيح الذاتي غير الخاضع للإشراف في السياسة الحالية لنماذج اللغات الكبيرة

يقترح الباحثون التنقيح الذاتي غير الخاضع للإشراف في السياسة الحالية (U-OPSD)، وهي طريقة تحقق تحسينًا ما بعد التدريب لنماذج اللغات الكبيرة باستخدام توليدات النموذج الخاصة به فقط دون إشراف خارجي. تعتمد الطريقة على أخذ عينات من عدة مسارات لبناء حل شبه صحيح عبر التصويت بالأغلبية، ثم تنقيح توزيع المعلم إلى بادئات أطول إكمال خاطئ للنموذج.

media r/LocalLLaMA · منذ 5 يوم

يستخدم AFM3 20B من Apple تقليم اتباع التعليمات لتفعيل حوالي 20% من الطبقات

أطلقت Apple بنية جديدة لنماذجها الأساسية من الجيل الثالث (AFM3) تستخدم "تقليم اتباع التعليمات" لتقليل عدد المعاملات النشطة بشكل كبير. تم تصميم النموذج لتفعيل حوالي 20% من طبقات MLP الخاصة به عن طريق اتخاذ قرارات التوجيه مرة واحدة لكل طلب بدلاً من كل توكن.

media MarkTechPost · منذ 7 يوم · 4 مشاهدات

إصدار NVIDIA NeMo لـ Molt، إطار عمل RL وكيل مضغوط أصلي PyT

أطلق فريق NeMo التابع لشركة NVIDIA إطار عمل Molt، وهو إطار عمل مفتوح المصدر للتعزيز الوكيلي مصمم لتقليل تعقيد تكرار الخوارزميات للباحثين. يتكون قاعدة الشيفرة من حوالي 8.6K سطرًا من شيفرة RL، وهي أصغر بكثير من الأطر العاملة المماثلة مثل verl (62K سطرًا) وslime (25K سطرًا).

media Hugging Face Forums · منذ 8 يوم

التحقيق في إمكانية استخدام مسارات الوكيل الفاشلة كبيانات ضبط دقيق

يقترح المؤلف فرضية مفادها أن مسارات الوكلاء الذين يستخدمون الأدوات ولكن فشلوا، مثل اختيار أدوات خاطئة أو حجوزات مشوهة، يمكن أن تكون بيانات قيمة لضبط دقيق لتدريب النماذج على الابتعاد عن هذه الأخطاء. يسعى المنشور للحصول على ملاحظات المجتمع حول ما إذا كان التدريب على مسارات الفشل المصححة فعالاً أم ضاراً.

media Hugging Face Forums · منذ 9 يوم

تفصل PIN v2 عرض النموذج عن تكلفة التخزين عبر ربط الأوزان

تُقدم بنية PIN الإصدار الثاني طريقة لاختيار حجم الشبكة العصبية وسرعة الاستدلال مسبقاً قبل التدريب باستخدام ربط الأوزان. تجبر هذه التقنية مجموعات من الخلايا على الاحتفاظ بقيم متطابقة، مما يسمح للشبكة بالحفاظ على عرضها مع تقليل عدد الأوزان المخزنة بشكل كبير.

media r/LocalLLaMA · منذ 9 يوم · مشاهدة واحدة

هواوي تفتح مصدر نموذج openPangu-2.0-Pro، وهو نموذج MoE بحجم 505B-A18B

أصدرت هواوي الأوزان مفتوحة المصدر لنموذج openPangu-2.0-Pro، وهو نموذج لغوي كبير (LLM) من نوع Mixture of Experts (MoE) تم تدريبه على عتاد Ascend. يحتوي النموذج على 505 مليار معامل إجمالي مع 18 مليار معامل مُفعّل ويدعم طول سياق يبلغ 512k رمزًا.

arxiv arXiv cs.CL · منذ 9 يوم · مشاهدتان

مُفكِّر الذاكرة على نطاق واسع: توسيع نطاق الذاكرة طويلة الأمد البارامترية إلى 6.9 مليار معلمة

يقدم الباحثون مُفكِّر الذاكرة على نطاق واسع، وهو نظام يوسّع نماذج الذاكرة طويلة الأمد البارامترية لتصل إلى 6.9 مليار معلمة ويطوّرها مسبقاً باستخدام 300 مليار رمز. وللتغلب على استحالة استخدام خطوط أنابيب Faiss القياسية عند هذا الحجم من البيانات، يطبّق المؤلفون خط أنابيب فهرسة موزع مع تحميل متناثر ودفعي لتوزيعات kNN.

lab Microsoft Research Blog · منذ 9 يوم · 3 مشاهدات

أبحاث مايكروسوفت تقدم مكتبة EvoLib للتعلم أثناء الاختبار باستخدام مكتبة متطورة

قدمت أبحاث مايكروسوفت مكتبة EvoLib، وهي إطار عمل يمكّن النماذج اللغوية الكبيرة من التعلم من خبراتها الخاصة أثناء الاستدلال دون الحاجة إلى تسميات مرجعية أو ملاحظات خارجية. بدلاً من تخزين الخبرات الخام كذكريات ثابتة، تحوّلها مكتبة EvoLib إلى مهارات قابلة لإعادة الاستخدام ورؤى تأملية يتم تحسينها باستمرار ودمجها وإعادة ترجيحها.

lab Microsoft Research Blog · منذ 9 يوم · 4 مشاهدات

مايكروسوفت تطلق Echoverse لتدريب وكلاء استخدام الحاسوب

أطلقت مايكروسوفت ريسيرش Echoverse، وهو مجموعة من اثني عشر بيئة اصطناعية عميقة مصممة لتدريب وكلاء استخدام الحاسوب. تتضمن المبادرة عشرة عوالم محددة المجال وعالمين يركزان على القدرات، وقد بُنيت جميعها للحفاظ على حالة متماسكة ودقة سلوكية.

arxiv arXiv cs.CL · منذ 11 يوم

يقلل Relay-OPD طول مسار التدريب بأكثر من 50٪ في التقريب غير الرسمي

يقدم الباحثون تقريبًا غير رسمي متتابع (Relay-OPD) لمعالجة فشل البادئة في التقريب غير الرسمي القياسي، حيث تؤدي أخطاء الطالب إلى إشراف غير موثوق. تستخدم الطريقة عدم تماثل الاستمرارية بين المعلم والطالب كمحفز ليأخذ المعلم زمام المبادرة لفترة قصيرة لإعادة توجيه المسار قبل أن يستأنف الطالب.

arxiv arXiv cs.CL · منذ 13 يوم OSWorld · 37.7%

يمكّن OpenForgeRL التدريب الشامل للوكلاء المعتمدين على أدوات في أي بيئة

يُعد OpenForgeRL إطار عمل مفتوح المصدر يسمح للباحثين بتدريب وكلاء الذكاء الاصطناعي المعتمدين على أدوات بشكل شامل باستخدام مجموعات تعلم التعزيز القياسية. يفصل بين التدريب والاستدلال من خلال استخدام وكيل خفيف الوزن لتسجيل استدعاءات النموذج كبيانات، ومنسق Kubernetes لإدارة عمليات النشر في حاويات عن بُعد.

media Hugging Face Forums · منذ 14 يوم GSM8K · 74.22%

CrowdTensor يُطلق النسخة التجريبية لتدريب المتطوعين وطلب التعليقات حول حملة Qwen2.5-7B GSM8K

يُعد CrowdTensor بروتوكولاً مفتوح المصدر بموجب رخصة Apache-2.0 لحملات تدريب النماذج بواسطة المتطوعين مع حفظ النقاط المرجعية، حيث يربح مراجعات غير قابلة للتغيير للنموذج والبيانات لتزويد خلايا المعالج المركزي (CPU)، أو وحدة معالجة الرسومات (GPU)، أو وحدة معالجة Tensor (TPU) المقبولة بأعمال محدودة النطاق. وقد أفرج المشروع عن عملية تسجيل في النسخة التجريبية جنبا إلى جنب مع مسودة طلب التعليقات حول حملة Qwen2.5-7B GSM8K.

media Hugging Face Forums · منذ 15 يوم

إصدار ThetaScan v0.1 يفتح ذاكرة غير خطية متوازية في المسح مع نتائج نموذج لغوي 17M

تم إصدار معاينة بحثية لـ ThetaScan v0.1، وهو خلاط رموز غير خطي بحالة ثابتة، كتنفيذ مفتوح المصدر. تضمن الهندسة المعمارية أن يحسب كل رمز كتابة ذاكرته من الإدخال الحالي والمعلمات المشتركة بدلاً من حالة سريعة متطورة، مما يسمح بتأليف الكتابات عبر مسح بادئة تجميعي.

arxiv arXiv cs.CL · منذ 16 يوم SWE-bench Pro · 55.9% · مشاهدتان

يمكن لـ OpenForgeRL تدريب الوكلاء المعتمدين على أدوات الاستشعار بشكل متكامل في أي بيئة

يقدم الباحثون إطار عمل مفتوح المصدر يُدعى OpenForgeRL، والذي يتيح التدريب المتكامل للوكلاء الذكيين باستخدام أدوات استشعار معقدة مثل Claude Code وOpenClaw. يفصل النظام بين عملية التدريب والاستدعاء من خلال استخدام وكيل خفيف لتسجيل استدعاءات النموذج كبيانات، ومنسق Kubernetes لإدارة نشر الحاويات عن بُعد.

arxiv arXiv cs.AI · منذ 16 يوم OSWorld · 37.7% · 5 مشاهدات

يمكّن OpenForgeRL التدريب الشامل للوكلاء المعتمدين على أدوات في أي بيئة

يُعد OpenForgeRL إطار عمل مفتوح المصدر يسمح للباحثين بتدريب وكلاء الذكاء الاصطناعي المعتمدين على أدوات بشكل شامل باستخدام حزم التعلم التعزيزي القياسية. ويتحقق من ذلك عن طريق فصل التدريب عن الاستدلال عبر وسيط خفيف الوزن يسجل استدعاءات النموذج كبيانات، ومنسق Kubernetes الذي يدير نشر الحاويات عن بُعد.

media Hugging Face Forums · منذ 16 يوم · مشاهدة واحدة

نقاش مجتمعي حول جدوى إنتاج نماذج LLM المتخصصة في المجال بحجم 7B–14B

يحقق مستخدم في منتدى Hugging Face فيما إذا كانت نماذج اللغات الكبيرة (LLMs) الصغيرة والمتخصصة في مجال معين، والتي تتراوح بين 7B و14B معلمة، يمكنها استبدال النماذج الأكبر بشكل فعال في بيئات الإنتاج الواقعية.

media Hugging Face Forums · منذ 17 يوم

إليزا مع مُشفِّر تلقائي متفرق

تستفيد نسخة جديدة من روبوت المحادثة إليزا من بنية المُشفِّر التلقائي المتفرق لتخزين إدخالات المحادثة في طبقة ذاكرة كامنة، بهدف تحسين الأساليب التقليدية لمطابقة الكلمات المفتاحية. يعتمد النظام على بنية مُشفِّر-مُفكِّك T5 مع طبقة ذاكرة تحتوي على 32,768 عصبوناً، حيث تُفعَّل الإدخالات المتشابهة عبر التعلم التبايني.

media r/LocalLLaMA · منذ 17 يوم · مشاهدة واحدة

SLAI T-Rex يحقق 34.22% MFU و71.81% Pass@1 لـ DeepSeek-V4 على Ascend

تقدم SLAI إطار عمل T-Rex للتدريب اللاحق الكامل المعلمات لعائلة نماذج DeepSeek-V4 على بنية Ascend SuperPOD الأساسية. يعالج النظام ضغط الذاكرة والعبء الإضافي للاتصال في نماذج MoE ذات التريليون معلمة من خلال التحسين الهرمي.

arxiv arXiv cs.AI · منذ 17 يوم · 4 مشاهدات

تمكّن SLAI T-Rex من التدريب اللاحق الكامل المعلمات لنموذج DeepSeek-V4 على Ascend SuperPOD

تُقدّم SLAI إطار عمل T-Rex، وهو إطار تحسين متكامل للتدريب اللاحق الكامل المعلمات لنماذج MoE ذات الحجم التريليوني من المعلمات على Ascend NPU SuperPOD. باستخدام عائلة نماذج DeepSeek-V4 كحملة عمل مستهدفة، يتعامل النظام مع ضغط الذاكرة وأعباء الاتصال من خلال التسامح المتوازي الهرمي وتحسينات تنفيذ النواة.