الموضوع · Training methods
lab Microsoft Research Blog · منذ 15 يوم · 7 مشاهدات

مايكروسوفت تطلق Echoverse لتدريب وكلاء استخدام الحاسوب

أطلقت مايكروسوفت ريسيرش Echoverse، وهو مجموعة من اثني عشر بيئة اصطناعية عميقة مصممة لتدريب وكلاء استخدام الحاسوب. تتضمن المبادرة عشرة عوالم محددة المجال وعالمين يركزان على القدرات، وقد بُنيت جميعها للحفاظ على حالة متماسكة ودقة سلوكية.

lab NVIDIA Research · منذ 3 يوم · 38 مشاهدة

تساوي نماذج اللغات الكبيرة أو تتفوق على التحسين البايزي في تحسين المعاملات الفائقة

تستكشف ورقة بحثية جديدة استخدام نماذج لغوية كبيرة أساسية (LLMs) لأتمتة تحسين المعاملات الفائقة (HPO)، وهي عملية تعتمد عادةً على أساليب يدوية في إعدادات الميزانية المحدودة. طور المؤلفون منهجية تقترح فيها النماذج LLM تكوينات للمعاملات الفائقة بناءً على وصف مجموعة البيانات والنموذج، والتي يتم بعد ذلك تحسينها تكرارياً وفقًا لأداء النموذج.

lab NVIDIA Research · منذ 3 يوم · 40 مشاهدة

مصدر يقدم اشتقاقًا مقاربًا غير ملتوي لنسبة بيانات التدريب

يقدم الباحثون مصدر، وهو طريقة جديدة لنسبة بيانات التدريب (TDA) تجمع بين الكفاءة الحسابية لدوال التأثير ودقة النهج القائمة على التفكيك. باستخدام صيغة تشبه دالة التأثير لتقريب الاشتقاق غير الملتوي، يعالج مصدر قيود طرق الاشتقاق الضمني، مثل فشلها في حساب التحيز الأمثل أو خطوط الأنابيب متعددة المراحل.

lab NVIDIA Research · منذ 3 يوم · 9 مشاهدات

تتعلم JacNet الدوال عن طريق نمذجة جاكوبيان المهيكلة مباشرة

يقدم الورقة JacNet، وهو بنية شبكة عصبية تتعلم بشكل مباشر جاكوبيان لدالة الإدخال-الإخراج بدلاً من التحويل نفسه. يتيح هذا النهج تحكماً دقيقاً في خصائص المشتق، مما يمكّن من فرض مسبق هيكلي مثل القابلية للعكس والاستمرارية k-Lipschitz.

lab NVIDIA Research · منذ 3 يوم · 12 مشاهدة

jlorraine تقدم أدوات تحسين متداخلة قابلة للتوسع للتعلم العميق

تقدم المقالة أطروحة من jlorraine تتناول تحديات تطبيق التحسين ثنائي المستوى أو المتداخل على إعدادات التعلم العميق واسعة النطاق. بينما يحدث تحديث مجموعة واحدة من المعلمات عادةً في التحسين القائم على التدرج، تتطلب العديد من التطبيقات تحديث مجموعات فرعية من المعلمات على أهداف مختلفة متداخلة داخل بعضها البعض.

lab NVIDIA Research · منذ 4 يوم · 6 مشاهدات

Masters يُكثّف نماذج الرؤية واللغة عبر قناع المعلم وتعزيز الطالب

يقترح الباحثون Masters، وهو إطار تعلم بالتعزيز التدريجي بالقناع لتكثيف نماذج الرؤية واللغة واسعة النطاق إلى إصدارات مدمجة مناسبة للنشر على الحافة. تتناول الطريقة عدم الاستقرار الناتج عن فجوة الحجم بين نموذجي المعلم والطالب.

lab NVIDIA Research · منذ 4 يوم · 9 مشاهدات

يستخدم ZPPO المطالبات بدلاً من التدرجات لتحسين تدريب نماذج الرؤية واللغة الصغيرة

يقدم الباحثون منطقة تحسين السياسة القريبة (ZPPO)، وهي طريقة تُدخل معرفة المعلم في المطالبات بدلاً من تدرجات السياسة لمعالجة الهشاشة في تقطير المعرفة والانحراف في التعلم المعزز. يبني ZPPO أسئلة تتضمن مرشحين ثنائيين (BCQ) وأسئلة تتضمن مرشحين سلبيين (NCQ) للأسئلة الصعبة، ويعيد تدويرها عبر مخزن الاسترجاع حتى تتحسن دقة الطالب أو يتم إخراجها.

lab Microsoft Research Blog · منذ 15 يوم · 4 مشاهدات

أبحاث مايكروسوفت تقدم مكتبة EvoLib للتعلم أثناء الاختبار باستخدام مكتبة متطورة

قدمت أبحاث مايكروسوفت مكتبة EvoLib، وهي إطار عمل يمكّن النماذج اللغوية الكبيرة من التعلم من خبراتها الخاصة أثناء الاستدلال دون الحاجة إلى تسميات مرجعية أو ملاحظات خارجية. بدلاً من تخزين الخبرات الخام كذكريات ثابتة، تحوّلها مكتبة EvoLib إلى مهارات قابلة لإعادة الاستخدام ورؤى تأملية يتم تحسينها باستمرار ودمجها وإعادة ترجيحها.

media Hugging Face Forums · منذ 1 يوم · مشاهدة واحدة

تقترح ThetaMem رفع مفاتيح ضربية موقعة للذاكرة المتسلسلة ذات الحالة الثابتة

ThetaMem هي دراسة أولية بذرة واحدة لمُخلِّط متكرر يعدّل الحالة المتكررة عبر رفع مفاتيح مُكتسبة باستخدام ضرب هادامارد الموقّع أو المنتج الخارجي، بدلاً من تحسين آليات التوجيه. يعرض المؤلف نتائج مختلطة على معايير اصطناعية ويسعى صراحةً إلى النقد لتحديد أرخص تجربة يمكن أن تدحض النهج.

media MarkTechPost · منذ 1 يوم · 6 مشاهدات

داينا روبوتكس تطلق داينا-2، نموذج عالمي-فعل مُدرَّب مسبقاً على مليون ساعة من الفيديو البشري

أطلقت داينا روبوتكس نموذج داينا-2، وهو نموذج عالمي-فعل لتلاعب الروبوتات، تم تدريبه مسبقاً على أكثر من مليون ساعة من الفيديو الذاتي المركز للبشر. تُظهر الشركة أن الفيديو البشري العادي يمكن أن يحل محل البيانات المُعلَّمة بالأفعال من خلال وضع قانون قياس يتراوح بين 1,000 و1,000,000 ساعة.

arxiv arXiv cs.AI · منذ 3 يوم

يحسّن MiLMMT-46-v1.0 الترجمة متعددة اللغات عبر ما بعد التدريب بدون مرجع

طوّر الباحثون نموذج MiLMMT-46-v1.0 للترجمة الآلية متعددة اللغات، الذي يطبّق ما بعد التدريب بدون مرجع على نماذج لغوية كبيرة مفتوحة المصدر. يستخدم الفريق تحسين السياسة النسبية للمجموعة (GRPO) مع مكافأة تعتمد على نموذجين لتقدير الجودة بدون مرجع، يتم التحكم فيهما عبر تحديد اللغة.

arxiv arXiv cs.CL · منذ 3 يوم · مشاهدة واحدة

تحسّن MiLMMT-46-v1.0 للترجمة متعددة اللغات عبر ما بعد التدريب بدون مرجع

أطلق الباحثون نموذج MiLMMT-46-v1.0، وهو نموذج لغوي كبير مفتوح المصدر للترجمة الآلية متعددة اللغات، يعتمد على ما بعد التدريب بدون مرجع. بدءاً من النسخة المدققة بالإشراف MiLMMT-46-v0.1، طبق الفريق تحسين السياسة النسبية للمجموعة (GRPO) مع مكافأة تستند إلى نموذجين لتقدير الجودة بدون مرجع، يتم تفعيلهما عبر تحديد اللغة.

lab Hugging Face Blog · منذ 5 يوم · 8 مشاهدات

Multiverse Computing يقلل من استهلاك ذاكرة الفيديو في تقنيات التقريب المعرفي باستخدام خسارة KL المقطعية المندمجة

تقدم Multiverse Computing نهجاً فعالاً من حيث الذاكرة لتقريب المعرفة في نماذج اللغات الكبيرة، من خلال الجمع بين تخزين اللوغاتات (logits) الأعلى قيمة بشكل غير متصل وخسارة تباعد كولباك-لايبلر (KL) المقطعية المندمجة. يلغي هذا الأسلوب الحاجة إلى الاحتفاظ بنماذج المعلم والطالب في الذاكرة في آنٍ واحد، مما يقلل بشكل كبير من متطلبات ذاكرة الفيديو.

arxiv arXiv cs.LG · منذ 8 يوم

يُمكّن U-OPSD التنقيح الذاتي غير الخاضع للإشراف في السياسة الحالية لنماذج اللغات الكبيرة

يقترح الباحثون التنقيح الذاتي غير الخاضع للإشراف في السياسة الحالية (U-OPSD)، وهي طريقة تحقق تحسينًا ما بعد التدريب لنماذج اللغات الكبيرة باستخدام توليدات النموذج الخاصة به فقط دون إشراف خارجي. تعتمد الطريقة على أخذ عينات من عدة مسارات لبناء حل شبه صحيح عبر التصويت بالأغلبية، ثم تنقيح توزيع المعلم إلى بادئات أطول إكمال خاطئ للنموذج.

media r/LocalLLaMA · منذ 11 يوم · 5 مشاهدات

يستخدم AFM3 20B من Apple تقليم اتباع التعليمات لتفعيل حوالي 20% من الطبقات

أطلقت Apple بنية جديدة لنماذجها الأساسية من الجيل الثالث (AFM3) تستخدم "تقليم اتباع التعليمات" لتقليل عدد المعاملات النشطة بشكل كبير. تم تصميم النموذج لتفعيل حوالي 20% من طبقات MLP الخاصة به عن طريق اتخاذ قرارات التوجيه مرة واحدة لكل طلب بدلاً من كل توكن.

media MarkTechPost · منذ 12 يوم · 4 مشاهدات

إصدار NVIDIA NeMo لـ Molt، إطار عمل RL وكيل مضغوط أصلي PyT

أطلق فريق NeMo التابع لشركة NVIDIA إطار عمل Molt، وهو إطار عمل مفتوح المصدر للتعزيز الوكيلي مصمم لتقليل تعقيد تكرار الخوارزميات للباحثين. يتكون قاعدة الشيفرة من حوالي 8.6K سطرًا من شيفرة RL، وهي أصغر بكثير من الأطر العاملة المماثلة مثل verl (62K سطرًا) وslime (25K سطرًا).

media Hugging Face Forums · منذ 13 يوم

التحقيق في إمكانية استخدام مسارات الوكيل الفاشلة كبيانات ضبط دقيق

يقترح المؤلف فرضية مفادها أن مسارات الوكلاء الذين يستخدمون الأدوات ولكن فشلوا، مثل اختيار أدوات خاطئة أو حجوزات مشوهة، يمكن أن تكون بيانات قيمة لضبط دقيق لتدريب النماذج على الابتعاد عن هذه الأخطاء. يسعى المنشور للحصول على ملاحظات المجتمع حول ما إذا كان التدريب على مسارات الفشل المصححة فعالاً أم ضاراً.

media Hugging Face Forums · منذ 14 يوم · 3 مشاهدات

تفصل PIN v2 عرض النموذج عن تكلفة التخزين عبر ربط الأوزان

تُقدم بنية PIN الإصدار الثاني طريقة لاختيار حجم الشبكة العصبية وسرعة الاستدلال مسبقاً قبل التدريب باستخدام ربط الأوزان. تجبر هذه التقنية مجموعات من الخلايا على الاحتفاظ بقيم متطابقة، مما يسمح للشبكة بالحفاظ على عرضها مع تقليل عدد الأوزان المخزنة بشكل كبير.