Research paper
arxiv arXiv cs.AI · منذ 2 ساعة · 9 مشاهدات

يتيح AIDE^2 التحسين الذاتي المتكرر لوكلاء البحث في الذكاء الاصطناعي

يقدم الباحثون نظام AIDE^2، الذي يطبق حلقة من التحسين الذاتي المتكرر لوكيل بحث ذكي من خلال تحسين شيفرته الخاصة. يقترح النظام تغييرات على منطقِه الداخلي، ويقيّم النسخ المعدّلة في مهام البحث والتطوير للذكاء الاصطناعي، ويحتفظ فقط بتحسينات التي حققت أفضل أداء في التقييمات المخفية.

arxiv arXiv cs.AI · منذ 3 ساعة WebArena · 45.3% · 13 مشاهدة

تحويل "Growing Harness" التحكم المتكرر للوكيل إلى كود قابل لإعادة الاستخدام عبر التدريب الموجه بالفشل

يقدم المؤلفون "Growing Harness"، وهو نموذج تدريبي يتعلم بنية تحكم الوكيل من ملاحظات المهمة بدلاً من الاعتماد على السقالات التقليدية الثقيلة بالسياق. ومن خلال تحويل قرارات التحكم المتكررة إلى كود قابل للتنفيذ وحجز استدعاءات نماذج اللغات الكبيرة (LLM) للاستدلال الدلالي، تهدف هذه الطريقة إلى إنشاء وكلاء متخصصين قابلين لإعادة الاستخدام.

arxiv arXiv cs.LG · منذ 4 ساعة · 11 مشاهدة

يتيح AIDE^2 التحسين الذاتي المتكرر لوكلاء أبحاث الذكاء الاصطناعي

يقدم الباحثون نظام AIDE^2، الذي يطبق حلقة من التحسين الذاتي المتكرر لوكيل أبحاث ذكاء اصطناعي متقدم من خلال تحسين شيفرته الخاصة. يقترح النظام تغييرات على منطقِه الداخلي، ويقيّم الإصدارات المعدّلة في مهام بحث وتطوير الذكاء الاصطناعي، ويحتفظ فقط بتلك التحديثات التي تحقق أفضل أداء في التقييمات المخفية.

arxiv arXiv cs.CL · منذ 7 ساعة · 11 مشاهدة

TelecomGPT-R1: تدريب موحد ما بعد التدريب للاستدلال عبر مهام اتصالات متنوعة

يقدم الباحثون TelecomGPT-R1، وهو عائلة من نماذج استدلال الاتصالات المفتوحة المصدر والموحدة، مصممة لأتمتة المهام الهندسية من خلال الاستدلال على المعايير والتكوينات والسجلات. يتناول النموذج قيود نماذج الذكاء الاصطناعي التوليدية العامة والمتخصصة الحالية من خلال نهج هيكلي يغطي محاور البروتوكول والمعرفة والنمذجة والأعطال.

arxiv arXiv cs.LG · منذ 1 يوم HealthBench · 50.1% · 10 مشاهدات

Fathom-Vaidya يحسّن الاستدلال الطبي باستخدام مكافآت قائمة على المعايير

يقدم المؤلفون Fathom-Vaidya، وهو نموذج بـ 30B معلمة يستخدم بيانات اصطناعية وتعلّم التعزيز القائم على المعايير لتعزيز الاستدلال التشخيصي والسريري في الرعاية الصحية. يطبق إطار التدريب أولاً RL الموجه بالقواعد على الأسئلة المستمدة من MedBullets للتشخيص، ثم يستخدم 5.3k سيناريوهات اصطناعية متعددة الأدوار بمعايير متعددة الأبعاد لمهام سريرية تفاعلية.

arxiv arXiv cs.AI · منذ 1 يوم HealthBench · 50.1% · 12 مشاهدة

Fathom-Vaidya يحسّن الاستدلال الطبي باستخدام مكافآت قائمة على المعايير

يقدم المؤلفون Fathom-Vaidya، وهو نموذج بـ 30 مليار معلمة يستخدم بيانات اصطناعية وتعلّم التعزيز القائم على المعايير لتعزيز كل من الاستدلال التشخيصي والإكلينيكي في الرعاية الصحية. يستهدف إطار التدريب أولاً الدقة التشخيصية باستخدام أسئلة مستمدة من MedBullets ثم يتعامل مع التفاعلات الإكلينيكية متعددة الأدوار عبر 5.3 ألف سيناريو تم إنشاؤه بمعايير متعددة الأبعاد.

arxiv arXiv cs.CL · منذ 1 يوم HealthBench · 50.1% · 12 مشاهدة

Fathom-Vaidya يحسّن الاستدلال الطبي باستخدام مكافآت قائمة على معايير التقييم

يقدم المؤلفون Fathom-Vaidya، وهو نموذج يحتوي على 30 مليار معلمة يستخدم بيانات اصطناعية وتعلّم التعزيز القائم على معايير التقييم لتعزيز كل من الاستدلال التشخيصي والسريري في الرعاية الصحية.

lab Microsoft Research Blog · منذ 2 يوم · 29 مشاهدة

مايكروسوفت تطلق RetroChimera للتنبؤ بالتخليق العكسي

نشرت مايكروسوفت ريسيرش وأصدرت كود RetroChimera كمصدر مفتوح، وهو إطار عمل جديد للتنبؤ بالتخليق العكسي يدمج نموذجين متكاملين لاقتراح مسارات تخليق عالية الجودة. يدمج النظام R-SMILES 2، وهو نموذج من نوع Transformer مُنشأ من الصفر، مع NeuralLoc، وهو نموذج قائم على الشبكات العصبية البيانية (GNN)، باستخدام استراتيجية تجميع مُتعلَّمة لترتيب التنبؤات.

arxiv arXiv cs.AI · منذ 2 يوم · 18 مشاهدة

CodeMidas يوسع بيئات التعلم بالتعزيز للبرمجة الوكيلية باستخدام الكود المصدري

يقدم الباحثون CodeMidas، وهو خط أنابيب وكيلي يبني بيئات التعلم بالتعزيز من الوظائف المُنفذة في مستودعات الكود المصدري مفتوح المصدر، باستخدام الكود المصدري كإدخال وحيد. تقوم الطريقة بتخصيص الحوسبة الوكيلية لاستكشاف الوظائف، وبناء اختبارات مبنية على التنفيذ، والتحقق من صحة المهام عبر عمليات تشغيل متكررة، مما يؤدي إلى مجموعة بيانات تحتوي على 5,545 مهمة تدريب عبر 23 لغة برمجة. يؤدي تدريب MiMo-V2.5 على هذه المهام باستخدام GRPO إلى تحسين الأداء في خمسة معايير متنوعة، بما في ذلك DeepSWE (+11.7%) وProgramBench (+17%) وTerminal-Bench v2.1 (+8.5%). يشير تحليل المسارات إلى أن الوكيل المدرب بالتعلم بالتعزيز يظهر سلوكيات أفضل مثل زيادة استكشاف قاعدة الكود وتنوع أكبر في التحقق الذاتي. تؤسس هذه النتائج الكود المصدري كأساس قابل للتوسع لبناء بيئات التعلم بالتعزيز التي تحسن وكلاء البرمجة عبر مهام برمجية متنوعة.

arxiv arXiv cs.CL · منذ 2 يوم · 10 مشاهدات

TrialAtlas: نظام متعدد الوكلاء يحسّن تقييم مخاطر تصميم التجارب السريرية

أطلق الباحثون TrialAtlas، وهي منظمة بحثية متعددة الوكلاء مدعومة بالذاكرة مصمّمة لمساعدة تخطيط التطوير السريري (CDP). ينسق النظام وكلاء متخصصين لتركيب الأدبيات، والاستخبارات التنافسية، والتحليل التنظيمي لتوقع مخاطر التطوير.

media Hugging Face Forums · منذ 3 يوم · 16 مشاهدة

باحث يبحث عن مُعلِّم مستقل واحد لحل غموض اتفاق نماذج اللغات الكبيرة

يطلب باحث مُعلِّماً بشرياً مستقلاً واحداً لتصنيف 100 مشهد سردي تركي لتحديد ما إذا كان انخفاض اتفاق المقيّمين يعود إلى الطبيعة التفسيرية للمهمة أو إلى تعريفات التضمين غير المحددة بدقة. وجدت الدراسة أن أربعة نماذج لغات كبيرة وكاشفاً قائماً على القواعد اتفق مع بعضها البعض ومع المرجع البشري عند مستوى يقارب الصدفة العشوائية، حيث تراوحت درجات كوهن κ بين 0.000 و0.185.

media Hugging Face Forums · منذ 3 يوم · 17 مشاهدة

GlucoEdge: التنبؤ باتجاهات الجلوكوز على الجهاز باستخدام كمّ INT8

نشر الباحث المستقل محمد منسي GlucoEdge، وهو دراسة هندسية توضح خط أنابيب تعلم آلي على الجهاز بالكامل للتنبؤ باتجاهات الجلوكوز لخمس فئات لمدة 15 دقيقة من بيانات مراقب الجلوكوز المستمر. تقدم الدراسة شبكة عصبية كونفولوشنية أحادية البعد (CNN) مدمجة تحتوي على 2,909 معلمة فقط، وتغطي سير العمل الكامل من PyTorch إلى التحويل إلى LiteRT.

media Hugging Face Forums · منذ 3 يوم · 18 مشاهدة

اقتراح: نقل معرفي تدريجي من Qwen 9B إلى 27B لنموذج ثابت الحجم 4B

يقترح مستخدم في منتديات Hugging Face تجربة في النقل المعرفي التدريجي، حيث يتعلم نموذج طالب ذو حجم ثابت (Qwen 4B) بشكل تسلسلي من نماذج معلمة أكبر فأكبر بدلاً من التعلم مباشرةً من الأكبر حجماً المتاح.

arxiv arXiv cs.LG · منذ 7 يوم · 20 مشاهدة

OpenAI تطلق Open-1B مع عملية تدريب قابلة للمراجعة بالكامل

أطلقت OpenAI نموذج Open-1B، وهو نموذج لغوي تم تدريبه في نظام حيث يمكن إعادة إنتاج كل عملية أثناء التدريب بشكل مستقل على عتاد تجاري متنوع بدقة بتية. يعالج هذا النهج مشكلات إمكانية إعادة الإنتاج الكامنة في النماذج مفتوحة المصدر من خلال فرض ترتيب محدد لمصادر عدم الحتمية، مثل اختزال نوى وحدة معالجة الرسومات وترتيب دفعات البيانات.

arxiv arXiv cs.AI · منذ 8 يوم · 24 مشاهدة

معاينة Atria Dawn: نموذج لغوي أساسي ذو قدرات وكيلة لأبحاث العلوم

يُعد Atria Dawn Preview نموذجًا لغويًا أساسيًا ذا قدرات وكيلة، صُمم لعمليات البحث العلمي وأعمال الهندسة، وتم تدريبه عبر خط أنابيب لتجارب قابلة للتحقق يربط التفاعلات الوسيطة بالأدوات بالبيئات القابلة للتنفيذ. وعلى مدار 16 معيارًا تغطي البحث الحقيقي، والهندسة، والعمل الرقمي، يتنافس النموذج مع الوكلاء المتقدمة ويحقق أعلى درجة مُبلغ عنها في خمسة منها.