Reasoning models
media AI News (smol.ai) · منذ 2 يوم

تحديثات Muse Spark 1.2 من Meta و GPT-5.6 Sol من OpenAI

أعلنت Meta أن نموذجها Muse Spark 1.2 حقق أداءً بميدالية ذهبية في أولمبيادات STEM الخمسة ودخل المراكز الخمسة الأولى في مؤشر Vals بسعر $0.69/اختبار، وأبلغ عنه بأنه أرخص بـ 3 مرات من Kimi. نسبت Meta هذه المكاسب إلى التنسيق متعدد الوكلاء مع الاستدلال المتوازي، مشيرة إلى درجات نظرية مثالية في APhO و IPhO دون أدوات خارجية.

media Don't Worry About the Vase · منذ 5 يوم · 5 مشاهدات

أسترا من أوبن إيه آي تحل 10 مسائل رياضية مفتوحة كبرى

أطلقت أوبن إيه آي نتائج نموذجها الداخلي غير المُصدر، أسترا، الذي نجح في حل عشرة مسائل مفتوحة مهمة في الرياضيات. تم توليد الحلول بواسطة النموذج ثم صاغها باحثون بشريون إلى شهادات لين (Lean).

media r/LocalLLaMA · منذ 6 يوم · 16 مشاهدة

AI9Stars تطلق G9v3-39A5B، نموذج بأوزان مفتوحة يحتوي على 39 مليار معلمة و5 خبراء نشطين

أطلقت AI9Stars نموذج G9v3-39A5B، وهو نموذج لغوي بأوزان مفتوحة مصمم لتقديم قدرات استدلال أقوى من سلفه، ai9stars/G9v3-3B. يتميز النموذج بـ 39 مليار معلمة و5 خبراء نشطين وهو مرخص بموجب رخصة Apache 2.0 للاستخدام الشخصي والتجاري.

media Hugging Face Forums · منذ 6 يوم · مشاهدة واحدة

GPT-5.6 تستعيد 95% من الرسائل المخفية في معيار التشفير الأدبي غير المرئي

تقيّم ورقة عمل من تأليف جوزيف جيه إم ووكر نماذج اللغة المتطورة على معيار تشفير أدبي متعدد القنوات وغير مرئي، مُضمّن في الرواية المادية "كتبت كتابًا وكسبت مليون دولار (آي. بي. رايتن)". وجدت الدراسة أن GPT-5.6 اعترفت بشكل مستقل بقناة الاتصال الثانوية واستعادت حوالي 95% من المادة المُضمّنة في مرورها الأول، بينما أظهرت النماذج السابقة قدرة فعالة تبلغ 0%.

arxiv arXiv cs.CL · منذ 12 يوم · مشاهدتان

تستخدم نماذج الذكاء الاصطناعي المتقدمة الاستدلال الخفي عبر رموز الحشو لتجاوز مراقبة سلسلة التفكير

أظهرت دراسة أن النماذج اللغوية المتقدمة يمكنها إجراء حسابات ذات عواقب باستخدام رموز حشو غير ذات دلالة، مما يخلق وضع فشل لا يظهر فيه الاستدلال في سلسلة مخرجات التفكير. قُيم البحث 13 نموذجاً عبر ثلاث مهام ووجد أن العديد منها تستفيد بشكل كبير من هذه الرموز، مع تحسن في الدقة يصل إلى 13 نقطة مئوية.

arxiv arXiv cs.AI · منذ 17 يوم Humanity's Last Exam · 49.92% · مشاهدة واحدة

PoTRE تقدم إطار عمل متعدد الوكلاء غير المتجانس للاستدلال أثناء الاختبار

يقدم المؤلفون PoTRE (تجمعات الاستدعاء متعددة الطوبولوجيا)، وهو إطار عمل مصمم لمعالجة قيود التوجيه أحادي التدفق القياسي في مهام الاستدلال المعقدة. يفكك PoTRE الاستنتاج إلى أربعة وكلاء متميزين: وكيل تحسين معادٍ، وكيل تخطيط استراتيجي هرمي، وكيل بحث طيفي، ووكيل سلسلة مباشر.

arxiv arXiv cs.AI · منذ 18 يوم

تقدم ISO مجموعة تحسين أصلية لـ RLVR تصلح أطياف أوزونة النموذج

يقترح الباحثون Isospectral Optimization (ISO)، وهو إطار لتعلم التعزيز مع المكافآت القابلة للتحقق (RLVR) يعالج طبقة التحسين المفقودة عن طريق الحفاظ على أطياف أوزونة النموذج ثابتة أثناء تحسين الإطارات المفردة للإدخال والإخراج.

arxiv arXiv cs.CL · منذ 24 يوم · 5 مشاهدات

GSM-Plus-BN يقدم معيارًا قائمًا على التشويش للاستدلال الرياضي البنغالي

تقدم الدراسة GSM-Plus-BN، وهو مجموعة بيانات رياضية بنغالية مشوشة جديدة مشتقة من معيار GSM-Plus الإنجليزي ومُحققة بواسطة مترجمين بشريين. يعالج هذا المورد نقص المعايير المنهجية لتقييم متانة النماذج في المناطق ذات التنوع اللغوي مثل بنغلاديش.

arxiv arXiv cs.AI · منذ 24 يوم

يتيح Deep Interaction تصحيحًا بشريًا دقيقًا لأخطاء الاستدلال في نماذج اللغات الكبيرة

يقترح المؤلفون طريقة تفاعل بين الإنسان والذكاء الاصطناعي فعالة تُعرف بـ Deep Interaction، مصممة لتصحيح أخطاء الاستدلال في نماذج اللغات الكبيرة دون الحاجة إلى إعادة توليد الرد الكامل. يسمح هذا الآلية للمستخدمين بتعديل رد Chain-of-Thought الأصلي مباشرةً، مع الحفاظ على الخطوات الدقيقة وتصحيح الأخطاء.

media Together AI Blog · منذ 25 يوم · 4 مشاهدات

Together AI تطلق نموذج التفكير متعدد الوسائط Inkling من Thinking Machines Lab

أطلقت Thinking Machines Lab نموذج Inkling، وهو نموذج جديد متعدد الوسائط من نوع Mixture-of-Experts مصمم للاستدعاء الفعال للرموز والفهم الأصلي لإدخالات النص والصوت والصور. توفر Together AI هذا النموذج على منصة الاستدلال الخاصة بها مع وصول فوري.

arxiv arXiv cs.CL · منذ 25 يوم

Ring-Zero يوسع التعلم المعزز الصفري إلى 1 تريليون معلمة للاستدلال الناشئ

يقدم الباحثون Ring-Zero، وهو خط أنابيب تدريب مستقر يوسع التعلم المعزز مع مكافآت قابلة للتحقق إلى نماذج تحتوي على تريليون معلمة، مما يعالج مشكلات مثل ازدواجية الرموز وسوء القراءة الموجودة في التوسع البدائي.

arxiv arXiv cs.LG · منذ 25 يوم

إطار نظري يفسر الاستدلال الاستقرائي في المحولات عبر متعدد السطوح الثابت

يشرح إطار نظري جديد ظهور قدرات الاستدلال الاستقرائي في نماذج اللغة المحوّلة من خلال دراسة فئة معمّمة من المهام الاستقرائية التي توحد المهام الاصطناعية مثل n-grams في السياق والاستدلال متعدد القفزات.

lab NVIDIA Technical Blog · منذ 25 يوم · 3 مشاهدات

تحليل NVIDIA لأكثر من 5,000 إدخال في Kaggle لتحديد تقنيات تحسين الاستدلال الذكي

دعت مسابقة NVIDIA Nemotron Model Reasoning Challenge مجتمع Kaggle لاستكشاف التقنيات التي تحسن دقة الاستدلال ضمن قيود مشتركة تتعلق بالنماذج المفتوحة، والمعايير المرجعية، والبنية التحتية. مع إغلاق المسابقة، كان هناك أكثر من 5,000 مشارك نشط عبر 4,000 فريق قد قدموا آلاف الإرسالات.

arxiv arXiv cs.CL · منذ 26 يوم

TreeThink: مكتبة بحث شجري غير متزامن ومعدني لإثبات النظريات باستخدام LLM

يقدم الباحثون TreeThink، وهي مكتبة بايثون مفتوحة المصدر مصممة للبحث الشجري المعدني وغير المتزامن بالكامل في إثبات النظريات العصبية. تدمج طرق البحث الراسخة مع خطوط أنابيب الاستدلال القائمة على vLLM وتقنيات تقييم العقد المتنوعة.

arxiv arXiv cs.AI · منذ 26 يوم · 7 مشاهدات

WILDTRACE تقدم معيارًا لتتبع الأدلة الطبيعية في الاستدلال طويل السياق

يقدم المؤلفون WILDTRACE، وهو معيار جديد مصمم لتقييم مدى قدرة النماذج على دمج الأدلة الموزعة عبر مقاطع بعيدة في المستندات الطويلة. على عكس المعايير الحالية التي تعتمد على حقائق مزروعة أو سلاسل تم هندستها عكسيًا، يستخدم WILDTRACE 481 مهمة مستمدة من 214 مصدرًا طبيعيًا، مثل تقارير الحوادث التقنية والسرد الأدبي.

arxiv arXiv cs.LG · منذ 27 يوم

انهيار الشبكة العصبية محظور: أرضيات المعلومات في نماذج اللغة

يجادل المقال بأن التباين داخل الفئة في تمثيلات نماذج اللغة ليس انهياراً عصبيًا غير مكتمل، بل هو تخزين معلومات مُخصص يخضع لقانون معين. يُظهر تحليل 14 نموذجًا أن بنية الفئة الكبرى تمثل فقط 4-12% من التباين التمثيلي، بينما يحمل سياق مستوى الرمز 79-91%، ويبقى مستقرًا عبر نطاق معلمات يبلغ 100x.