أسترا من أوبن إيه آي تحل 10 مسائل رياضية مفتوحة كبرى
أطلقت أوبن إيه آي نتائج نموذجها الداخلي غير المُصدر، أسترا، الذي نجح في حل عشرة مسائل مفتوحة مهمة في الرياضيات. تم توليد الحلول بواسطة النموذج ثم صاغها باحثون بشريون إلى شهادات لين (Lean).
أطلقت أوبن إيه آي نتائج نموذجها الداخلي غير المُصدر، أسترا، الذي نجح في حل عشرة مسائل مفتوحة مهمة في الرياضيات. تم توليد الحلول بواسطة النموذج ثم صاغها باحثون بشريون إلى شهادات لين (Lean).
أطلقت OpenAI حلولاً لعشرة مسائل في الرياضيات وعلوم الكمبيوتر النظرية لم تشهد أي تقدم في نتائجها الرئيسية لمدة عشر سنوات على الأقل، باستخدام نسخة داخلية من نموذجها الرئيسي القادم، Astra.
تُظهر ورقة بحثية أنه يمكن استخراج كتل التفكير المتسلسل المشفرة التي تُرجعها أنثروبيك وأوبن إيه آي وجوجل كنص واضح. استغل المؤلفون ثغرةً حيث كانت النماذج داخل العائلة نفسها تشارك مفاتيح التشفير، مما مكنهم من إعادة تشغيل المسارات إلى نماذج أخفّ في القوة.
تُظهر ورقة بحثية جديدة أنه يمكن فك تشفير كتل الاستدلال المشفرة من النماذج المتقدمة مثل Claude وGPT وGemini وإعادة تشغيلها لاستخراج بيانات سلسلة التفكير المخفية. يُظهر المؤلفون كيفية نقل هذه الكتل الموقعة إلى نماذج أضعف أو جلسات مختلفة لنقل الأفكار الكامنة، متجاوزين بذلك جهود إخفاء الهوية التي تبذلها الشركات المزودة للخدمة.
حدد الباحثون ثغرة في كيفية تعامل مقدمي نماذج اللغة الكبيرة الرائد مع مسارات الاستدلال خطوة بخطوة، والتي تُرجع ككتل مشفرة للاستخدام من جانب العميل. وجدوا أن هذه الكتل المشفرة متوافقة تمامًا وقابلة للتبديل عبر جلسات مختلفة ومستخدمين ونماذج داخل نظام بيئي لنفس المزود.
حدد باحثون عيباً معمارياً في كيفية تعامل مقدمي نماذج لغوية كبيرة رائدين مع مسارات الاستدلال خطوة بخطوة. يعيد هؤلاء الموفدون هذه المسارات ككتل مشفرة إلى العملاء، لكن الدراسة وجدت أن هذه الكتل متوافقة تماماً وقابلة للتبديل عبر جلسات مختلفة ومستخدمين ونماذج داخل بيئة مقدم الخدمة.
أعلنت Meta أن نموذجها Muse Spark 1.2 حقق أداءً بميدالية ذهبية في أولمبيادات STEM الخمسة ودخل المراكز الخمسة الأولى في مؤشر Vals بسعر $0.69/اختبار، وأبلغ عنه بأنه أرخص بـ 3 مرات من Kimi. نسبت Meta هذه المكاسب إلى التنسيق متعدد الوكلاء مع الاستدلال المتوازي، مشيرة إلى درجات نظرية مثالية في APhO و IPhO دون أدوات خارجية.
أطلقت AI9Stars نموذج G9v3-39A5B، وهو نموذج لغوي بأوزان مفتوحة مصمم لتقديم قدرات استدلال أقوى من سلفه، ai9stars/G9v3-3B. يتميز النموذج بـ 39 مليار معلمة و5 خبراء نشطين وهو مرخص بموجب رخصة Apache 2.0 للاستخدام الشخصي والتجاري.
تقيّم ورقة عمل من تأليف جوزيف جيه إم ووكر نماذج اللغة المتطورة على معيار تشفير أدبي متعدد القنوات وغير مرئي، مُضمّن في الرواية المادية "كتبت كتابًا وكسبت مليون دولار (آي. بي. رايتن)". وجدت الدراسة أن GPT-5.6 اعترفت بشكل مستقل بقناة الاتصال الثانوية واستعادت حوالي 95% من المادة المُضمّنة في مرورها الأول، بينما أظهرت النماذج السابقة قدرة فعالة تبلغ 0%.
أظهرت دراسة أن النماذج اللغوية المتقدمة يمكنها إجراء حسابات ذات عواقب باستخدام رموز حشو غير ذات دلالة، مما يخلق وضع فشل لا يظهر فيه الاستدلال في سلسلة مخرجات التفكير. قُيم البحث 13 نموذجاً عبر ثلاث مهام ووجد أن العديد منها تستفيد بشكل كبير من هذه الرموز، مع تحسن في الدقة يصل إلى 13 نقطة مئوية.
يقدم المؤلفون PoTRE (تجمعات الاستدعاء متعددة الطوبولوجيا)، وهو إطار عمل مصمم لمعالجة قيود التوجيه أحادي التدفق القياسي في مهام الاستدلال المعقدة. يفكك PoTRE الاستنتاج إلى أربعة وكلاء متميزين: وكيل تحسين معادٍ، وكيل تخطيط استراتيجي هرمي، وكيل بحث طيفي، ووكيل سلسلة مباشر.
يقترح الباحثون Isospectral Optimization (ISO)، وهو إطار لتعلم التعزيز مع المكافآت القابلة للتحقق (RLVR) يعالج طبقة التحسين المفقودة عن طريق الحفاظ على أطياف أوزونة النموذج ثابتة أثناء تحسين الإطارات المفردة للإدخال والإخراج.
يشارك مطور تقدمًا في بنية ذكاء اصطناعي رمزية للمحادثة تم تطويرها على مدار الثمانية أشهر الماضية، بهدف معالجة الفجوات في استخراج المعلومات غير العصبي.