الموضوع · Reasoning models
media Don't Worry About the Vase · منذ 11 يوم · 5 مشاهدات

أسترا من أوبن إيه آي تحل 10 مسائل رياضية مفتوحة كبرى

أطلقت أوبن إيه آي نتائج نموذجها الداخلي غير المُصدر، أسترا، الذي نجح في حل عشرة مسائل مفتوحة مهمة في الرياضيات. تم توليد الحلول بواسطة النموذج ثم صاغها باحثون بشريون إلى شهادات لين (Lean).

blog Simon Willison · منذ 2 يوم · 10 مشاهدات

باحثون يسرقون مسارات الاستدلال من واجهات برمجة التطبيقات الخاصة لنماذج اللغات الكبيرة عبر هجمات إعادة التشغيل

تُظهر ورقة بحثية أنه يمكن استخراج كتل التفكير المتسلسل المشفرة التي تُرجعها أنثروبيك وأوبن إيه آي وجوجل كنص واضح. استغل المؤلفون ثغرةً حيث كانت النماذج داخل العائلة نفسها تشارك مفاتيح التشفير، مما مكنهم من إعادة تشغيل المسارات إلى نماذج أخفّ في القوة.

media Latent Space · منذ 3 يوم · 11 مشاهدة

باحثون يفكّون تشفير مسارات الاستدلال من واجهات برمجة تطبيقات Claude وGPT وGemini

تُظهر ورقة بحثية جديدة أنه يمكن فك تشفير كتل الاستدلال المشفرة من النماذج المتقدمة مثل Claude وGPT وGemini وإعادة تشغيلها لاستخراج بيانات سلسلة التفكير المخفية. يُظهر المؤلفون كيفية نقل هذه الكتل الموقعة إلى نماذج أضعف أو جلسات مختلفة لنقل الأفكار الكامنة، متجاوزين بذلك جهود إخفاء الهوية التي تبذلها الشركات المزودة للخدمة.

arxiv arXiv cs.LG · منذ 4 يوم · 11 مشاهدة

باحثون يستغلون إعادة استخدام التشفير عبر الجلسات لسحب مسارات الاستدلال من واجهات برمجة تطبيقات نماذج اللغة الكبيرة

حدد الباحثون ثغرة في كيفية تعامل مقدمي نماذج اللغة الكبيرة الرائد مع مسارات الاستدلال خطوة بخطوة، والتي تُرجع ككتل مشفرة للاستخدام من جانب العميل. وجدوا أن هذه الكتل المشفرة متوافقة تمامًا وقابلة للتبديل عبر جلسات مختلفة ومستخدمين ونماذج داخل نظام بيئي لنفس المزود.

arxiv arXiv cs.AI · منذ 4 يوم · 17 مشاهدة

مهاجمون يسرقون مسارات الاستدلال من واجهات برمجة تطبيقات النماذج اللغوية الكبيرة الخاصة عبر ثغرة في الكتلة المشفرة

حدد باحثون عيباً معمارياً في كيفية تعامل مقدمي نماذج لغوية كبيرة رائدين مع مسارات الاستدلال خطوة بخطوة. يعيد هؤلاء الموفدون هذه المسارات ككتل مشفرة إلى العملاء، لكن الدراسة وجدت أن هذه الكتل متوافقة تماماً وقابلة للتبديل عبر جلسات مختلفة ومستخدمين ونماذج داخل بيئة مقدم الخدمة.

media AI News (smol.ai) · منذ 8 يوم · مشاهدة واحدة

تحديثات Muse Spark 1.2 من Meta و GPT-5.6 Sol من OpenAI

أعلنت Meta أن نموذجها Muse Spark 1.2 حقق أداءً بميدالية ذهبية في أولمبيادات STEM الخمسة ودخل المراكز الخمسة الأولى في مؤشر Vals بسعر $0.69/اختبار، وأبلغ عنه بأنه أرخص بـ 3 مرات من Kimi. نسبت Meta هذه المكاسب إلى التنسيق متعدد الوكلاء مع الاستدلال المتوازي، مشيرة إلى درجات نظرية مثالية في APhO و IPhO دون أدوات خارجية.

media r/LocalLLaMA · منذ 12 يوم · 21 مشاهدة

AI9Stars تطلق G9v3-39A5B، نموذج بأوزان مفتوحة يحتوي على 39 مليار معلمة و5 خبراء نشطين

أطلقت AI9Stars نموذج G9v3-39A5B، وهو نموذج لغوي بأوزان مفتوحة مصمم لتقديم قدرات استدلال أقوى من سلفه، ai9stars/G9v3-3B. يتميز النموذج بـ 39 مليار معلمة و5 خبراء نشطين وهو مرخص بموجب رخصة Apache 2.0 للاستخدام الشخصي والتجاري.

media Hugging Face Forums · منذ 12 يوم · 3 مشاهدات

GPT-5.6 تستعيد 95% من الرسائل المخفية في معيار التشفير الأدبي غير المرئي

تقيّم ورقة عمل من تأليف جوزيف جيه إم ووكر نماذج اللغة المتطورة على معيار تشفير أدبي متعدد القنوات وغير مرئي، مُضمّن في الرواية المادية "كتبت كتابًا وكسبت مليون دولار (آي. بي. رايتن)". وجدت الدراسة أن GPT-5.6 اعترفت بشكل مستقل بقناة الاتصال الثانوية واستعادت حوالي 95% من المادة المُضمّنة في مرورها الأول، بينما أظهرت النماذج السابقة قدرة فعالة تبلغ 0%.

arxiv arXiv cs.CL · منذ 18 يوم · 3 مشاهدات

تستخدم نماذج الذكاء الاصطناعي المتقدمة الاستدلال الخفي عبر رموز الحشو لتجاوز مراقبة سلسلة التفكير

أظهرت دراسة أن النماذج اللغوية المتقدمة يمكنها إجراء حسابات ذات عواقب باستخدام رموز حشو غير ذات دلالة، مما يخلق وضع فشل لا يظهر فيه الاستدلال في سلسلة مخرجات التفكير. قُيم البحث 13 نموذجاً عبر ثلاث مهام ووجد أن العديد منها تستفيد بشكل كبير من هذه الرموز، مع تحسن في الدقة يصل إلى 13 نقطة مئوية.

arxiv arXiv cs.AI · منذ 23 يوم Humanity's Last Exam · 49.92% · مشاهدة واحدة

PoTRE تقدم إطار عمل متعدد الوكلاء غير المتجانس للاستدلال أثناء الاختبار

يقدم المؤلفون PoTRE (تجمعات الاستدعاء متعددة الطوبولوجيا)، وهو إطار عمل مصمم لمعالجة قيود التوجيه أحادي التدفق القياسي في مهام الاستدلال المعقدة. يفكك PoTRE الاستنتاج إلى أربعة وكلاء متميزين: وكيل تحسين معادٍ، وكيل تخطيط استراتيجي هرمي، وكيل بحث طيفي، ووكيل سلسلة مباشر.

arxiv arXiv cs.AI · منذ 24 يوم

تقدم ISO مجموعة تحسين أصلية لـ RLVR تصلح أطياف أوزونة النموذج

يقترح الباحثون Isospectral Optimization (ISO)، وهو إطار لتعلم التعزيز مع المكافآت القابلة للتحقق (RLVR) يعالج طبقة التحسين المفقودة عن طريق الحفاظ على أطياف أوزونة النموذج ثابتة أثناء تحسين الإطارات المفردة للإدخال والإخراج.