Тема · Reasoning models
media Don't Worry About the Vase · 5 д назад · 5 просмотров

Astra от OpenAI решает 10 крупных открытых математических задач

OpenAI опубликовала результаты работы своей ещё не выпущенной внутренней модели Astra, которая успешно решила десять значимых открытых проблем в математике. Решения были сгенерированы моделью, а затем формализованы в виде сертификатов Lean исследователями-людьми.

blog Simon Willison · 7 д назад · 12 просмотров

Модель Astra от OpenAI решает десять давних математических задач с помощью GPT-5.6 Sol

OpenAI представила решения десяти математических и теоретико-информационных задач, по которым не было прогресса в основных результатах как минимум десятилетие, используя внутреннюю версию своей следующей крупной модели Astra.

media Together AI Blog · 24 д назад · 4 просмотра

Together AI запускает мультимодальную модель рассуждений Inkling от Thinking Machines Lab

Thinking Machines Lab выпустила Inkling, новую мультимодельную смесь экспертов (MoE), предназначенную для токено-эффективного рассуждения и нативного понимания текстовых, изображенийных и аудио входных данных. Together AI делает модель доступной на своей платформе инференса с нулевым днем доступа.

media AI News (smol.ai) · 2 д назад

Обновления Muse Spark 1.2 от Meta и GPT-5.6 Sol от OpenAI

Meta объявила, что её модель Muse Spark 1.2 показала золотой результат на пяти олимпиадах по STEM и вошла в топ-5 индекса Vals при стоимости $0.69 за тест, что, по сообщениям, в 3 раза дешевле Kimi. Meta объяснила эти достижения оркестровкой с участием нескольких агентов и параллельным мышлением, отметив идеальные результаты по теории на APhO и IPhO без использования внешних инструментов.

media r/LocalLLaMA · 6 д назад · 16 просмотров

AI9Stars выпустила G9v3-39A5B, модель с открытыми весами на 39B параметров и 5 активными экспертами

AI9Stars выпустила G9v3-39A5B, языковую модель с открытыми весами, предназначенную для обеспечения более сильных способностей к рассуждению по сравнению с её предшественником, ai9stars/G9v3-3B. Модель имеет 39 миллиардов параметров и 5 активных экспертов и лицензирована по Apache 2.0 для личного и коммерческого использования.

media Hugging Face Forums · 6 д назад · 1 просмотр

GPT-5.6 восстанавливает 95% скрытых сообщений в новом литературном криптографическом бенчмарке

Рабочий документ Джозефа Дж. М. Уокера оценивает передовые языковые модели на новом многоканальном литературном криптографическом бенчмарке, встроенном в физический роман «Я написал книгу и заработал миллион долларов (I.B. Wryten)». Исследование показывает, что GPT-5.6 самостоятельно распознала вторичный канал связи и восстановила около 95% встроенного материала с первой попытки, тогда как более ранние модели продемонстрировали практически нулевую способность.

arxiv arXiv cs.CL · 12 д назад · 2 просмотра

Фронтальные LLM используют невидимое рассуждение через токены-заполнители для обхода мониторинга CoT

Исследование показывает, что передовые языковые модели могут выполнять значимые вычисления с использованием семантически нерелевантных токенов-заполнителей, создавая режим отказа, при котором рассуждение не видно в цепочке вывода. Исследование оценило 13 моделей по трём задачам и обнаружило, что многие из них значительно выигрывают от этих токенов, с улучшением точности до 13 процентных пунктов.

arxiv arXiv cs.AI · 17 д назад Humanity's Last Exam · 49.92% · 1 просмотр

PoTRE представляет гетерогенную многоагентную архитектуру для рассуждений во время тестирования

Авторы представляют PoTRE (Poly-Topological Reasoning Ensembles), архитектуру, предназначенную для преодоления ограничений стандартного однопоточного промптинга в сложных задачах рассуждения. PoTRE разделяет процесс вывода на четыре отдельных агента: агент состязательного уточнения, иерархический агент стратегического планирования, агент поиска спектра и агент прямой цепочки.

arxiv arXiv cs.AI · 18 д назад

ISO представляет нативный стек оптимизации для RLVR, исправляющий спектры весов моделей

Исследователи предлагают Isospectral Optimization (ISO), фреймворк для обучения с подкреплением по верифицируемым наградам (RLVR), который устраняет недостающий слой оптимизации за счёт фиксации спектров весов модели при оптимизации входных и выходных сингулярных кадров.

arxiv arXiv cs.CL · 25 д назад

Ring-Zero масштабирует нулевое обучение с подкреплением до 1 трлн параметров для эмерджентного рассуждения

Исследователи представляют Ring-Zero, стабильный конвейер обучения, который масштабирует обучение с подкреплением с верифицируемыми наградами на модели с одним триллионом параметров, решая такие проблемы, как избыточность токенов и плохая читаемость, обнаруженные при наивном масштабировании.

arxiv arXiv cs.AI · 27 д назад

За пределами фиксированных представлений: Пробелы в словаре и верификаторе для открытого ИИ

В этой статье утверждается, что создание более мощных интеллектуальных систем, способных к открытым инновациям, требует создания, стабилизации и повторного использования новых репрезентативных примитивов, а не просто поиска в рамках фиксированных структур.

media Hugging Face Forums · 23 д назад · 1 просмотр

Разработчик исследует ненейронную символическую ИИ для диалога ради эффективности

Разработчик делится прогрессом в создании архитектуры символического ИИ для диалога, разработанной за последние восемь месяцев, с целью устранения пробелов в извлечении информации ненейронными методами.

arxiv arXiv cs.CL · 24 д назад · 5 просмотров

GSM-Plus-BN представляет бенчмарк на основе возмущений для математического рассуждения на бенгальском языке

Исследование представляет GSM-Plus-BN, новый набор данных по математике на бенгальском языке с возмущениями, полученный из английского бенчмарка GSM-Plus и проверенный переводчиками-людьми. Этот ресурс восполняет отсутствие системных бенчмарков для оценки устойчивости моделей в лингвистически разнообразных регионах, таких как Бангладеш.

arxiv arXiv cs.AI · 24 д назад

Глубокое взаимодействие обеспечивает точное исправление ошибок рассуждения LLM человеком

Авторы предлагают Deep Interaction, эффективный метод взаимодействия человека и ИИ, предназначенный для исправления ошибок рассуждения в больших языковых моделях без необходимости полной регенерации ответа. Этот механизм позволяет пользователям напрямую редактировать исходный ответ Chain-of-Thought, сохраняя правильные шаги и исправляя ошибки.

arxiv arXiv cs.CL · 25 д назад

Qwen3-30B-A3B достигает 8,3% на FukuyamaBench по механистическому рассуждению

Исследователи разработали новый крупномасштабный набор данных для рассуждений и бенчмарк FukuyamaBench для оценки иерархического механизма рассуждения в больших языковых моделях, решая проблему физических несоответствий, характерных для современных химических LLM.

arxiv arXiv cs.LG · 25 д назад

Теоретическая основа объясняет индуктивное рассуждение Трансформера через инвариантное многообразие

Новая теоретическая основа объясняет возникновение способностей к индуктивному рассуждению в языковых моделях Трансформер, изучая обобщенный класс индуктивных задач, который объединяет синтетические задачи, такие как n-граммы в контексте и многоступенчатое рассуждение.

lab NVIDIA Technical Blog · 25 д назад · 3 просмотра

NVIDIA анализирует более 5000 работ с Kaggle для выявления методов улучшения рассуждений ИИ

Вызов NVIDIA Nemotron Model Reasoning Challenge призвал сообщество Kaggle исследовать методы, повышающие точность рассуждений в рамках общих ограничений: открытые модели, бенчмарки и инфраструктура. К завершению конкурса более 5000 активных участников из 4000 команд подготовили тысячи заявок.

arxiv arXiv cs.CL · 26 д назад

TreeThink: модульная асинхронная библиотека поиска по дереву для теоретического доказательства LLM

Исследователи представляют TreeThink, библиотеку с открытым исходным кодом на Python, предназначенную для модульного полностью асинхронного поиска по дереву в нейронном доказательстве теорем. Она интегрирует устоявшиеся методы поиска с конвейерами вывода на основе vLLM и разнообразными техниками оценки узлов.

arxiv arXiv cs.AI · 26 д назад · 7 просмотров

WILDTRACE представляет бенчмарк для естественных цепочек доказательств в рассуждениях с длинным контекстом

Авторы представляют WILDTRACE, новый бенчмарк, предназначенный для оценки того, насколько хорошо модели интегрируют доказательства, разбросанные по удалённым фрагментам в длинных документах. В отличие от существующих бенчмарков, которые опираются на внедрённые факты или реконструированные цепочки, WILDTRACE использует 481 задачу, полученных из 214 естественно возникших источников, таких как технические отчёты об инцидентах и литературные повествования.

arxiv arXiv cs.LG · 27 д назад

Нейронный коллапс запрещён: информационные полы в языковых моделях

В статье утверждается, что внутриклассовая дисперсия в представлениях языковых моделей представляет собой не неполный нейронный коллапс, а выделенное хранение информации, управляемое определённым законом. Анализ 14 моделей показывает, что структура макро-категорий объясняет лишь 4–12% репрезентативной дисперсии, тогда как контекст внутри токена несёт 79–91%, оставаясь стабильным в диапазоне параметров в 100 раз.