Тема · Reasoning models
lab OpenAI News · 17 д назад · 34 просмотра

OpenAI предупреждает об угрозах ИИ по мере масштабирования моделей рассуждений

В эссе под названием "Чужой разум" OpenAI обсуждает стремительное развитие языковых моделей, способных к рассуждениям, и потенциал рекурсивного самосовершенствования. Автор выражает обеспокоенность тем, что машинный интеллект превосходит человеческие возможности трансформирующим образом, что обусловлено прежде всего масштабированием вычислительных мощностей, а не специально спроектированными алгоритмами.

lab NVIDIA Research · 11 д назад · 12 просмотров

ReasAlign использует рассуждения для защиты агентов LLM от инъекций в промпты

Исследователи представили ReasAlign, решение на уровне модели, предназначенное для улучшения безопасности выравнивания больших языковых моделей (LLM) против косвенных атак с инъекцией промптов. Подход включает структурированные шаги рассуждения для анализа пользовательских запросов и выявления конфликтующих инструкций, обеспечивая непрерывность задач, задуманных пользователем.

media Don't Worry About the Vase · 9 д назад · 29 просмотров

Внутренняя модель OpenAI решила задачу Навье-Стокса за 88 часов

OpenAI использовала внутреннюю модель, превосходящую Astra, для решения задачи о конечного времени взрыва Навье-Стокса, выполнив задание за 88 часов после слухов о решении задач тысячелетия.

media AI News (smol.ai) · 10 д назад · 26 просмотров

OpenAI заявляет о результате сингулярности Навье-Стокса с помощью ИИ благодаря сотрудничеству 10 000 агентов

Аккаунты, связанные с OpenAI, сообщили, что усилия с использованием ИИ привели к результату, связанному с проблемой существования и регулярности Навье-Стокса, одной из задач тысячелетия. Утверждение касается совместной системы, включающей примерно 10 000 агентов, обученных в течение года с помощью многоагентного обучения с подкреплением.

media Ahead of AI · 14 д назад · 28 просмотров

OpenAI выпустила GPT-6 Astra с мощным 3D-рендерингом и управлением компьютером

OpenAI выпустила GPT-6 Astra, новую модель, которая значительно превосходит своего предшественника GPT-5.6 по бенчмаркам в написании текстов, математике и программировании. В релизе подчеркиваются исключительные возможности модели в 3D-рендеринге, анимации и взаимодействии с графическим пользовательским интерфейсом.

arxiv arXiv cs.CL · 7 ч назад · 11 просмотров

TelecomGPT-R1: Единое постобучение для рассуждений в гетерогенных телекоммуникационных задачах

Исследователи представляют TelecomGPT-R1, семейство открытых унифицированных моделей рассуждений для телекоммуникаций, предназначенных для автоматизации инженерных задач путем анализа стандартов, конфигураций и журналов. Модель решает ограничения существующих универсальных и специализированных LLM посредством структурированного подхода, охватывающего протоколы, знания, моделирование и устранение неисправностей.

media Hugging Face Forums · 1 д назад · 10 просмотров

CosmicUndercurrent выпускает Principia-Structurae-Realitatis для тестирования координации всей системы LLM

CosmicUndercurrent открыла исходный код модели-агностичной структуры рассуждений, предназначенной для проверки того, может ли структурное прайминг снизить глобальные несоответствия в больших языковых моделях. Проект, размещенный на платформе, исследует, улучшает ли двухэтапный процесс координацию всей системы по сравнению с локальной корректностью.

media Hugging Face Forums · 2 д назад · 15 просмотров

Предложение по системе декомпозиции пропозиций и противоречиво-управляемого рассуждения

Автор предлагает дизайн исследования для системы рассуждения, которая обнаруживает противоречия между двумя пропозициями путем их декомпозиции на более мелкие компоненты и поиска логических коллизий, вместо того чтобы полагаться на прямое суждение LLM.

blog Simon Willison · 21 д назад · 40 просмотров

Anthropic выпустила Claude Fable 5.1 с улучшенными показателями в задачах по программированию и науке

Anthropic выпустила Claude Fable 5.1, обновление модели, которое устанавливает новый стандарт для задач программирования, работы с знаниями и долгосрочного решения проблем. В релизе подчеркиваются значительные улучшения производительности на новом бенчмарке Terminal-Bench-Science 0.1, где Fable 5.1 достигла результата 52,6%, по сравнению с 24,7% для Fable 5, 29,0% для Opus 5 и 22,4% для GPT-5.6 Sol.

blog Simon Willison · 24 д назад · 42 просмотра

Tencent выпустила Hy4 Preview: текстовую LLM на 770B с контекстом 1M

Китайская компания Tencent выпустила Hy4 Preview, модель большого языка с открытыми весами для текстового ввода, имеющую 770 миллиардов общих параметров и 49 миллиардов активных параметров. Этот релиз значительно расширяет предыдущую модель Hy3 от июля, которая имела 295B общих параметров и контекстное окно на 256 000 токенов.

media r/LocalLLaMA · 29 д назад · 59 просмотров

IBM выпускает семейство Granite 4.2 с встроенным цепочечным мышлением

IBM выпустила семейство моделей для рассуждений Granite 4.2 с открытым исходным кодом, включающее флагманскую версию на 30B, среднюю на 8B и компактную на 3B. Эти модели используют нативные возможности цепочки мышления для улучшения результатов в математике, программировании и сложных многошаговых задачах.