Diffusion-Proof — первый фреймворк для обучения и применения диффузионных языковых моделей в формальной доказательной математике. Он вводит dLLM-Prover-7B для написания полных доказательств с долгосрочной согласованностью и dLLM-Corrector-7- для локальной коррекции доказательств с использованием обратной информации. Фреймворк превосходит автокоррекционные базовые LLM на 1,61% на ProofNet-Test и на 6,14% на MiniF2F-Test, и решает задачу IMO за пределами возможностей DeepSeek-Prover-V2-7B.
Diffusion-Proof: Первый фреймворк для диффузионных LLM в формальной доказательной математике
Лёгкий как процесс-верифицированный оракул вознаграждения в RL для доказательства теорем
Эта работа показывает, что Lean может служить симметрическим оракулом процесса, предоставляя детализированные, верифицированные сигналы обратной связи во время обучения с усилением. Разбивая попытки доказательства на последовательности тактик и используя элаборацию Lean для выделения корректных шагов и первых сбоев, система генерирует плотные сигналы вознаграждения, основанные на типовой теории. Эксперименты демонстрируют, что надзор на уровне тактик превосходит методы, основанные только на результатах, на бенчмарках, таких как MiniF2F и ProofNet, что подчёркивает роль Lean как оценщика и источника вознаграждения для обучения.
Сети с раздраженной синхронизацией превосходят трансформеры
Сети с раздраженной синхронизацией (FSN) достигают более низкой ошибки валидации, чем трансформер с RoPE-SwiGLU на уровне символов и задачах по коду на каждом эпохе. При одном миллионе параметров FSN достигает ошибки валидации 1,5953 ± 0,0014, что превосходит достигнутую ошибку трансформера 1,611. Это преимущество сохраняется до четырёх миллионов параметров, при этом продолжаются оценки на более высоких масштабах.
Обзор рецептур после тренировки в Frontier с Finbarr Timbers
Аудио-программа рассматривает эволюцию рецептур после тренировки в больших языковых моделях, от InstructGPT до моделей передовой эпохи 2026 года. В ней подчеркивается Multi-Teacher On-Policy Distillation (MOPD) как доминирующий паттерн, при котором специализированные модели для определённых областей тренируются, а затем дистиллируются в общую модель-ученика с помощью дистилляции на основе политики, масштабируясь до более чем 10 учителей в моделях, таких как DeepSeek V4 и Nemotron 3 Ultra.
Сравнение бенчмарков Claude 3.7 Sonnet, o3-mini, R1 и Grok 3 Beta
Сравнительный анализ оценивает возможности Claude 3.7 Sonnet, Claude 3.5 Sonnet, OpenAI o3-mini, DeepSeek R1 и Grok 3 Beta в задачах математики, программирования и рассуждений по результатам бенчмарков.
Anthropic выпустила Claude 3.7 Sonnet с динамическим управлением рассуждением
Anthropic выпустила Claude 3.7 Sonnet, модель, предназначенную для реальных бизнес- и разработческих задач, а не только для оптимизации бенчмарков. Выпуск включает возможность динамического переключения между стандартным и расширенным режимами рассуждения, позволяя пользователям контролировать количество токенов, выделяемых на «время размышления».