Diffusion-Proof es el primer marco para entrenar y aplicar modelos de lenguaje de difusión para la demostración formal de teoremas. Introduce dLLM-Prover-7B para la escritura completa de pruebas con coherencia a largo plazo y dLLM-Corrector-7- para la corrección local de pruebas utilizando información bidireccional. El marco supera las líneas base de LLMs autoregresivos en un 1.61% en ProofNet-Test y un 6.14% en MiniF2F-Test, y resuelve un problema del IMO más allá de la capacidad de DeepSeek-Prover-V2-7B.
Diffusion-Proof: Primer marco para LLMs de difusión en demostración formal de teoremas
Lean como Oráculo de Recompensa Verificado por Proceso en RL para Demostración de Teoremas
Este trabajo muestra que Lean puede servir como un oráculo simbólico de proceso, proporcionando retroalimentación fina y verificada durante el aprendizaje por refuerzo. Al analizar los intentos de demostración en secuencias de tácticas y usar la elaboración de Lean para marcar pasos válidos y primeros fallos, el sistema genera señales de recompensa densas basadas en teoría de tipos. Los experimentos demuestran que la supervisión a nivel de táctica supera a los métodos solo de resultado en benchmarks como MiniF2F y ProofNet, destacando el papel de Lean tanto como evaluador como fuente de recompensa de entrenamiento.
La Red de Sincronización Frustrada supera a los Transformers
La Red de Sincronización Frustrada (FSN) logra una pérdida de validación menor que un transformer RoPE-SwiGLU en cada época en tareas de texto y código a nivel de caracteres. Con un millón de parámetros, FSN converge a una pérdida de validación de 1.5953 ± 0.0014, superando la pérdida convergida del transformer de 1.611. Esta ventaja persiste hasta cuatro millones de parámetros, con evaluaciones en curso más allá de esa escala.
Revisión de la receta de post-entrenamiento de Frontier con Finbarr Timbers
El podcast analiza la evolución de las recetas de post-entrenamiento en modelos de lenguaje grandes, desde InstructGPT hasta los modelos frontier de 2026. Destaca la Distilación On-Policy Multi-Maestro (MOPD) como el patrón dominante, donde los modelos especialistas por dominio se entrenan y luego se destilan en un modelo estudiante general mediante distilación on-policy, escalando a más de 10 maestros en modelos como DeepSeek V4 y Nemotron 3 Ultra.
Comparativa de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 y Grok 3 Beta
Un análisis comparativo evalúa las capacidades de Claude 3.7 Sonnet, Claude 3.5 Sonnet, OpenAI o3-mini, DeepSeek R1 y Grok 3 Beta en benchmarks de matemáticas, programación y razonamiento.
Anthropic lanza Claude 3.7 Sonnet con control dinámico de razonamiento
Anthropic ha lanzado Claude 3.7 Sonnet, un modelo diseñado para casos de uso empresarial y de desarrolladores en el mundo real, en lugar de solo optimización de benchmarks. El lanzamiento introduce la capacidad de cambiar dinámicamente entre modos de razonamiento estándar y avanzado, permitiendo a los usuarios controlar la cantidad de tokens asignados al "tiempo de pensamiento".