Fuente · arXiv cs.LG
arxiv arXiv cs.LG · hace 21 d · 69 vistas

Los modelos Nemotron-3 de NVIDIA logran medalla de oro y puntuaciones por encima del nivel humano en la IOI 2026

Los investigadores han desarrollado una canalización post-entrenamiento para modelos de lenguaje grandes que les permite lograr un rendimiento de medalla de oro en programación competitiva. Al combinar el ajuste fino supervisado, el aprendizaje por refuerzo y una nueva estrategia impulsada por retroalimentación llamada GenCorrect, el sistema supera a los mejores concursantes humanos en el conjunto de problemas de la IOI 2026.

arxiv arXiv cs.LG · hace 1 d · 13 vistas

AIDE^2 permite la mejora recursiva de agentes de investigación con IA

Los investigadores presentan AIDE^2, un sistema que implementa un bucle de mejora recursiva para un agente de investigación con IA de vanguardia optimizando su propio código. El sistema propone cambios en su lógica interna, evalúa las versiones modificadas en tareas de I+D con IA y conserva únicamente aquellas actualizaciones que obtienen el mejor rendimiento en evaluaciones ocultas.

arxiv arXiv cs.LG · hace 1 d · 12 vistas

CliffCompaction reduce los costos de agentes de codificación de largo alcance hasta en un 50% mientras mantiene el rendimiento

Los investigadores presentan CliffCompaction, una técnica de autocompacción diseñada para agentes que manejan millones de tokens, la cual reduce los costos hasta en un 50% bajo contexto acotado. El método mantiene o mejora el rendimiento en Terminal-Bench y logra resultados de vanguardia en KernelBench al mantener la información fiel mediante truncamiento en lugar de reformulación.

arxiv arXiv cs.LG · hace 2 d HealthBench · 50.1% · 11 vistas

Fathom-Vaidya mejora el razonamiento médico con recompensas basadas en rúbricas

Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar el razonamiento diagnóstico y clínico en atención médica. El marco de entrenamiento primero aplica RL guiado por reglas a preguntas derivadas de MedBullets para el diagnóstico, luego utiliza 5.3k escenarios sintéticos multi-turno con rúbricas multidimensionales para tareas clínicas interactivas.

arxiv arXiv cs.LG · hace 8 d · 21 vistas

OpenAI lanza Open-1B con un entrenamiento completamente auditable

OpenAI ha lanzado Open-1B, un modelo de lenguaje entrenado bajo un régimen donde cada operación durante el entrenamiento es reproducible de forma independiente en hardware comercial heterogéneo con certeza a nivel de bits. Este enfoque aborda los problemas de reproducibilidad inherentes a los modelos de código abierto al imponer un orden definido sobre las fuentes de no determinismo, como las reducciones de kernels de GPU y el ordenamiento de lotes de datos.

arxiv arXiv cs.LG · hace 9 d Codeforces (Elo) · 98.2% · 26 vistas

Coliseo Estelar: un arnés para múltiples agentes enfocado en investigación matemática y de ciencias de la computación teórica a largo plazo

Los autores presentan Stellar Colosseum, un arnés agnóstico al modelo diseñado para distribuir la inferencia en investigaciones a largo plazo en matemáticas y ciencias de la computación teórica. El sistema explora estrategias alternativas antes de la construcción de pruebas, utiliza un filtro de preparación para determinar cuándo una ruta está lo suficientemente madura para su descomposición y representa el plan de prueba como subproblemas interdependientes a nivel de sección.

arxiv arXiv cs.LG · hace 17 d · 31 vistas

El método de incertidumbre especulativa reduce errores en agentes de ingeniería de software mediante el uso de un modelo borrador

Los autores presentan la Incertidumbre Especulativa (SU), una técnica que recupera una señal de fallo predictivo para agentes LLM de caja negra analizando únicamente sus tokens de salida, sin requerir acceso a logits, pesos o activaciones. Al invertir la decodificación especulativa, un modelo borrador pequeño con pesos abiertos puntúa la trayectoria del agente en una sola pasada hacia adelante para extraer características sensibles a la fase y calibrarlas contra un objetivo verificable.

arxiv arXiv cs.LG · hace 20 d · 43 vistas

FlashAttention-4 introduce Direct-P para inferencia y entrenamiento de FP4 consciente del hardware

FlashAttention-4 aborda las limitaciones de rendimiento de los núcleos de tensor de punto flotante de 4 bits (FP4) de Blackwell introduciendo nuevas rutas para la inferencia no causal y el entrenamiento causal. El método, llamado Direct-P, mapea las puntuaciones directamente a probabilidades FP4 para evitar los sobrecostos de conversión de softmax que suelen dominar una vez que los productos matriciales se reducen.

arxiv arXiv cs.LG · hace 22 d SWE-bench Verified · 16.6% · 38 vistas

CANOPY permite que Qwen3-14B encabece AppWorld usando RL solo con resultados

El artículo presenta CANOPY (Coverage-ANchored On-PolicY RL), un protocolo que aborda la escasez de señales y la deriva de políticas en el aprendizaje por refuerzo a largo plazo para modelos abiertos pequeños. Al escalar la exploración de la misma tarea y mantener las actualizaciones ancladas mediante KL, el método permite que los agentes aprendan eficazmente únicamente a partir de la verificación al final de la tarea.