Fuente · arXiv cs.AI
arxiv arXiv cs.AI · hace 21 d · 37 vistas

Los modelos Nemotron-3 de NVIDIA logran rendimiento de medalla de oro en competencias de programación de la IOI

NVIDIA ha desarrollado una canalización de postentrenamiento para sus modelos de lenguaje Nemotron-3, permitiendo que alcancen un rendimiento de nivel de medalla de oro en la Olimpiada Internacional de Informática (IOI). El enfoque combina la curación a gran escala de problemas, trazos de razonamiento sintéticos, ajuste fino supervisado y aprendizaje por refuerzo.

arxiv arXiv cs.AI · hace 21 h WebArena · 45.3% · 14 vistas

Growing Harness convierte el control recurrente de agentes en código reutilizable mediante entrenamiento guiado por fallos

Los autores presentan Growing Harness, un paradigma de entrenamiento que aprende la estructura de control de un agente a partir de la retroalimentación de la tarea, en lugar de depender de arneses estándar con gran carga contextual. Al convertir las decisiones de control recurrentes en código ejecutable y reservar las llamadas al LLM para el razonamiento semántico, el método busca crear agentes especialistas reutilizables.

arxiv arXiv cs.AI · hace 21 h · 15 vistas

CliffCompaction reduce los costos de los agentes de codificación en un 50 % mientras mantiene el rendimiento

Los investigadores presentan CliffCompaction, una técnica de autocompacción diseñada para reducir los costos de los agentes de codificación de largo alcance hasta en un 50 % bajo un contexto acotado. El método mantiene o mejora el rendimiento en Terminal-Bench y logra resultados de última generación en KernelBench al mantener la información compactada fiel mediante truncamiento en lugar de reformulación.

arxiv arXiv cs.AI · hace 23 h · 12 vistas

VideoX-Qwen presenta un marco centrado en datos para la edición de video basada en instrucciones

Los investigadores presentan VideoX-Qwen, un marco integrado que combina la construcción escalable de datos con el entrenamiento del modelo para avanzar en la edición de video general e impulsada por instrucciones. El sistema utiliza una canalización de producción que organiza modelos especializados para generar registros de edición direccional, resultando en más de 1.2 millones de muestras de alta calidad en tareas de adición, eliminación, reemplazo y atributos.

arxiv arXiv cs.AI · hace 2 d HealthBench · 50.1% · 14 vistas

Fathom-Vaidya mejora el razonamiento médico con recompensas basadas en rúbricas

Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar tanto el razonamiento diagnóstico como el clínico en atención médica. El marco de entrenamiento primero se centra en la precisión diagnóstica utilizando preguntas derivadas de MedBullets y luego aborda interacciones clínicas multironda a través de 5.3k escenarios generados con rúbricas multidimensionales.

arxiv arXiv cs.AI · hace 2 d · 12 vistas

AgentRouter reduce los costos de flujos de trabajo agénticos en un 72% mediante el enrutamiento de modelos a nivel de paso

Los investigadores proponen AgentRouter, un clasificador ligero que optimiza flujos de trabajo agénticos multi-paso al enrutar pasos individuales de la trayectoria a niveles de modelo apropiados, en lugar de utilizar modelos de vanguardia para cada tarea. El sistema aborda la ineficiencia de las soluciones existentes que ignoran la complejidad variable de las subtareas dentro de una sola sesión de agente.

arxiv arXiv cs.AI · hace 3 d · 13 vistas

NemotronLabs lanza VoiceChat, un modelo de voz a voz full-dúplex con capacidad de llamada a herramientas

NemotronLabs ha presentado NemotronLabs VoiceChat, un modelo de voz a voz full-dúplex de pesos abiertos que integra capacidades nativas de llamada a herramientas dentro de una arquitectura de transmisión unificada. El sistema combina un codificador de audio en streaming y un modelo de lenguaje solo-decodificador con flujos de salida paralelos para texto del agente y llamadas a funciones estructuradas, junto con una rama RNN-T auxiliar para transcripción incremental y un decodificador TTS en streaming.

arxiv arXiv cs.AI · hace 3 d · 19 vistas

CodeMidas escala entornos de aprendizaje por refuerzo para programación agéntica utilizando código fuente

Los investigadores presentan CodeMidas, una canalización agéntica que construye entornos de aprendizaje por refuerzo a partir de la funcionalidad implementada en repositorios de código abierto, utilizando el código fuente como única entrada. El método asigna cómputo agéntico para explorar la funcionalidad, construir pruebas basadas en la ejecución y validar tareas mediante repeticiones repetidas, lo que resulta en un conjunto de datos de 5.545 tareas de entrenamiento en 23 lenguajes de programación. Entrenar MiMo-V2.5 en estas tareas con GRPO mejora el rendimiento en cinco benchmarks diversos, incluyendo DeepSWE (+11,7%), ProgramBench (+17%) y Terminal-Bench v2.1 (+8,5%). El análisis de trayectorias indica que el agente entrenado con RL exhibe mejores comportamientos, como una mayor exploración del repositorio de código y una autoverificación más diversa. Estos resultados establecen el código fuente como una base escalable para construir entornos de RL que mejoran a los agentes de programación en diversas tareas de software.

arxiv arXiv cs.AI · hace 9 d · 26 vistas

Vista previa de Atria Dawn: modelo de lenguaje agénico fundamental para la investigación científica

Atria Dawn Preview es un modelo de lenguaje agénico fundamental diseñado para flujos de trabajo de investigación científica e ingeniería, entrenado mediante una Pipeline de Experiencia Verificable que conecta interacciones mediadas por herramientas con entornos ejecutables. En 16 benchmarks que abarcan investigación del mundo real, ingeniería y trabajo digital, el modelo es competitivo frente a agentes de vanguardia y alcanza la puntuación más alta reportada en cinco de ellos.

arxiv arXiv cs.AI · hace 9 d Codeforces (Elo) · 98.2% · 15 vistas

Stellar Colosseum aprovecha la inferencia multiagente para investigación en matemáticas y TCS a largo plazo

Los autores presentan Stellar Colosseum, un harness agnóstico al modelo diseñado para distribuir la inferencia entre problemas de investigación a largo plazo en matemáticas y ciencias de la computación teórica. El sistema explora estrategias alternativas antes de la construcción de pruebas, utiliza un filtro de preparación para determinar cuándo descomponer las rutas y representa los planes de prueba como subproblemas interdependientes.

arxiv arXiv cs.AI · hace 10 d · 27 vistas

La reevaluación por expertos revela que los modelos de vanguardia están cerca de la saturación en pruebas de física

Un estudio que audita seis pruebas de física ampliamente utilizadas encuentra que las puntuaciones bajas reportadas para los modelos de lenguaje de vanguardia se deben en gran medida a errores en la evaluación y no a deficiencias del modelo. Los expertos revisaron los enunciados de los problemas, las soluciones de referencia y las respuestas de los modelos, distinguiendo errores genuinos de equivocaciones del evaluador, referencias incorrectas y preguntas ambiguas.

arxiv arXiv cs.AI · hace 14 d · 19 vistas

Show-Harness permite a agentes VLM controlar robots mediante una interfaz semántica compacta

Los autores presentan Show-Harness, un Harness Encarnado que permite a los modelos de visión y lenguaje (VLM) controlar robots a través de una interfaz semántica compacta que vincula la intención con la acción. Este sistema expone unidades de acción semánticas discretas para el razonamiento VLM y utiliza intérpretes específicos de la encarnación para anclarlos en acciones locales del robot.

arxiv arXiv cs.AI · hace 15 d SWE-bench Verified · 72.6% · 30 vistas

ExecCritic utiliza RL específico por rol para mejorar agentes de codificación mediante reparación guiada por pruebas

ExecCritic introduce un marco que separa la construcción de pruebas de la reparación del código fuente para evitar una confianza falsa en los agentes de codificación. El sistema emplea un agente de prueba y un agente de reparación, ambos respaldados por Qwen-3.5-35B-A3B, entrenados por separado mediante aprendizaje por refuerzo.

arxiv arXiv cs.AI · hace 21 d · 35 vistas

DisCo destila repositorios de GitHub en más de 5.000 habilidades de investigación de IA

Los investigadores presentan DisCo, un agente autónico potenciado por habilidades diseñado para cerrar la brecha en el conocimiento operativo de la investigación de aprendizaje automático mediante la destilación de experiencia de repositorios de código. El sistema condensa proyectos de código abierto ampliamente utilizados en habilidades reutilizables y verificadas a través de dos formas complementarias: destilación agnóstica a tareas de ecosistemas generales y generación orientada a tareas para necesidades específicas.