Fuente · arXiv cs.CL
arxiv arXiv cs.CL · hace 21 d · 32 vistas

Los modelos NVIDIA Nemotron-3 logran rendimiento de medalla de oro en competiciones de programación IOI

NVIDIA ha desarrollado pipelines de post-entrenamiento para sus modelos de lenguaje Nemotron-3-Nano-CC y Nemotron-3-Ultra-CC con el fin de destacar en programación competitiva. Al combinar la curación a gran escala de problemas, trazas de razonamiento sintético, ajuste fino supervisado (SFT) y aprendizaje por refuerzo, el equipo creó sistemas especializados capaces de realizar razonamiento algorítmico de alto nivel.

arxiv arXiv cs.CL · hace 9 h

VHD-Play genera entornos de RL agéntico a partir de mecanismos resueltos

VHD-Play es una tubería que genera diversos entornos de aprendizaje por refuerzo agéntico muestreando y resolviendo modelos matemáticos antes de renderizar sus procesos de decisión como herramientas con estado. Este enfoque asegura que la dinámica ejecutable y las referencias de puntuación de trayectorias se hereden directamente del modelo resuelto, abordando los problemas de desalineación comunes en las tuberías de generación existentes.

arxiv arXiv cs.CL · hace 10 h SWE-Lancer · 51.47% · 1 vista

SkillGym internaliza habilidades humanas en LLMs para la resolución de problemas del mundo real

Los investigadores presentan SkillGym, un marco que transforma las habilidades de agentes escritas por humanos en entornos de entrenamiento ejecutables y verificables para agentes de modelos de lenguaje grandes. El sistema utiliza una canalización de habilidad a tarea para instanciar tareas concretas y verificar resultados con verificadores basados en código.

arxiv arXiv cs.CL · hace 1 d · 13 vistas

TelecomGPT-R1: Entrenamiento posterior unificado para el razonamiento en tareas de telecomunicaciones heterogéneas

Los investigadores presentan TelecomGPT-R1, una familia de modelos de razonamiento unificados de telecomunicaciones de código abierto diseñados para automatizar tareas de ingeniería mediante el razonamiento sobre estándares, configuraciones y registros. El modelo aborda las limitaciones de los LLMs existentes de propósito general y especializados a través de un enfoque estructurado que cubre ejes de protocolo, conocimiento, modelado y fallos.

arxiv arXiv cs.CL · hace 2 d · 12 vistas

AgentRouter reduce los costos de flujos de trabajo agénticos en un 72 % mediante el enrutamiento de modelos a nivel de paso

Los investigadores proponen AgentRouter, un clasificador ligero que optimiza flujos de trabajo agénticos multi-paso al enrutar los pasos individuales de la trayectoria a niveles de modelo apropiados, en lugar de utilizar un único modelo de vanguardia para todas las tareas. El sistema aborda la ineficiencia de los sistemas empresariales que desperdician del 60 % al 80 % de su presupuesto de inferencia en subtareas que modelos más pequeños pueden manejar con igual eficacia.

arxiv arXiv cs.CL · hace 3 d · 14 vistas

NemotronLabs lanza VoiceChat, un modelo de voz a voz en dúplex completo de código abierto con llamada de herramientas

NemotronLabs ha presentado VoiceChat, un modelo de código abierto de peso completo para conversión de voz a voz en dúplex completo, diseñado para integrar la escucha, la transcripción, el razonamiento y la habla dentro de una arquitectura de transmisión unificada. El sistema combina un codificador de voz en streaming y un modelo de lenguaje solo-decodificador con flujos de salida especializados en paralelo para texto de agente y llamadas de función estructuradas, junto con una rama RNN-T auxiliar para transcripción incremental del usuario.

arxiv arXiv cs.CL · hace 3 d · 12 vistas

TrialAtlas: un sistema multiagente mejora la evaluación de riesgos en el diseño de ensayos clínicos

Los investigadores han presentado TrialAtlas, una organización de investigación multiagente con memoria aumentada diseñada para asistir en la planificación del desarrollo clínico (CDP). El sistema coordina agentes especializados para la síntesis de literatura, inteligencia competitiva y análisis regulatorio, con el fin de anticipar los riesgos del desarrollo.

arxiv arXiv cs.CL · hace 7 d · 23 vistas

Modelos de vanguardia evaluados en el juego de preguntas log(N) sobre Wikipedia

Un estudio evalúa seis modelos de lenguaje de vanguardia en una tarea de comunicación entre dos agentes donde un interrogador identifica un objetivo a partir de N párrafos de Wikipedia utilizando exactamente log2(N) preguntas de sí/no. El experimento ejecutó 408 juegos en conjuntos de documentos de 4 a 1024 párrafos, revelando disparidades significativas en el rendimiento entre los modelos evaluados.

arxiv arXiv cs.CL · hace 9 d Codeforces (Elo) · 98.2% · 30 vistas

Stellar Colosseum aprovecha la inferencia multiagente para investigación matemática a largo plazo

Stellar Colosseum es un harness agnóstico al modelo diseñado para distribuir la inferencia en investigaciones de largo alcance en matemáticas y ciencias teóricas de la computación, abordando la falta de fiabilidad de los modelos de lenguaje en problemas complejos. El sistema explora estrategias alternativas antes de la construcción de pruebas, utiliza un gate de preparación para determinar cuándo una ruta está lo suficientemente madura para la descomposición, y representa el plan de prueba como subproblemas interdependientes a nivel de sección.

arxiv arXiv cs.CL · hace 14 d · 29 vistas

Ataque unidireccional a GLM-5.3-Flash revela fragilidad del alineamiento de seguridad en modelos MoE

Los investigadores demuestran que la ablación direccional, un ataque de caja blanca que elimina el rechazo proyectando fuera una única dirección desde los pesos, sigue siendo efectiva en modelos de vanguardia de mezcla de expertos (MoE) como GLM-5.3-Flash. El estudio muestra que, aunque el ataque sobrevive a la arquitectura, sus efectos se distribuyen entre los escritores de atención, densos y de expertos enrutados, en lugar de concentrarse en una sola ubicación.

arxiv arXiv cs.CL · hace 15 d SWE-bench Verified · 72.6% · 25 vistas

ExecCritic utiliza RL específico por rol para mejorar agentes de codificación mediante reparación guiada por pruebas

Los investigadores presentan ExecCritic, un marco que combina una estructura de verificar-revisar-corregir con aprendizaje por refuerzo específico por rol para potenciar agentes de codificación. El sistema separa la construcción de pruebas de la reparación del código fuente, utilizando un agente de Pruebas para generar pruebas nativas del repositorio y un agente de Reparación para revisar el código basándose en retroalimentación de ejecución.

arxiv arXiv cs.CL · hace 15 d · 25 vistas

TontaubeV1 permite texto-a-voz en streaming con contexto acotado

Los investigadores presentan TontaubeV1, un modelo de texto-a-voz que preserva la prosodia natural mientras habilita inferencia en streaming desde una única GPU de consumo. El sistema utiliza una representación DualCodec jerárquica a 12.5 Hz para separar las secuencias semánticas de los refinamientos acústicos, permitiendo la decodificación causal a pesar de la naturaleza no causal del códec subyacente.

arxiv arXiv cs.CL · hace 20 d · 37 vistas

VisCAD lanza una suite de modelos base con inteligencia multimodal para CAD industrial

Los investigadores presentan VisCAD, una suite de modelos base diseñada para ofrecer una generalización amplia y una capacidad sólida para el diseño realista de productos industriales. La suite aborda los desafíos de la generación a nivel de pieza a partir de diversas entradas como renders y texto, así como la generación a nivel de ensamblaje que involucra piezas interactivas.