Un estudio de medición encuentra que 26 operadores semánticos post-hoc no mejoran la precisión en datos no vistos frente a Best-of-N en modelos pequeños de código congelados. Aunque dos operadores —la recuperación por capa de expresión y la parada temprana de consenso adaptativo— ofrecen beneficios en eficiencia computacional o recuperación de programas, ninguno supera a BoN en precisión. Los resultados destacan limitaciones sistémicas en la detección de errores y la cobertura, lo que sugiere que los arneses de modelos y la cobertura de errores deben mejorarse antes de considerar el razonamiento post-hoc.
Los operadores post-hoc no logran mejorar la precisión en modelos pequeños de código
CodeMidas escala entornos de aprendizaje por refuerzo para programación agéntica utilizando código fuente
Los investigadores presentan CodeMidas, una canalización agéntica que construye entornos de aprendizaje por refuerzo a partir de la funcionalidad implementada en repositorios de código abierto, utilizando el código fuente como única entrada. El método asigna cómputo agéntico para explorar la funcionalidad, construir pruebas basadas en la ejecución y validar tareas mediante repeticiones repetidas, lo que resulta en un conjunto de datos de 5.545 tareas de entrenamiento en 23 lenguajes de programación. Entrenar MiMo-V2.5 en estas tareas con GRPO mejora el rendimiento en cinco benchmarks diversos, incluyendo DeepSWE (+11,7%), ProgramBench (+17%) y Terminal-Bench v2.1 (+8,5%). El análisis de trayectorias indica que el agente entrenado con RL exhibe mejores comportamientos, como una mayor exploración del repositorio de código y una autoverificación más diversa. Estos resultados establecen el código fuente como una base escalable para construir entornos de RL que mejoran a los agentes de programación en diversas tareas de software.
Seguimiento: DeepSeek V4 Flash en 2x RTX PRO 6000 finaliza tareas de codificación reales más rápido que Sonnet y Opus, con calidad aproximada a la de Sonnet
Una evaluación de seguimiento compara el rendimiento de DeepSeek V4 Flash ejecutándose en dos GPUs RTX PRO 6000 usando vLLM, contrastándolo con modelos basados en API como Claude Sonnet y Opus en tareas de codificación del mundo real. El estudio encuentra que, aunque Opus y Fable mantienen una calidad de código superior, DeepSeek V4 Flash alcanza una calidad aproximadamente al nivel de Sonnet con tiempos de pared significativamente más rápidos.
La matriz de cobertura de señales: estratificación de errores de tipo y semánticos en la autoformalización de enunciados
Este artículo introduce una matriz de cobertura de señales para estratificar los errores de tipo y semánticos en la autoformalización de LLM, superando las métricas escalares de corrección de tipo. El marco clasifica las salidas en celdas de éxito verdadero, solo tipo, solo semántico o fallo en ambas categorías cruzando los resultados del elaborador de Lean con juicios de equivalencia semántica.
Localización automatizada de fallos semánticos en SysML v2 mediante LLMs aumentados con grafos de conocimiento
Este artículo presenta un marco de trabajo humano-en-el-bucle para identificar y reparar automáticamente errores semánticos en modelos SysML v2 que los compiladores no pueden detectar. El enfoque combina Pequeños Modelos de Lenguaje ajustados finamente con un grafo de conocimiento del dominio para fundamentar las sugerencias de reparación en restricciones de ingeniería válidas.
Destilación y ablación conscientes del contexto para Text2DSL
Un nuevo sistema Text2DSL utiliza destilación consciente del contexto con un contexto estructurado de gramática BNF, especificación de API y vocabulario de identificadores cerrados. Los estudios de ablación muestran que el vocabulario tiene el mayor impacto en la calidad semántica, mientras que la API y la BNF mejoran significativamente la validez estructural, confirmando que el contexto estructurado es un componente crítico y portador de carga.