Un nuevo sistema Text2DSL utiliza destilación consciente del contexto con un contexto estructurado de gramática BNF, especificación de API y vocabulario de identificadores cerrados. Los estudios de ablación muestran que el vocabulario tiene el mayor impacto en la calidad semántica, mientras que la API y la BNF mejoran significativamente la validez estructural, confirmando que el contexto estructurado es un componente crítico y portador de carga.
Destilación y ablación conscientes del contexto para Text2DSL
La matriz de cobertura de señales: estratificación de errores de tipo y semánticos en la autoformalización de enunciados
Este artículo introduce una matriz de cobertura de señales para estratificar los errores de tipo y semánticos en la autoformalización de LLM, superando las métricas escalares de corrección de tipo. El marco clasifica las salidas en celdas de éxito verdadero, solo tipo, solo semántico o fallo en ambas categorías cruzando los resultados del elaborador de Lean con juicios de equivalencia semántica.
Localización automatizada de fallos semánticos en SysML v2 mediante LLMs aumentados con grafos de conocimiento
Este artículo presenta un marco de trabajo humano-en-el-bucle para identificar y reparar automáticamente errores semánticos en modelos SysML v2 que los compiladores no pueden detectar. El enfoque combina Pequeños Modelos de Lenguaje ajustados finamente con un grafo de conocimiento del dominio para fundamentar las sugerencias de reparación en restricciones de ingeniería válidas.
Los operadores post-hoc no logran mejorar la precisión en modelos pequeños de código
Un estudio de medición encuentra que 26 operadores semánticos post-hoc no mejoran la precisión en datos no vistos frente a Best-of-N en modelos pequeños de código congelados. Aunque dos operadores —la recuperación por capa de expresión y la parada temprana de consenso adaptativo— ofrecen beneficios en eficiencia computacional o recuperación de programas, ninguno supera a BoN en precisión. Los resultados destacan limitaciones sistémicas en la detección de errores y la cobertura, lo que sugiere que los arneses de modelos y la cobertura de errores deben mejorarse antes de considerar el razonamiento post-hoc.
CodeMidas escala entornos de aprendizaje por refuerzo para programación agéntica utilizando código fuente
Los investigadores presentan CodeMidas, una canalización agéntica que construye entornos de aprendizaje por refuerzo a partir de la funcionalidad implementada en repositorios de código abierto, utilizando el código fuente como única entrada. El método asigna cómputo agéntico para explorar la funcionalidad, construir pruebas basadas en la ejecución y validar tareas mediante repeticiones repetidas, lo que resulta en un conjunto de datos de 5.545 tareas de entrenamiento en 23 lenguajes de programación. Entrenar MiMo-V2.5 en estas tareas con GRPO mejora el rendimiento en cinco benchmarks diversos, incluyendo DeepSWE (+11,7%), ProgramBench (+17%) y Terminal-Bench v2.1 (+8,5%). El análisis de trayectorias indica que el agente entrenado con RL exhibe mejores comportamientos, como una mayor exploración del repositorio de código y una autoverificación más diversa. Estos resultados establecen el código fuente como una base escalable para construir entornos de RL que mejoran a los agentes de programación en diversas tareas de software.
Investigador busca un único anotador independiente para resolver la ambigüedad del acuerdo de LLM
Un investigador está solicitando un único anotador humano independiente para etiquetar 100 escenas narrativas turcas con el fin de determinar si el bajo acuerdo interevaluador se debe a la naturaleza interpretativa de la tarea o a definiciones de anotación insuficientemente especificadas. El estudio encontró que cuatro LLM y un detector basado en reglas coincidieron entre sí y con la referencia humana aproximadamente al azar, con puntuaciones de κ de Cohen que oscilan entre 0.000 y 0.185.