ReproRepo introduce un marco escalable que utiliza GitHub issues para evaluar la reproducibilidad de artículos de ML. Muestra que los agentes LLM como Codex con GPT-5.5 identifican al menos un bloqueador semánticamente relacionado en el 90% de los pares artículo-repositorio sin ejecutar código.
ReproRepo: Escalando las auditorías de reproducibilidad con GitHub Issues
ReproRepo: Auditorías de reproducibilidad escalables con GitHub Issues
ReproRepo introduce un marco escalable que utiliza GitHub issues para evaluar la reproducibilidad de artículos de ML. Muestra que los agentes LLM como Codex con GPT-5.5 identifican al menos un bloqueador reportado por humanos en el 90% de los 1,149 artículos de ML, destacando su capacidad para detectar fallos visibles y problemas semánticos, aunque la localización exacta sigue siendo limitada.
ReproRepo: Escalando auditorías de reproducibilidad con GitHub Issues
ReproRepo introduce un marco escalable que utiliza GitHub issues para evaluar la reproducibilidad de artículos de ML. Muestra que agentes LLM como Codex con GPT-5.5 identifican al menos un bloqueo en el 90% de los pares artículo-repositorio sin ejecutar código, aunque la localización exacta sigue siendo desafiante.
GameCraft-Bench: Evaluando la generación de juegos de extremo a extremo
GameCraft-Bench introduce un benchmark con 140 tareas de Godot en 15 familias de juegos para evaluar la capacidad de los agentes de codificación para generar juegos jugables. Las evaluaciones muestran que el mejor agente logra solo un 41.46% de éxito, lo que indica desafíos significativos en la producción de juegos completos e interactivos con jugabilidad coherente y retroalimentación visual.
La minería de trayectorias revela la estructura de habilidades pero no mejora las políticas
Una tubería de tres etapas extrae bibliotecas de habilidades a partir de datos de interacción con GUI, logrando una alta pureza en cinco de los ocho clústeres frente a las etiquetas de InteraSkill. Sin embargo, el método solo mejora ligeramente la precisión de pasos de habilidad en IW y no logra avanzar el rendimiento en BrowseComp+ ni en métricas clave, lo que indica limitaciones en la transferencia de políticas entre dominios.
CAPRA: Sistema de LLM multiagente para retroalimentación de arquitectura de software
CAPRA es un sistema de LLM multiagente que genera retroalimentación en LaTeX personalizada y conforme a plantillas sobre entregables de arquitectura de software. Utiliza agentes especializados, PyMuPDF y gpt-4o para extraer y analizar texto y diagramas UML, con anclaje de evidencia y gestión de consistencia para garantizar la fiabilidad. Una evaluación preliminar de 10 informes estudiantiles muestra que CAPRA cumplió el 88.8% de ocho criterios y logró un acuerdo moderado entre evaluadores (kappa = 0.582), con cada informe procesado en menos de 4 minutos.