arxiv arXiv cs.LG · hace 2 h · fuente: hace 12 d · research

ReproRepo: Auditorías de reproducibilidad escalables con GitHub Issues

Traducido del English → Español

ReproRepo introduce un marco escalable que utiliza GitHub issues para evaluar la reproducibilidad de artículos de ML. Muestra que los agentes LLM como Codex con GPT-5.5 identifican al menos un bloqueador reportado por humanos en el 90% de los 1,149 artículos de ML, destacando su capacidad para detectar fallos visibles y problemas semánticos, aunque la localización exacta sigue siendo limitada.

Importancia 2/3 arXiv cs.LG OpenAI Cohere Mistral AI AI agents Code generation Evaluation & benchmarks

Benchmarks

Benchmark	Modelo	Puntuación
SWE-bench Verified	Codex with GPT-5.5	90%

Leer original