El 27 de septiembre, Claude Opus 5 y el modelo Tetsu de 3B identificaron seis comprobaciones de integración continua separadas en su repositorio público que informaban estado verde o superaban la prueba a pesar de no verificar lo que se suponía que debían medir. Los problemas iban desde un filtro de despliegue que rechazaba reinicios válidos debido a resúmenes obsoletos hasta benchmarks de temporización con umbrales huecos que aceptaban diferencias de rendimiento insignificantes.
- Un script de verificación de despliegue rechazó todos los reinicios porque su anclaje de resumen principal estaba desactualizado por cinco commits, entrenando a los lectores para no creer en los indicadores rojos.
- Una comprobación del número esperado de líneas nunca se aplicó en la ruta de ejecución real utilizada por las comprobaciones horarias.
- Un guardián de deriva del corpus multimedia afirmaba coincidencias de regex en la salida de herramientas sin abrir jamás el documento que afirmaba proteger.
- 252 reparaciones asíncronas registradas como "iniciadas" nunca se volvieron a medir, costando cinco días de compilaciones y permaneciendo sin demostrar.
- Una falla de CI pública en un cambio de markdown fue inconsistente, mostrando tres veredictos diferentes para los mismos bytes idénticos.
- Una corrección de benchmark de temporización utilizó un mínimo de cinco ejecuciones que seleccionaba la caché más cálida, ocultando efectos de ordenamiento hasta que se realizaron mediciones entrelazadas.
Los autores enfatizan que registrar una prueba antes de realizarla es un error crítico, actualizando sus reglas para requerir romper las comprobaciones antes de documentarlas como corregidas.