Los investigadores han desarrollado Replica, un espacio de tareas escalable para la replicación de artículos, para abordar la necesidad de conocimiento científico confiable. Realizaron post-entrenamiento de Faraday, un agente "AI Scientist" de 27B parámetros que utiliza agentes de codificación como herramientas, para aprovechar este entorno.
- Replica proporciona un juez basado en rúbricas auto-generado con bajo ruido que se alinea con la evaluación humana de la calidad de la replicación.
- Faraday supera el rendimiento de Claude Opus 4.8 y GPT-5.5 en tareas de replicación retenidas.
- El análisis cualitativo muestra que Faraday adopta un enfoque más científicamente fundamentado en comparación con otros modelos.
Los resultados sirven como un paso hacia agentes de IA capaces de innovación científica a largo plazo sin requerir arneses complejos.