Los investigadores han desarrollado Replica, un espacio de tareas escalable para la replicación de artículos, e introducido un juez basado en rúbricas generado automáticamente para proporcionar señales de recompensa de bajo ruido que se alineen con la evaluación humana.
- El equipo realizó un post-entrenamiento de Faraday, un agente "AI Scientist" de 27B parámetros que utiliza agentes de codificación como herramientas.
- Faraday supera el rendimiento de Claude Opus 4.8 y GPT-5.5 en tareas de replicación reservadas.
- El análisis cualitativo indica que Faraday adopta un enfoque más fundamentado científicamente durante las ejecuciones.
Los autores creen que estos resultados proporcionan un punto de partida hacia agentes de IA capaces de innovación científica a largo plazo sin requerir arneses complejos.