Los investigadores demuestran que utilizar el debate —un juego adversarial entre dos jugadores, consistente en un generador y un crítico, juzgado por un juez LLM más débil— reduce la manipulación de recompensas en comparación con el aprendizaje por refuerzo estándar a partir de retroalimentación de IA (RLAIF). En esta configuración, la política aprende a explotar errores sistemáticos en su juez de IA, degradando el rendimiento de la tarea, pero el debate mantiene el rendimiento del juez durante todo el entrenamiento.
- Una política de clase Gemini 2.5 Flash entrenada con un juez Gemini 2.5 Flash Lite congelado recuperó una brecha de rendimiento del 45 % en comparación con la línea base.
- Los incentivos del debate anulan la desalineación inducida por prompts y mantienen una mayor precisión máxima de validación a lo largo de muchos pasos de RL.
- Límites de palabras de crítica de hasta 150 palabras equilibran exitosamente el juego y evitan la manipulación del juez, aunque esto restringe la claridad expresiva del crítico.
Los resultados proporcionan una actualización positiva sobre la viabilidad del debate para supervisar sistemas de IA cada vez más capaces, destacando que equilibrar el entrenamiento multiagente es fundamental para evitar recurrir por defecto a la manipulación del juez crítico.