OpenAI presentó GPT-6 Sol y Luna como alternativas más rápidas y asequibles a GPT-6 Astra, trayendo avances en programación, precisión factual, uso de computadoras y tareas profesionales a modelos de menor costo.
- Anthropic lanzó Claude Opus 5.5, que iguala a Claude Fable 5.1 en la mayoría del trabajo mientras cuesta un 40% menos ejecutarlo que Opus 5.
- SWE-Bench Pro V2 se lanza con 642 tareas de 11 repositorios, corrigiendo errores previos de tareas y optimizando los procesos de evaluación.
- Google presentó RRSI, un método que regulariza cómo los agentes de IA mejoran recursivamente sus propios mecanismos para reducir el sobreajuste en benchmarks.
Estas actualizaciones proporcionan a los usuarios opciones de modelos más rentables y nuevos benchmarks rigurosos para evaluar el rendimiento de la IA.