A OpenAI apresentou o GPT-6 Sol e Luna como alternativas mais rápidas e acessíveis ao GPT-6 Astra, trazendo avanços em codificação, factualidade, uso de computador e tarefas profissionais para modelos de menor custo.

  • A Anthropic lançou o Claude Opus 5.5, que iguala o Claude Fable 5.1 na maioria dos trabalhos enquanto custa 40% menos para executar do que o Opus 5.
  • O SWE-Bench Pro V2 é lançado com 642 tarefas de 11 repositórios, corrigindo erros anteriores nas tarefas e otimizando os processos de avaliação.
  • A Google apresentou o RRSI, um método que regulariza como agentes de IA melhoram recursivamente a si mesmos para reduzir o overfitting em benchmarks.

Essas atualizações fornecem aos usuários opções de modelos mais econômicas e novos benchmarks rigorosos para avaliar o desempenho da IA.