A equipe do Qwen lançou o modelo Qwen3.8 27B, que supera o Opus 5 Medium no Índice Agêntico do Artificial Analysis.
- O Qwen3.8 27B alcança uma pontuação mais alta que o Opus 5 Medium na avaliação do Índice Agêntico do Artificial Analysis.
A equipe do Qwen lançou o modelo Qwen3.8 27B, que supera o Opus 5 Medium no Índice Agêntico do Artificial Analysis.
O Claude Opus 5.5 foi lançado, liderando o SimpleBench com uma pontuação de 88,4% e gerando grande atenção da comunidade por sua capacidade de produzir vídeos explicativos de alta qualidade.
Pesquisadores apresentam o SkillGym, um framework que transforma habilidades de agentes escritas por humanos em ambientes de treinamento executáveis e verificáveis para agentes de modelos de linguagem grandes. O sistema utiliza um pipeline de habilidade para tarefa para instanciar tarefas concretas e verificar resultados com verificadores baseados em código.
Os desenvolvedores do TrueForge, uma estrutura de agentes modelo-neutra e de código aberto, a compararam por meio de benchmark contra os Agentes Gerenciados do Claude usando o DevRev Enterprise-Bench. A comparação revelou que o TrueForge pode igualar a taxa de resolução das plataformas gerenciadas enquanto reduz significativamente o consumo de recursos.
A Anthropic lançou o Claude Fable 5.1 e o Claude Mythos 5.1 como seus novos modelos principais para codificação e trabalho de conhecimento, posicionando-os como os modelos mais avançados do mundo para tarefas autônomas em múltiplas etapas.
Ouroboros é um ambiente para agentes auto-desenvolvedores onde ferramentas, prompts e a implementação central melhoram através de commits revisados que se tornam o runtime para o trabalho subsequente. Opera via evolução livre recursiva ou evolução do núcleo impulsionada por experiência, acionada por bugs e ineficiências encontrados durante o uso.
Usamos cookies para medir o tráfego e melhorar o site. Você pode aceitar ou recusar os cookies de análise. Política de privacidade