Duas configurações de API triplicaram as pontuações do GPT-5.6 no ARC-AGI-3
Habilitar duas configurações específicas de API para o GPT-5.6 resultou em uma tripla das suas pontuações de desempenho na benchmark ARC-AGI-3.
Habilitar duas configurações específicas de API para o GPT-5.6 resultou em uma tripla das suas pontuações de desempenho na benchmark ARC-AGI-3.
A Z.ai anunciou o GLM-5.3, um novo modelo que alcança desempenho de ponta em benchmarks de codificação agêntica ao estender o pós-treinamento de seu modelo base GLM-5.2. O modelo de ~750B parámetros atualmente supera o Kimi K3 e iguala ou excede o Claude Fable 5 e o GPT-5.6-Sol em vários benchmarks.
Uma comparação entre DeepSeek-V4 Flash 0731 e GPT-5.6 Luna no benchmark DeepSWE revela que, embora GPT-5.6 Luna seja o engenheiro mais forte, uma estratégia em cascata usando ambos os modelos alcança maior precisão a um custo menor.
A Alibaba anunciou o Qwen3.8-Max como seu novo modelo principal, descrevendo-o como uma arquitetura esparsa de 2,4T de parâmetros focada em trabalho agêntico de longo prazo, codificação e raciocínio multimodal. A empresa confirmou que os pesos abertos do Qwen3.8-Max serão lançados na próxima semana junto à variante de pesos abertos Qwen3.8-27B.
A DeepSeek atualizou seu modelo V4 Flash, lançando uma nova versão em 2026-07-31 que apresenta ganhos significativos de desempenho em relação à versão anterior. A atualização introduz resultados para vários novos benchmarks enquanto melhora as pontuações nos existentes.
Uma comparação entre Kimi K3 e GPT-5.6 Sol no benchmark DeepSWE revela que, embora o GPT-5.6 Sol lidera em qualidade de tiro único (72,7% contra 68,5%), o Kimi K3 alcança pontuações pass@k mais altas para k > 1 com um custo significativamente menor.
A Anthropic lançou o modelo Claude Opus 5, desencadeando escrutínio sobre seu desempenho em métricas de codificação e capacidade geral, além de reacender o debate sobre a avaliação de modelos de fronteira.
A Anthropic lançou o Claude Opus 5, um novo modelo de fronteira que gerou discussões significativas sobre pontuações em benchmarks e desempenho prático. Avaliações independentes da Epoch AI reportam um Índice de Capacidades da Epoch (ECI) de 159 e um SWE-ECI de 161 para o novo modelo.
O Kimi K3, um modelo de pesos abertos da Moonshot AI, alcança desempenho comparável ao Claude Fable 5 da Anthropic no benchmark DeepSWE, enquanto custa significativamente menos por tarefa. Em uma avaliação de 16 de julho de 2026, o Kimi K3 atingiu 68,5% de pass@1 em comparação com os 69,9% do Fable 5, mas superou-o em cenários de múltiplas tentativas e ofereceu maior eficiência de custo.
A Sierra Research lançou o τ-bench 1.0.1, que corrige o esquema de avaliação da tarefa `banking_knowledge` para parar de penalizar agentes por leituras prudentes de verificação e corrige várias inconsistências nos dados. A atualização garante que a reavaliação das trajetórias do ranking apenas aumente as pontuações, sem que simulações anteriormente aprovadas falhem.
Em 16 de julho, a Moonshot AI lançou seu mais recente modelo principal, Kimi K3, uma arquitetura Mixture of Experts (MoE) com 2,8 trilhões de parâmetros. A empresa prometeu liberar os pesos do modelo em 27 de julho.
A Moonshot lançou o Kimi K3, um modelo de pesos abertos que provocou uma reavaliação sobre quão próximos os modelos chineses estão da fronteira. O lançamento é caracterizado por desempenho robusto em codificação, tarefas agênticas e trabalho de conhecimento de longo prazo.
A Moonshot AI apresentou o Kimi K3, um novo modelo de pesos abertos de classe fronteira com 2,8 trilhões de parâmetros totais e capacidades nativas de entrada multimodal. Oficialmente posicionado como "Inteligência Fronteira Aberta", o modelo suporta uma janela de contexto de 1 milhão de tokens e utiliza componentes arquiteturais inovadores, como Kimi Delta Attention (KDA) e Attention Residuals, para melhorar a eficiência.
A Moonshot AI lançou o Kimi K3, um modelo de pesos abertos de classe fronteira com 2,8 trilhões de parâmetros e entrada multimodal nativa. O modelo apresenta o Kimi Delta Attention (KDA) para decodificação mais rápida em contextos longos e é posicionado para fluxos de trabalho de codificação agêntica de longo prazo.
O laboratório chinês de IA Moonshot AI anunciou o Kimi K3, descrevendo-o como seu modelo mais capaz até hoje, com 2,8 trilhões de parâmetros. O modelo está atualmente disponível por meio do site e da API, com uma versão de pesos abertos prometida para 27 de julho de 2026.
O DharmaOCR alcança maior qualidade e estabilidade na extração do que o Mistral OCR4 e o Unlimited-OCR no português brasileiro por meio de treinamento específico do domínio.
A Qwen lançou o modelo Qwen3.8-27B, disponível para download no ModelScope e Hugging Face.
O artigo destaca um gráfico da atualização do Gemini 3.7 Flash mostrando que as versões anteriores, especificamente 3.5 e 3.6 Flash, ficaram para trás em relação aos modelos mais recentes das séries Claude 4.8+ e GPT 5.5+.
Um usuário do Reddit destaca o modelo DeepSeek DSv4 Flash 0731, observando suas fortes capacidades de desempenho em relação ao seu custo. O post referencia o Artificial Analysis Intelligence Index v4.1.1 para apoiar a afirmação de que o modelo tem um desempenho excepcional.
Um sistema de geração aumentada por recuperação projetado especificamente chamado VITA, destinado a contextos de baixa e média renda, foi avaliado em comparação com modelos de linguagem grandes de propósito geral no benchmark HealthBench. O estudo demonstra que o design específico do corpus pode manter um desempenho competitivo mesmo à medida que novos modelos de ponta são lançados.