Tema · Benchmark results
media AI News (smol.ai) · há 10 d Terminal-Bench 2 · 67.4% · 21 visualizações

Alibaba anuncia Qwen3.8-Max com 2,4T de parâmetros e pesos abertos em breve

A Alibaba anunciou o Qwen3.8-Max como seu novo modelo principal, descrevendo-o como uma arquitetura esparsa de 2,4T de parâmetros focada em trabalho agêntico de longo prazo, codificação e raciocínio multimodal. A empresa confirmou que os pesos abertos do Qwen3.8-Max serão lançados na próxima semana junto à variante de pesos abertos Qwen3.8-27B.

media Together AI Blog · há 21 d · 8 visualizações

Kimi K3 iguala Claude Fable 5 na qualidade do DeepSWE com um terço do custo

O Kimi K3, um modelo de pesos abertos da Moonshot AI, alcança desempenho comparável ao Claude Fable 5 da Anthropic no benchmark DeepSWE, enquanto custa significativamente menos por tarefa. Em uma avaliação de 16 de julho de 2026, o Kimi K3 atingiu 68,5% de pass@1 em comparação com os 69,9% do Fable 5, mas superou-o em cenários de múltiplas tentativas e ofereceu maior eficiência de custo.

arxiv τ²-bench (tau2-bench) · há 23 d · 3 visualizações

τ-bench 1.0.1 corrige a avaliação de banking_knowledge para evitar penalizar comportamento cauteloso do agente

A Sierra Research lançou o τ-bench 1.0.1, que corrige o esquema de avaliação da tarefa `banking_knowledge` para parar de penalizar agentes por leituras prudentes de verificação e corrige várias inconsistências nos dados. A atualização garante que a reavaliação das trajetórias do ranking apenas aumente as pontuações, sem que simulações anteriormente aprovadas falhem.

media Latent Space · há 29 d · 3 visualizações

Moonshot AI lança Kimi K3, um modelo de fronteira aberta com 2,8T parâmetros

A Moonshot AI apresentou o Kimi K3, um novo modelo de pesos abertos de classe fronteira com 2,8 trilhões de parâmetros totais e capacidades nativas de entrada multimodal. Oficialmente posicionado como "Inteligência Fronteira Aberta", o modelo suporta uma janela de contexto de 1 milhão de tokens e utiliza componentes arquiteturais inovadores, como Kimi Delta Attention (KDA) e Attention Residuals, para melhorar a eficiência.

arxiv arXiv cs.AI · há 2 d HealthBench · 51.9% · 4 visualizações

RAG clínico VITA iguala ou supera LLMs de ponta no HealthBench

Um sistema de geração aumentada por recuperação projetado especificamente chamado VITA, destinado a contextos de baixa e média renda, foi avaliado em comparação com modelos de linguagem grandes de propósito geral no benchmark HealthBench. O estudo demonstra que o design específico do corpus pode manter um desempenho competitivo mesmo à medida que novos modelos de ponta são lançados.