Benchmark results
lab Hugging Face Blog · há 15 h · 9 visualizações

AISI divulga resultados verificados de avaliação para seis modelos de ponta em cinco benchmarks

O Instituto de Segurança de IA do Reino Unido (AISI) disponibilizou publicamente métodos de avaliação e achados por meio da plataforma Evaluation Cards do EvalEval, visando melhorar a reprodutibilidade dos benchmarks. Esta divulgação inclui resultados verificados, contexto e informações de configuração para cinco benchmarks específicos: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro e Terminal-Bench 2.0.

media MarkTechPost · há 21 h GDPval-AA (Elo) · 1695.0Elo · 13 visualizações

SpaceXAI lança Grok 4.7 com modelo base maior e benchmarks aprimorados

A SpaceXAI lançou o Grok 4.7, um novo modelo principal para codificação, tarefas agênticas e trabalho de conhecimento que utiliza um modelo base maior e uma execução de aprendizado por reforço estendida em comparação ao Grok 4.6. O modelo mantém a mesma estrutura de preços do seu antecessor, enquanto oferece capacidades aprimoradas de autoverificação, manipulação de contexto longo e segurança.

media Interconnects · há 2 d Artificial Analysis Intelligence Index · 45.0% · 17 visualizações

Modelos chineses de peso aberto superam contrapartes americanas em downloads e benchmarks

O autor apresenta um resumo sobre o estado dos modelos de peso aberto, observando que as empresas de IA chinesas se tornaram as claras líderes neste espaço desde aproximadamente abril de 2025. Essa mudança é evidenciada pelas métricas de download do Hugging Face e pelo desempenho em benchmarks de capacidade.

media Hugging Face Forums · há 6 d · 13 visualizações

Índice de Desperdício de Agentes avalia 341.054 execuções públicas de agentes de codificação por padrões de desperdício

O Índice de Desperdício de Agentes avaliou 341.054 trajetórias de agentes de 11 conjuntos de dados públicos para identificar ineficiências como loops, tentativas cegas, saída de ferramentas excessiva e execuções abandonadas. A análise revela que comportamentos de loop e tentativa são prevalentes em modelos mais fracos como os agentes Llama, mas raros no Claude 3.7 Sonnet e Qwen3-Coder-480B.

media MarkTechPost · há 7 d LMSYS Arena (Elo) · 1866.0Elo · 20 visualizações

Prior Labs lança TabPFN-3.5, superando vencedor do Kaggle Otto de 2015 com configurações padrão

A Prior Labs lançou o TabPFN-3.5, um modelo fundamental para dados tabulares que realiza previsões em uma tabela em uma única passagem direta, sem necessidade de treinamento ou ajuste por conjunto de dados. O modelo obteve pontuação de 0.375 na lista privada do Challenge de Classificação de Produtos do Grupo Otto de 2015, superando a pontuação vencedora original de 0.382 alcançada por Gilberto Titericz e Stanislav Semenov.

media MarkTechPost · há 7 d · 28 visualizações

Nums AI lança Causilo, um modelo fundamental tabular que lidera o TabArena entre modelos únicos

A Nums AI lançou o Causilo, um modelo fundamental tabular pré-treinado para classificação e regressão que alcança a maior pontuação Elo entre modelos únicos no TabArena. O modelo utiliza uma abordagem de aprendizado em contexto onde as linhas de treinamento são armazenadas como contexto em vez de atualizar os pesos, e está disponível com código Apache-2.0 e pesos pré-treinados no Hugging Face.

arxiv arXiv cs.CL · há 8 d Codeforces (Elo) · 98.2% · 27 visualizações

Stellar Colosseum utiliza inferência multiagente para pesquisa matemática de longo prazo

O Stellar Colosseum é um harness agnóstico a modelos projetado para distribuir a inferência em pesquisas de longo prazo em matemática e ciência da computação teórica, abordando a falta de confiabilidade dos modelos de linguagem em problemas complexos. O sistema explora estratégias alternativas antes da construção da prova, utiliza um gate de prontidão para determinar quando uma rota está madura o suficiente para decomposição e representa o plano da prova como subproblemas interdependentes ao nível das seções.

arxiv arXiv cs.LG · há 8 d Codeforces (Elo) · 98.2% · 25 visualizações

Coliseu Estelar: estrutura para muitos agentes voltada à pesquisa de matemática e ciência da computação teórica em longo prazo

Os autores apresentam o Coliseu Estelar, uma estrutura agnóstica a modelos projetada para distribuir a inferência ao longo de pesquisas de longo alcance em matemática e ciência da computação teórica. O sistema explora estratégias alternativas antes da construção da prova, utiliza um gate de prontidão para determinar quando uma rota está madura o suficiente para decomposição e representa o plano da prova como subproblemas interdependentes de nível de seção.

arxiv arXiv cs.AI · há 9 d · 25 visualizações

Reavaliação por especialistas revela que modelos de fronteira estão quase saturados em benchmarks de física

Um estudo que auditou seis benchmarks de física amplamente utilizados descobriu que as pontuações baixas relatadas para modelos de linguagem de fronteira devem-se principalmente a erros de benchmarking, e não a deficiências dos modelos. Especialistas revisaram os enunciados dos problemas, as soluções de referência e as respostas dos modelos, distinguindo erros genuínos de erros do avaliador, referências incorretas e perguntas ambíguas.

media MarkTechPost · há 10 d Terminal-Bench 2 · 92.8% · 28 visualizações

Cognition lança SWE-2, um modelo de codificação pós-treinado do Kimi K3 com esforço de raciocínio selecionável

A Cognition lançou o SWE-2, seu modelo de codificação mais capaz até o momento, que foi pós-treinado com aprendizado por reforço a partir do modelo aberto de 2,8T parâmetros da Moonshot AI, o Kimi K3. O modelo obtém 50,0% no FrontierCode 1.1 Main, posicionando-se a um ponto de distância do Fable 5.1 enquanto opera com 64% menos custo.

lab NVIDIA Research · há 11 d · 16 visualizações

ReasoningBomb induz raciocínio patologicamente longo em grandes modelos de raciocínio

Pesquisadores formalizaram ataques de negação de serviço no tempo de inferência (PI-DoS) que exploram o alto custo computacional do raciocínio explícito em múltiplos passos em Grandes Modelos de Raciocínio (LRMs). Eles apresentam o ReasoningBomb, um framework baseado em aprendizado por reforço que treina um atacante para gerar prompts naturais curtos que levam os modelos vítimas a traços de raciocínio patologicamente longos e frequentemente não terminantes.