Tema · Benchmark results
lab NVIDIA Research · há 19 d · 21 visualizações

ReasoningBomb induz raciocínio patologicamente longo em grandes modelos de raciocínio

Pesquisadores formalizaram ataques de negação de serviço no tempo de inferência (PI-DoS) que exploram o alto custo computacional do raciocínio explícito em múltiplos passos em Grandes Modelos de Raciocínio (LRMs). Eles apresentam o ReasoningBomb, um framework baseado em aprendizado por reforço que treina um atacante para gerar prompts naturais curtos que levam os modelos vítimas a traços de raciocínio patologicamente longos e frequentemente não terminantes.

media The Batch · há 5 d Humanity's Last Exam · 61.4% · 11 visualizações

Anthropic lança Claude Opus 5.5; TypeSafe lança modelo de classificação Jev

A Anthropic lançou o Claude Opus 5.5, um sucessor de menor custo do Claude Opus 5 que lidera o Índice de Inteligência v4.3 da Artificial Analysis e o Vals Index da Vals AI em benchmarks gerais de inteligência. Concurrentemente, a TypeSafe, fundada pelo ex-funcionário da OpenAI Diogo Almeida, apresentou o Jev, um modelo de classificação geral projetado para analisar texto e retornar saídas predefinidas com custo inferior ao dos grandes modelos de linguagem.

media MarkTechPost · há 8 d GDPval-AA (Elo) · 1695.0Elo · 23 visualizações

SpaceXAI lança Grok 4.7 com modelo base maior e benchmarks aprimorados

A SpaceXAI lançou o Grok 4.7, um novo modelo principal para codificação, tarefas agênticas e trabalho de conhecimento que utiliza um modelo base maior e uma execução de aprendizado por reforço estendida em comparação ao Grok 4.6. O modelo mantém a mesma estrutura de preços do seu antecessor, enquanto oferece capacidades aprimoradas de autoverificação, manipulação de contexto longo e segurança.

media The Batch · há 19 d GPQA Diamond · 96.3% · 32 visualizações

OpenAI lança GPT-6 Astra, lidera rankings com menor custo

A OpenAI lançou o GPT-6 Astra, seu novo modelo de linguagem e visão principal que alcança as primeiras posições ou perto delas nos principais rankings de IA, enquanto utiliza significativamente menos tokens e custa menos do que os modelos concorrentes. O modelo foi projetado para atender ao nível crítico de cibersegurança da OpenAI, com capacidades avançadas de cibersegurança restritas a organizações selecionadas.

media AI News (smol.ai) · há 29 d · 50 visualizações

Anthropic lança Claude Fable 5.1 e Mythos 5.1 com preços reduzidos de cache

A Anthropic lançou o Claude Fable 5.1 e o Claude Mythos 5.1 como seus novos modelos principais para codificação e trabalho de conhecimento, posicionando-os como capazes de tarefas autônomas e multi-etapas. O lançamento inclui uma redução significativa no preço de leitura de cache para US$ 0,25 por milhão de tokens, juntamente com uma janela de contexto de 1 milhão de tokens.

media MarkTechPost · há 6 h

Pesquisadores da NVIDIA lançam Physis-Lang para melhorar o raciocínio físico nos modelos de vídeo Cosmos 3

Pesquisadores da NVIDIA, MIT e da Universidade de Oxford apresentaram o Physis-Lang, um framework que aprimora os modelos de mundo em vídeo ao integrar linguagem física autoevolutiva nas legendas. Essa abordagem trata a linguagem física como uma representação otimizável usada para curadoria de dados, treinamento do modelo e inferência, corrigindo erros físicos nos vídeos gerados.

media Hugging Face Forums · há 9 h

Radar de Computação em IA classifica Qwen da Alibaba e Google como principais laboratórios de modelos abertos por Pontuação de Calor

O Radar de Computação em IA publicou um "painel de criadores" classificando 15 laboratórios que contribuem para seu conjunto rastreado de 46 modelos abertos, usando uma métrica composta chamada Pontuação de Calor. A classificação é determinada pelo número de modelos que cada laboratório possui no top 10, com empates quebrados pela melhor posição e somando os downloads dos últimos 30 dias.