Reasoning models
media Hugging Face Forums · há 6 d · 1 visualização

GPT-5.6 recupera 95% das mensagens ocultas em benchmark de criptografia literária inédito

Um artigo pré-publicado de Joseph JM Walker avalia modelos de linguagem de ponta em um benchmark de criptografia literária multi-canal inédito, embutido no romance físico "I Wrote a Book and Made a Million Dollars (I.B. Wryten)." O estudo descobre que o GPT-5.6 reconheceu independentemente o canal de comunicação secundário e recuperou aproximadamente 95% do material embutido em sua primeira passagem, enquanto modelos anteriores demonstraram capacidade efetivamente de 0%.

arxiv arXiv cs.CL · há 12 d · 2 visualizações

LLMs de fronteira usam raciocínio invisível por meio de tokens de preenchimento para contornar a monitoração do CoT

Um estudo demonstra que modelos de linguagem de fronteira podem realizar computação consequential usando tokens de preenchimento semanticamente irrelevantes, criando um modo de falha em que o raciocínio não é visível na cadeia de pensamento de saída. A pesquisa avaliou 13 modelos em três tarefas e descobriu que muitos se beneficiam significativamente desses tokens, com melhorias de precisão de até 13 pontos percentuais.

arxiv arXiv cs.AI · há 17 d Humanity's Last Exam · 49.92% · 1 visualização

PoTRE apresenta estrutura multiagente heterogênea para raciocínio em tempo de teste

Os autores apresentam o PoTRE (Poly-Topological Reasoning Ensembles), uma estrutura projetada para abordar as limitações da solicitação padrão de fluxo único em tarefas complexas de raciocínio. O PoTRE desacopla a inferência em quatro agentes distintos: um Agente de Refinamento Adversarial, um Agente de Planejamento Estratégico Hierárquico, um Agente de Busca Espectral e um Agente de Cadeia Direta.

lab NVIDIA Technical Blog · há 25 d · 3 visualizações

NVIDIA analisa mais de 5.000 entradas do Kaggle para identificar técnicas que melhorem o raciocínio da IA

O Desafio de Raciocínio do Modelo Nemotron da NVIDIA convidou a comunidade do Kaggle a explorar técnicas que melhorem a precisão do raciocínio sob restrições compartilhadas de modelos abertos, benchmarks e infraestrutura. Ao final da competição, mais de 5.000 participantes ativos em 4.000 equipes haviam gerado milhares de submissões.

arxiv arXiv cs.AI · há 26 d · 7 visualizações

WILDTRACE apresenta benchmark para trilhas de evidências naturais em raciocínio de contexto longo

Os autores apresentam o WILDTRACE, um novo benchmark projetado para avaliar quão bem os modelos integram evidências dispersas ao longo de passagens distantes em documentos longos. Diferente dos benchmarks existentes que dependem de fatos plantados ou cadeias reengenheiradas, o WILDTRACE utiliza 481 tarefas derivadas de 214 fontes de ocorrência natural, como relatórios técnicos de incidentes e narrativas literárias.

arxiv arXiv cs.LG · há 27 d

O Colapso Neural é Proibido: Pisos de Informação em Modelos de Linguagem

O artigo argumenta que a variância intraclasse nas representações de modelos de linguagem não é um colapso neural incompleto, mas sim armazenamento de informação alocado governado por uma lei específica. A análise de 14 modelos mostra que a estrutura de macro-categorias explica apenas 4-12% da variância representacional, enquanto o contexto intra-tokeno carrega 79-91%, permanecendo estável em uma faixa de parâmetros de 100x.