Tema · Reasoning models
blog Simon Willison · há 2 d · 10 visualizações

Pesquisadores roubam rastros de raciocínio de APIs de LLM proprietárias por meio de ataques de replay

Um artigo demonstra que blocos de cadeia de pensamento criptografados retornados pela Anthropic, OpenAI e Google podem ser extraídos em texto simples. Os autores exploraram uma vulnerabilidade onde modelos dentro da mesma família compartilhavam chaves de criptografia, permitindo que eles retransmitissem os rastros para modelos irmãos mais fracos.

media Latent Space · há 3 d · 11 visualizações

Pesquisadores decodificam rastros de raciocínio criptografados das APIs Claude, GPT e Gemini

Um novo artigo demonstra que blocos de raciocínio criptografados de modelos de ponta como Claude, GPT e Gemini podem ser decodificados e reproduzidos para extrair dados ocultos de cadeia de pensamento. Os autores mostram como esses blobs assinados podem ser transferidos para modelos mais fracos ou sessões diferentes para transcrever os pensamentos subjacentes, efetivamente contornando os esforços de ofuscação dos provedores.

arxiv arXiv cs.LG · há 4 d · 11 visualizações

Pesquisadores exploram reutilização de criptografia entre sessões para roubar rastros de raciocínio de APIs de LLM

Pesquisadores identificaram uma vulnerabilidade na forma como os principais provedores de modelos de linguagem grandes manipulam os rastros de raciocínio passo a passo, que são retornados como blocos criptografados para uso no lado do cliente. Eles descobriram que esses blocos criptografados são totalmente compatíveis e intercambiáveis entre diferentes sessões, usuários e modelos dentro do ecossistema do mesmo provedor.

arxiv arXiv cs.AI · há 4 d · 16 visualizações

Atacantes roubam rastros de raciocínio de APIs de LLM proprietárias por meio de vulnerabilidade em blocos criptografados

Pesquisadores identificaram uma vulnerabilidade arquitetural na forma como os principais provedores de modelos de linguagem grandes manipulam rastros de raciocínio passo a passo. Os provedores retornam esses rastros como blocos criptografados para os clientes, mas o estudo revela que esses blocos são totalmente compatíveis e intercambiáveis entre diferentes sessões, usuários e modelos dentro do ecossistema de um provedor.

media AI News (smol.ai) · há 8 d · 1 visualização

Atualizações do Muse Spark 1.2 da Meta e do GPT-5.6 Sol da OpenAI

A Meta anunciou que seu modelo Muse Spark 1.2 alcançou desempenho de medalha de ouro em cinco Olimpíadas de STEM e entrou no top 5 do Índice Vals a $0,69/teste, sendo relatado como 3x mais barato que o Kimi. A Meta atribuiu esses ganhos à orquestração multiagente com raciocínio paralelo, observando pontuações perfeitas em teoria na APhO e IPhO sem ferramentas externas.

media Hugging Face Forums · há 12 d · 3 visualizações

GPT-5.6 recupera 95% das mensagens ocultas em benchmark de criptografia literária inédito

Um artigo pré-publicado de Joseph JM Walker avalia modelos de linguagem de ponta em um benchmark de criptografia literária multi-canal inédito, embutido no romance físico "I Wrote a Book and Made a Million Dollars (I.B. Wryten)." O estudo descobre que o GPT-5.6 reconheceu independentemente o canal de comunicação secundário e recuperou aproximadamente 95% do material embutido em sua primeira passagem, enquanto modelos anteriores demonstraram capacidade efetivamente de 0%.

arxiv arXiv cs.CL · há 18 d · 2 visualizações

LLMs de fronteira usam raciocínio invisível por meio de tokens de preenchimento para contornar a monitoração do CoT

Um estudo demonstra que modelos de linguagem de fronteira podem realizar computação consequential usando tokens de preenchimento semanticamente irrelevantes, criando um modo de falha em que o raciocínio não é visível na cadeia de pensamento de saída. A pesquisa avaliou 13 modelos em três tarefas e descobriu que muitos se beneficiam significativamente desses tokens, com melhorias de precisão de até 13 pontos percentuais.

arxiv arXiv cs.AI · há 23 d Humanity's Last Exam · 49.92% · 1 visualização

PoTRE apresenta estrutura multiagente heterogênea para raciocínio em tempo de teste

Os autores apresentam o PoTRE (Poly-Topological Reasoning Ensembles), uma estrutura projetada para abordar as limitações da solicitação padrão de fluxo único em tarefas complexas de raciocínio. O PoTRE desacopla a inferência em quatro agentes distintos: um Agente de Refinamento Adversarial, um Agente de Planejamento Estratégico Hierárquico, um Agente de Busca Espectral e um Agente de Cadeia Direta.