Reasoning models
arxiv arXiv cs.CL · há 7 h · 11 visualizações

TelecomGPT-R1: Pós-treinamento unificado para raciocínio em tarefas de telecomunicações heterogêneas

Pesquisadores apresentam o TelecomGPT-R1, uma família de modelos de raciocínio unificados de telecomunicações de código aberto, projetados para automatizar tarefas de engenharia por meio do raciocínio sobre padrões, configurações e logs. O modelo aborda as limitações dos LLMs generalistas e especializados existentes por meio de uma abordagem estruturada que abrange os eixos de protocolo, conhecimento, modelagem e falhas.

media Hugging Face Forums · há 1 d · 10 visualizações

CosmicUndercurrent lança Principia-Structurae-Realitatis para testar coordenação de todo o sistema em LLMs

A CosmicUndercurrent disponibilizou como código aberto um framework de raciocínio agnóstico a modelos, projetado para testar se o priming estrutural pode reduzir inconsistências globais em grandes modelos de linguagem. O projeto, hospedado, investiga se um processo de duas etapas melhora a coordenação de todo o sistema em comparação com a correção local.

media AI News (smol.ai) · há 10 d · 26 visualizações

OpenAI afirma ter resultado sobre singularidade de Navier-Stokes assistido por IA via colaboração com 10.000 agentes

Contas afiliadas à OpenAI relataram que um esforço assistido por IA produziu um resultado relacionado ao problema da existência e regularidade de Navier-Stokes, um dos Problemas do Prêmio Millennium. A alegação centra-se num sistema colaborativo envolvendo aproximadamente 10.000 agentes treinados ao longo de um ano usando aprendizado por reforço multiagente.

lab NVIDIA Research · há 12 d · 12 visualizações

ReasAlign usa raciocínio para defender agentes de LLM contra injeção de prompt

Pesquisadores introduziram o ReasAlign, uma solução em nível de modelo projetada para melhorar o alinhamento de segurança em Grandes Modelos de Linguagem (LLMs) contra ataques de injeção indireta de prompt. A abordagem incorpora etapas de raciocínio estruturado para analisar consultas do usuário e detectar instruções conflitantes, garantindo a continuidade das tarefas pretendidas pelo usuário.

lab OpenAI News · há 17 d · 34 visualizações

OpenAI alerta para risco da IA à medida que modelos de raciocínio escalam

Em um ensaio intitulado "An Alien Mind", a OpenAI discute o rápido avanço dos modelos de linguagem de raciocínio e o potencial para autoaperfeiçoamento recursivo. O autor expressa preocupação de que a inteligência das máquinas está superando as capacidades humanas de maneiras transformadoras, impulsionada principalmente pelo aumento do poder computacional em vez de algoritmos projetados.

blog Simon Willison · há 21 d · 40 visualizações

Anthropic lança Claude Fable 5.1 com benchmarks de codificação e ciência aprimorados

A Anthropic lançou o Claude Fable 5.1, uma atualização do modelo que estabelece um novo padrão para tarefas de codificação, trabalho de conhecimento e resolução de problemas de longa duração. O lançamento destaca ganhos significativos de desempenho no novo benchmark Terminal-Bench-Science 0.1, onde o Fable 5.1 alcançou uma pontuação de 52,6%, em comparação com 24,7% para o Fable 5, 29,0% para o Opus 5 e 22,4% para o GPT-5.6 Sol.