Fonte · arXiv cs.AI
arxiv arXiv cs.AI · há 2 d · 3 visualizações

SCUT melhora o raciocínio espacial em VLMs por meio de CoT estruturado e RL supervisionado por processo

Pesquisadores propõem o SCOUT, um framework que aprimora o raciocínio espacial de Modelos Visão-Linguagem ao combinar Chain-of-Thought estruturada com aprendizado por reforço de recompensa de processo multiobjetivo. Essa abordagem aborda problemas de atribuição de crédito em métodos de RL existentes e integra percepção de profundidade para compreensão 3D abrangente.

arxiv arXiv cs.AI · há 2 d HealthBench · 51.9% · 4 visualizações

RAG clínico VITA iguala ou supera LLMs de ponta no HealthBench

Um sistema de geração aumentada por recuperação projetado especificamente chamado VITA, destinado a contextos de baixa e média renda, foi avaliado em comparação com modelos de linguagem grandes de propósito geral no benchmark HealthBench. O estudo demonstra que o design específico do corpus pode manter um desempenho competitivo mesmo à medida que novos modelos de ponta são lançados.

arxiv arXiv cs.AI · há 3 d

MiLMMT-46-v1.0 melhora a tradução multilíngue por meio de pós-treinamento sem referência

Pesquisadores desenvolveram o MiLMMT-46-v1.0, um modelo de tradução automática multilíngue que aplica pós-treinamento sem referência em grandes modelos de linguagem de código aberto. A equipe utiliza Otimização de Política Relativa de Grupo (GRPO) com uma recompensa baseada em dois modelos de estimativa de qualidade sem referência, controlada por identificação de idioma.

arxiv arXiv cs.AI · há 4 d

Otimização de Finalidade Aberta permite que o GPT-5.5 componha seu próprio processo de melhoria

O artigo apresenta a Otimização de Finalidade Aberta (OEO), um framework que permite que um otimizador de modelo de fronteira componha dinamicamente seu processo de melhoria online, em vez de depender de pipelines de otimização prescritos. Os autores comparam o OEO contra duas abordagens em estágios, SkillOpt e GEPA, em 14 comparações diretas entre oito configurações de benchmark-alvo-modelo.

arxiv arXiv cs.AI · há 4 d

AMIE (Video) atinge desempenho de nível especialista em consultas médicas em tempo real

Pesquisadores demonstraram o primeiro sistema de IA de nível especialista para consultas clínicas de vídeo em tempo real usando AMIE (Video), um sistema multiagente baseado em Gemini que integra diálogo de baixa latência com percepção audiovisual em tempo real. Em um estudo randomizado de Exame Clínico Estruturado Objetivo envolvendo 30 médicos de atenção primária e 100 cenários, os avaliadores clínicos classificaram o sistema como equivalente ou superior aos médicos na coleta de histórico, diagnóstico, manejo e observação física.

arxiv arXiv cs.AI · há 4 d · 17 visualizações

Atacantes roubam rastros de raciocínio de APIs de LLM proprietárias por meio de vulnerabilidade em blocos criptografados

Pesquisadores identificaram uma vulnerabilidade arquitetural na forma como os principais provedores de modelos de linguagem grandes manipulam rastros de raciocínio passo a passo. Os provedores retornam esses rastros como blocos criptografados para os clientes, mas o estudo revela que esses blocos são totalmente compatíveis e intercambiáveis entre diferentes sessões, usuários e modelos dentro do ecossistema de um provedor.

arxiv arXiv cs.AI · há 4 d OSWorld · 90.69% · 6 visualizações

Agente auto-desenvolvedor Ouroboros estabelece novos recordes com Opus 5

Ouroboros é um ambiente para agentes auto-desenvolvedores onde ferramentas, prompts e a implementação central melhoram através de commits revisados que se tornam o runtime para o trabalho subsequente. Opera via evolução livre recursiva ou evolução do núcleo impulsionada por experiência, acionada por bugs e ineficiências encontrados durante o uso.

arxiv arXiv cs.AI · há 5 d · 12 visualizações

GPT-5 e GPT-5 Nano igualam especialistas na avaliação de pesquisas sobre oncogênese microbiana

Um estudo demonstra que o GPT-5 e o GPT-5 Nano alcançam desempenho de nível especialista na extração de evidências e na avaliação crítica de publicações de pesquisa sobre oncogênese microbiana. Os pesquisadores avaliaram esses modelos junto com Gemini 2.5 Pro e Gemini 2.5 Flash em comparação a especialistas do domínio, utilizando um conjunto de dados com 24 artigos focados em MMTV-LV e câncer de mama.

arxiv arXiv cs.AI · há 9 d SWE-bench Pro · 78.0% · 1 visualização

Argus: Um Runtime Agêntico de Propósito Geral para Raciocínio de Longo Prazo

Pesquisadores apresentam o Argus, um runtime agêntico persistente e autoevolutivo projetado para raciocínio de longo prazo que separa a intenção estável do usuário dos objetivos operacionais. O sistema utiliza funções de Gerente, Planejador, Engenheiro e Revisor para executar missões delimitadas sobre um estado de projeto durável, permitindo execução autônoma entre pontos de escalonamento de propriedade do operador.

arxiv arXiv cs.AI · há 9 d

SciCode-Verified corrige defeitos de benchmark para revelar a verdadeira capacidade de codificação científica dos modelos

Os autores identificam que a estagnação das pontuações no benchmark SciCode decorre de defeitos significativos no instrumento de avaliação, e não de limitações na capacidade dos modelos. Uma auditoria realizada por especialistas de domínio em 65 problemas de teste revelou 263 defeitos, dos quais 192 causavam a rejeição incorreta de soluções corretas devido a problemas como respostas padrão não reproduzíveis e tolerâncias excessivamente restritivas.

arxiv arXiv cs.AI · há 10 d

Video-DeepResearch apresenta agente multimodal para fluxos de vídeo contínuos

Pesquisadores apresentam o Video-DeepResearch (Video-DR), um framework que estende agentes multimodais de imagens estáticas para fluxos de vídeo contínuos, abordando viés de modalidade e vazamento de conhecimento paramétrico. O sistema emprega um pipeline de percepção-exploração desacoplado com desbloqueio de ferramentas por estágio para impor ancoragem visual entre quadros antes da recuperação na web.

arxiv arXiv cs.AI · há 15 d WebArena · 73.6% · 4 visualizações

Qwen-UI-Agent estabelece estado da arte em benchmarks de uso móvel

A equipe do Qwen publicou um relatório técnico para o Qwen-UI-Agent, um agente GUI fundamental centrado no mundo real, projetado para operar de forma confiável em ambientes móveis, de uso em computadores, web e DeepSearch. O sistema combina diversos ambientes sandbox com uma execução móvel em dispositivos reais em larga escala, intercalando operações de GUI com execução de CLI e suportando tarefas de longo prazo.

arxiv arXiv cs.AI · há 18 d · 1 visualização

ClinFusion apresenta MLLM centrado na visão para compreensão médica holística

Pesquisadores apresentam o ClinFusion, um modelo de linguagem multimodal grande centrado na visão, projetado para abordar os desafios da implementação de IA na prática clínica ao unificar a compreensão de imagens médicas 2D e 3D. O sistema possui um codificador visual em cascata composicional com um operador de Fusão de Localidade Espacialmente Consciente em Cascata e inclui um novo framework de avaliação composto por MedIF-Bench e métricas fundamentadas na região de interesse.

arxiv arXiv cs.AI · há 18 d

Módulo de Elegibilidade da Aethis usa arquitetura neuro-simbólica para corrigir erros de avaliação de regras em LLMs

O artigo documenta uma classe de falha em modelos de linguagem grandes de ponta chamada colapso de cadeia de exceções, onde os modelos avaliam incorretamente regras condicionais aninhadas. Para abordar isso, os autores apresentam o Módulo de Elegibilidade da Aethis, uma arquitetura neuro-simbólica que combina regras autoradas por LLM com uma camada baseada em SMT para execução determinística.

arxiv arXiv cs.AI · há 22 d OSWorld · 37.7% · 5 visualizações

OpenForgeRL permite o treinamento de ponta a ponta de agentes baseados em harness em qualquer ambiente

O OpenForgeRL é um framework de código aberto que permite aos pesquisadores treinar agentes de IA baseados em harness de ponta a ponta usando pilhas padrão de aprendizado por reforço. Ele alcança isso desacoplando o treinamento da inferência por meio de um proxy leve que registra as chamadas do modelo como dados e um orquestrador Kubernetes que gerencia os lançamentos remotos de contêineres.

arxiv arXiv cs.AI · há 22 d · 4 visualizações

AREX apresenta agentes de pesquisa profunda que se auto-melhoram recursivamente

Pesquisadores apresentam o AREX, uma família de agentes de pesquisa profunda Recursivamente Auto-Melhoráveis (RSI) projetados para abordar a assimetria entre descoberta e verificação em consultas complexas. O AREX alterna entre um loop interno que coleta evidências e constrói respostas provisórias, e um loop externo que audita restrições para guiar o refinamento direcionado.

arxiv arXiv cs.AI · há 23 d · 4 visualizações

SLAI T-Rex permite o pós-treinamento de todos os parâmetros do DeepSeek-V4 no Ascend SuperPOD

O SLAI apresenta o T-Rex, um framework de otimização de ponta a ponta para o pós-treinamento de todos os parâmetros de modelos MoE na escala de trilhões de parâmetros no Ascend NPU SuperPOD. Utilizando a família de modelos DeepSeek-V4 como carga de trabalho alvo, o sistema aborda a pressão de memória e a sobrecarga de comunicação por meio de paralelismo hierárquico e otimizações de execução de kernels.