Research paper
arxiv arXiv cs.LG · há 2 d

U-OPSD permite auto-distilação on-policy não supervisionada para LLMs

Pesquisadores propõem Auto-Distilação On-Policy Não Supervisionada (U-OPSD), um método que alcança melhoria no pós-treinamento para grandes modelos de linguagem usando apenas as próprias gerações do modelo, sem supervisão externa. A abordagem amostra múltiplas execuções para construir uma pseudo-solução por meio de votação majoritária, em seguida, destila a distribuição do professor nos prefixos do maior completamento incorreto do modelo.

arxiv arXiv cs.CL · há 2 d

M$^3$R-Bench apresenta benchmark fundamentado em evidências para compreensão de metáforas multimodais

Pesquisadores apresentam o M$^3$R-Bench, um benchmark unificado contendo 1.000 instâncias de imagem-texto com anotações verificadas por humanos, projetado para avaliar a compreensão fundamentada em evidências de metáforas multimodais. O benchmark fornece anotações conjuntas para ocorrência de metáfora, mapeamento Alvo-Fonte, sentimento e explicações etapa a etapa baseadas na Teoria da Metáfora Conceitual.

lab Google DeepMind Blog · há 3 d · 16 visualizações

Google DeepMind disponibiliza o modelo de IA WeatherNext para previsão de ciclones

O Google DeepMind e o Google Research disponibilizaram os modelos de IA WeatherNext 2 e WeatherNext Cyclones, que alcançaram precisão de ponta na previsão de trajetórias, intensidade e estrutura do vento de ciclones tropicais. Publicado na Nature, o trabalho demonstra que esses modelos fornecem aos meteorologistas um dia extra de precisão preditiva em comparação com sistemas anteriores.

arxiv arXiv cs.AI · há 3 d SWE-bench Pro · 78.0%

Argus: Um Runtime Agêntico de Propósito Geral para Raciocínio de Longo Prazo

Pesquisadores apresentam o Argus, um runtime agêntico persistente e autoevolutivo projetado para raciocínio de longo prazo que separa a intenção estável do usuário dos objetivos operacionais. O sistema utiliza funções de Gerente, Planejador, Engenheiro e Revisor para executar missões delimitadas sobre um estado de projeto durável, permitindo execução autônoma entre pontos de escalonamento de propriedade do operador.

media MarkTechPost · há 3 d

SkillOpt da Microsoft permite transferência de habilidades entre Codex e Claude Code

Pesquisadores da Microsoft, da Universidade Jiao Tong de Xangai, da Universidade Tongji e da Universidade Fudan desenvolveram o SkillOpt, um otimizador no espaço de texto que treina documentos de habilidade em linguagem natural enquanto mantém o modelo-alvo congelado. O sistema utiliza um modelo otimizador para propor edições limitadas com base em rollouts pontuados, exportando o resultado como um único arquivo `best_skill.md`.

arxiv arXiv cs.LG · há 5 d OSWorld 2.0 · 21.2% · 6 visualizações

Qwen lança Qwen-CUA, um agente nativo de uso do computador com 397B-A17B

A Qwen apresenta o Qwen-CUA, um agente nativo de uso do computador construído sobre uma espinha dorsal de misturas de especialistas de 397B-A17B que opera por meio de capturas de tela e eventos de entrada, sem depender de árvores DOM ou metadados de acessibilidade. O sistema utiliza um andaime para manter até 20 capturas de tela ativas e foi treinado usando uma frota de rollout na nuvem com quase 100.000 vCPUs em aproximadamente 40.000 tarefas verificáveis.

lab OpenAI News · há 8 d · 16 visualizações

Modelo Astra resolve dez problemas abertos em matemática e ciência da computação teórica

O modelo interno Astra da OpenAI gerou soluções para dez problemas abertos de longa data em matemática e ciência da computação teórica, com os argumentos formalizados em Lean. Esses resultados abrangem geometria de alta dimensão, teoria dos códigos, teoria dos grupos e complexidade quântica, abordando questões que não tinham avanços há pelo menos uma década.

arxiv arXiv cs.CL · há 9 d · 2 visualizações

Memory Decoder em Escala: Ampliando a memória paramétrica de longo prazo para 6,9B parâmetros

Pesquisadores apresentam o Memory Decoder at Scale, um sistema que amplia modelos de memória paramétrica de longo prazo até 6,9B parâmetros e os pré-treina em 300B tokens. Para lidar com a inviabilidade dos pipelines padrão do Faiss nessa escala de dados, os autores implementam um pipeline de indexação distribuído com carregamento esparsa e por lotes das distribuições kNN.

arxiv arXiv cs.AI · há 9 d WebArena · 73.6% · 2 visualizações

Qwen-UI-Agent estabelece estado da arte em benchmarks de uso móvel

A equipe do Qwen publicou um relatório técnico para o Qwen-UI-Agent, um agente GUI fundamental centrado no mundo real, projetado para operar de forma confiável em ambientes móveis, de uso em computadores, web e DeepSearch. O sistema combina diversos ambientes sandbox com uma execução móvel em dispositivos reais em larga escala, intercalando operações de GUI com execução de CLI e suportando tarefas de longo prazo.

arxiv arXiv cs.CL · há 10 d · 3 visualizações

Treinamento intermediário constitucional gera ganhos duráveis de alinhamento sem perda de capacidade

Pesquisadores testaram o treinamento intermediário constitucional inserindo conteúdo baseado em valores no processo de treinamento de modelos de escala 120B para determinar se ele produz um alinhamento mais durável do que os métodos padrão de pós-treinamento. O estudo descobriu que essa abordagem melhora significativamente a generalização e a durabilidade do alinhamento, especialmente na mitigação da propensão ao chantagem após o ajuste fino supervisionado.