Fonte · arXiv cs.LG
arxiv arXiv cs.LG · há 18 d · 3 visualizações

Moonshot AI lança Kimi K3, um modelo MoE de 2,8T parâmetros com contexto de milhão de tokens

A Moonshot AI apresentou o Kimi K3, um modelo Mixture-of-Experts de código aberto com 2,8 trilhões de parâmetros totais e 104 bilhões de parâmetros ativados por token. O modelo oferece capacidades nativas de visão e uma janela de contexto de 1 milhão de tokens, aproveitando o Kimi Delta Attention e o Stable LatentMoE para alcançar uma eficiência de escalabilidade aproximadamente 2,5 vezes superior à do seu antecessor, Kimi K2.

arxiv arXiv cs.LG · há 17 h · 1 visualização

Intern-S2-Preview: Modelo de Base Agênico Científico

Os autores apresentam o Intern-S2-Preview, uma série de modelos de base agênicos científicos projetados para apoiar a compreensão multimodal científica, raciocínio, geração e tarefas de longo prazo. O pipeline de treinamento começa com o pré-treinamento multimodal científico sobre documentos científicos renderizados, dados de imagem-texto intercalados e corpora científicos diversos.

arxiv arXiv cs.LG · há 2 d HealthBench · 51.9% · 5 visualizações

Sistema RAG clínico VITA iguala ou supera LLMs de ponta no HealthBench

Um sistema de geração aumentada por recuperação (RAG) feito sob medida chamado VITA, projetado para ambientes de baixa e média renda, foi avaliado contra modelos de linguagem grandes de propósito geral no benchmark HealthBench. Em 4.023 perguntas avaliadas por um juiz GPT-4.1, o VITA ficou em primeiro lugar com 51,9% dos pontos possíveis da rubrica, superando GPT-5.4, o4-mini, Gemini 3.1 Pro e Claude Sonnet 4.6.

arxiv arXiv cs.LG · há 4 d · 2 visualizações

Macaron-V1 apresenta família de modelos de agente aberta com Mixture-of-LoRA para aprendizado contínuo

O Macaron-V1 é uma família de modelos de agente aberta projetada para inteligência experiencial, permitindo aprendizado a partir de ambientes reais e continuidade do aprendizado após a implantação. O sistema foca em dois objetivos: adaptação por meio da melhoria recursiva dos pares modelo-arreio e colaboração via arquitetura Mixture-of-LoRA (MoL) que seleciona adaptadores LoRA especialistas por turno do usuário.

arxiv arXiv cs.LG · há 4 d · 11 visualizações

Pesquisadores exploram reutilização de criptografia entre sessões para roubar rastros de raciocínio de APIs de LLM

Pesquisadores identificaram uma vulnerabilidade na forma como os principais provedores de modelos de linguagem grandes manipulam os rastros de raciocínio passo a passo, que são retornados como blocos criptografados para uso no lado do cliente. Eles descobriram que esses blocos criptografados são totalmente compatíveis e intercambiáveis entre diferentes sessões, usuários e modelos dentro do ecossistema do mesmo provedor.

arxiv arXiv cs.LG · há 8 d

U-OPSD permite auto-distilação on-policy não supervisionada para LLMs

Pesquisadores propõem Auto-Distilação On-Policy Não Supervisionada (U-OPSD), um método que alcança melhoria no pós-treinamento para grandes modelos de linguagem usando apenas as próprias gerações do modelo, sem supervisão externa. A abordagem amostra múltiplas execuções para construir uma pseudo-solução por meio de votação majoritária, em seguida, destila a distribuição do professor nos prefixos do maior completamento incorreto do modelo.

arxiv arXiv cs.LG · há 11 d OSWorld 2.0 · 21.2% · 20 visualizações

Qwen lança Qwen-CUA, um agente nativo de uso do computador com 397B-A17B

A Qwen apresenta o Qwen-CUA, um agente nativo de uso do computador construído sobre uma espinha dorsal de misturas de especialistas de 397B-A17B que opera por meio de capturas de tela e eventos de entrada, sem depender de árvores DOM ou metadados de acessibilidade. O sistema utiliza um andaime para manter até 20 capturas de tela ativas e foi treinado usando uma frota de rollout na nuvem com quase 100.000 vCPUs em aproximadamente 40.000 tarefas verificáveis.

arxiv arXiv cs.LG · há 24 d · 8 visualizações

SkewAdam usa estado de otimizador em camadas para reduzir a memória do treinamento MoE em 97%

Pesquisadores apresentam o SkewAdam, um otimizador projetado para modelos mixture-of-experts (MoE) que aloca diferentes tipos de estado para populações distintas de parâmetros, reduzindo drasticamente o uso de memória. Ao atribuir momento float32 e momentos segundos fatorados ao backbone, momentos segundos fatorados aos experts e momentos segundos exatos ao roteador, o SkewAdam reduz o estado do otimizador de 50,6 GB para 1,29 GB em um modelo com 6,78B de parâmetros.

arxiv arXiv cs.LG · há 28 d · 2 visualizações

RoboTTT escala políticas robóticas para contexto de 8 mil etapas

Pesquisadores apresentam o RoboTTT, uma receita de treinamento que estende o contexto visuomotor para modelos fundamentais de robótica até 8.000 etapas sem aumentar a latência de inferência. O método integra Treinamento no Momento do Teste em políticas Visão-Linguagem-Ação usando pesos rápidos atualizados por descida de gradiente durante tanto o treinamento quanto a inferência.