A Meta lançou o Muse Glimmer, um modelo multimodal denso com 30 bilhões de parâmetros otimizado para fluxos de trabalho de agentes locais sempre ativos. Os pesos estão disponíveis sob a licença Apache 2.0.

  • Quantizado para ~4-bit, o modelo cabe em menos de 20 GB, deixando margem para cache KV e decodificação especulativa em hardware de consumo com 24 GB ou 32 GB de memória.
  • Vem com um preparador leve baseado em DFlash para decodificação especulativa, permitindo geração de tokens significativamente mais rápida com qualidade de saída idêntica.
  • Treinado em mais de 100 idiomas com esforço de raciocínio controlável para equilibrar qualidade e velocidade.
  • Otimizado para tarefas agênticas, incluindo conclusão de tarefas de ponta a ponta, chamada de funções, raciocínio em múltiplos passos e recuperação de falhas.

O lançamento visa permitir a execução local eficiente de loops complexos de agentes, reduzindo a pegada de memória enquanto mantém o desempenho em benchmarks como DeepSearch QA e SWE-Bench.