A implementação do CUDA foi atualizada para priorizar estratégias de agendamento de tiles completos para o FlashAttention. Essa mudança visa otimizar o fluxo de execução dos mecanismos de atenção dentro do framework.
CUDA prefere agendamento de tiles completos no FlashAttention
Eqx-zoo fornece portas verificadas de modelos Equinox do Hugging Face
O autor construiu eqx-zoo, uma biblioteca que carrega checkpoints do Hugging Face Hub diretamente como módulos plain de Equinox e verifica cada modelo contra a biblioteca transformers. O projeto atualmente suporta Llama, Qwen2, Qwen3, Qwen3-MoE para geração, e BERT, RoBERTa, XLM-RoBERTa para embeddings.
Lançamento do llama.cpp b11401 corrige registro e habilita cores ANSI no Windows
O lançamento do llama.cpp b11401 aborda problemas de registro no modo roteador do servidor e adiciona suporte para cores ANSI no console do Windows. Esta atualização garante que os logs de processos filhos sejam corretamente separados dos comandos de estado e que a saída colorida seja renderizada adequadamente nos terminais do Windows.
Aleph Alpha lança Kolibri, um modelo MoE de 78,1B para inglês e alemão com 3,46B de parâmetros ativos
A Aleph Alpha lançou o Kolibri-1, um modelo de linguagem Mixture-of-Experts de pesos abertos projetado para tarefas bilíngues em inglês e alemão. O modelo possui 78,1 bilhões de parâmetros totais, mas ativa apenas 3,46 bilhões por token, permitindo que seja executado em uma única GPU B200, B300 ou H200.
llama.cpp b11390 corrige falha de memória CUDA MMQ
O projeto llama.cpp lançou a versão b11390, que inclui uma correção para uma falha de memória CUDA MMQ que ocorria quando o número de especialistas era significativamente maior que o tamanho do micro-lote.
llama.cpp b11382 adiciona suporte f16 ao fill/set_rows do WebGPU
O projeto llama.cpp lançou a compilação b11382, que inclui uma atualização importante para seu backend do WebGPU. Este lançamento adiciona suporte de ponto flutuante de 16 bits (f16) especificamente para as operações `fill` e `set_rows` dentro da implementação do WebGPU.