O projeto vLLM lançou a versão 0.29.0, que inclui uma correção de bug central relacionada ao cache de prefixo denso.
- A atualização aplica a configuração padrão do cache de prefixo denso especificamente a modelos híbridos.
O projeto vLLM lançou a versão 0.29.0, que inclui uma correção de bug central relacionada ao cache de prefixo denso.
A DeepSeek AI lançou o DeepSeek-V4.1-Flash, um modelo Mixture-of-Experts multimodal que possui uma janela de contexto de 1 milhão de tokens e um cache KV FP4 que reduz a pegada global do cache para 890 bytes por token. O modelo utiliza uma arquitetura de codificador-decodificador causal e Compressed Sparse Attention 2 (CSA2) para reduzir significativamente os requisitos de memória enquanto mantém o desempenho.
O projeto llama.cpp lançou a compilação b10889, que inclui uma otimização de memória para evitar alocar o cache V para o indexador, já que ele não é utilizado.
O projeto llama.cpp lançou a compilação b10888, que inclui um novo recurso para adicionar rótulos de depuração de buffer de comandos para profilers de GPU no backend Vulkan.
O projeto llama.cpp lançou a compilação b10886, que introduz o suporte a intrínsecos vetoriais Q1_0 para a arquitetura s390x. Esta atualização inclui a implementação de `ggml_vec_dot_q1_0_q8_0` e atualiza a documentação para refletir a nova capacidade.
O projeto llama.cpp lançou a compilação b10883, que inclui atualizações significativas no backend Vulkan. A principal alteração envolve o uso de constantes de especificação para operações de multiplicação matriz-matriz tipo A para melhorar a compilação e o desempenho dos shaders.
Usamos cookies para medir o tráfego e melhorar o site. Você pode aceitar ou recusar os cookies de análise. Política de privacidade