Fonte · llama.cpp
github llama.cpp · há 19 h · 2 visualizações

llama.cpp b11266 carrega a matriz A F32 de 2 em 2 para Vulkan na Intel

O projeto llama.cpp lançou a compilação b11266, que inclui uma otimização do Vulkan que carrega as matrizes A F32 dois elementos por vez quando estão alinhadas a 2. Essa alteração corrige problemas de desempenho no hardware da Intel, onde carregar floats um por um é ineficiente, e também corrige uma validação ausente para o alinhamento de `a_offset` no patch original.

github llama.cpp · há 1 d · 1 visualização

llama.cpp b11258 remove o service worker da interface integrada quando a UI não é servida

O projeto llama.cpp lançou a compilação b11258, que inclui uma correção para o comportamento do service worker da interface web integrada. Anteriormente, usar flags como `--path` ou `--no-ui` fazia com que os navegadores retivessem versões em cache da interface porque o servidor retornava um 404 para `/sw.js`, o que não aciona a remoção do service worker.

github llama.cpp · há 1 d · 7 visualizações

llama.cpp b11254 corrige a coleta de entradas do grafo para paralelismo de pipeline

O projeto llama.cpp lançou a compilação b11254, que inclui uma correção em como os tensores de entrada são coletados no grafo de computação. Anteriormente, `graph_inputs` era preenchido durante a divisão do grafo, causando problemas com paralelismo de pipeline onde a alternância entre lotes que consumiam entradas diferentes levava a comparações espúrias de ID de backend e forçava re-reservas do agendador.

github llama.cpp · há 2 d · 4 visualizações

llama.cpp b11238 adiciona ggml_pad_ext para preenchimento à esquerda e ignora taps do DFlash2

O projeto llama.cpp lançou a compilação b11238, introduzindo uma implementação unificada de preenchimento à esquerda por meio da nova função `ggml_pad_ext`. Essa alteração consolida os métodos anteriores usados por codificadores de áudio como Parakeet, LFM2-Audio, Granite Speech e Gemma 4, garantindo embeddings bit a bit idênticos para o Gemma 4 enquanto simplifica o suporte ao backend.