O projeto llama.cpp lançou a versão b10839, que resolve falhas graves no backend Vulkan causadas por deslocamentos desalinhados durante operações de recuperação de linhas de tensores. Anteriormente, modelos como Qwen3-TTS e Qwen3-VL falhavam ao usar `ggml_view` com deslocamentos de visualização não nulos porque o shader gerava asserções em violações de alinhamento em relação a `minStorageBufferOffsetAlignment`. Esta atualização implementa suporte nativo para deslocamentos alinhados nos caminhos quantizados e não quantizados, eliminando a necessidade de fallbacks na CPU.

As principais alterações técnicas incluem:

  • Vinculação dos deslocamentos do buffer a uma posição alinhada próxima ao deslocamento de visualização e passagem da desalinhamento ajustado via push constants para evitar erros de truncamento.
  • Adição do parâmetro `use_view_offs` em `ggml_vk_tensor_subbuffer` para lidar corretamente com deslocamentos físicos em GPUs UMA e discretas.
  • Introdução de `ggml_vk_get_adjusted_misalign` para encontrar o menor desalinhamento válido que satisfaça os requisitos de alinhamento do buffer de armazenamento.
  • Remoção do fallback defensivo anterior na CPU em `supports_op()`, já que o backend Vulkan agora lida com esses casos nativamente.
  • Adição de cobertura abrangente de testes do backend para deslocamentos de visualização não nulos em múltiplos tipos de dados, com todos os 223 testes GET_ROWS passando no NVIDIA RTX 5060 Ti.

Esta correção garante a execução estável de modelos que dependem de visualizações complexas de tensores e fatias do cache KV em hardware Vulkan sem exigir descarregamento para a CPU.