O projeto llama.cpp lançou a compilação b10672, que atualiza o backend do OpenVINO para a versão 2026.3.1 e adiciona suporte a modelos Whisper.cpp no NPU.
- O backend do OpenVINO agora funde convoluções IM2COL + MatMul em uma única operação de convolução do OpenVINO.
- Modelos Qwen3.5 estão habilitados para execução no NPU por meio do backend atualizado.
- Novas operações, incluindo RELU, POOL_2D, QUICK_GEGLU e ROLL, são suportadas no backend do OpenVINO.
- O tratamento de formas estáticas foi corrigido para resolver problemas de propagação da dimensão dinâmica de slots e independência da contagem de tokens.
- A lógica de pré-filling em blocos foi corrigida para impedir que tokens preenchidos sejam incorporados permanentemente ao cache recorrente.
- Uma nova variável de ambiente GGML_OPENVINO_NPU_COMPILE_CONFIG permite que os usuários configurem parâmetros de compilação do NPU, como optimization-level=3.
Esta atualização melhora o desempenho de inferência e a compatibilidade de modelos para usuários do OpenVINO, especialmente aqueles que visam NPUs da Intel.