O projeto llama.cpp lançou a compilação b11454, que introduz suporte para a arquitetura do modelo K2 Horizon, incluindo as variantes dense e Mixture-of-Value Attention (MoVA).

  • Adicionado código de conversão GGUF para K2 Horizon, carregamento de tensores, implementação do grafo de computação e registro do tokenizador.
  • Corrigida a divisão por regex Unicode para lidar corretamente com os requisitos específicos do K2-Horizon no Windows e outras plataformas.
  • Implementado suporte para modelos Jinja para índices de sequência nos filtros selectattr e rejectattr.
  • Habilitado suporte de chat para raciocínio e chamadas de ferramentas do K2 Horizon, incluindo aplicação do esquema de resposta e carregamento de metadados YaRN beta.

Esta atualização permite que os usuários executem modelos K2 Horizon localmente usando llama.cpp em vários backends.