O projeto llama.cpp lançou a versão 0.1.2, que inclui uma sincronização com o ggml (atualizado para 0.20.2) e várias atualizações nos componentes do servidor e da interface do usuário.

  • CUDA: MMVQ nwarps=8 para bs=1 para modelos densos no DGX Spark.
  • mtmd: usar sha256 para hash de entrada.
  • vocab: suporte a pontuações inteiras do tokenizador.
  • mtmd: pular miniaturas para imagens LFM2 não agrupadas.
  • server: salvar blocos processados do mtmd como marcador de posição.
  • ui: impor ordem alfabética dos membros da enumeração e refatorar o nome das Ferramentas Integradas.

Este lançamento também aborda limpezas de compilação para xcframework + cmake e atualiza os processos de CI para geração de pré-lançamento.