O projeto llama.cpp lançou a versão 0.1.2, que inclui uma sincronização com o ggml (atualizado para 0.20.2) e várias atualizações nos componentes do servidor e da interface do usuário.
- CUDA: MMVQ nwarps=8 para bs=1 para modelos densos no DGX Spark.
- mtmd: usar sha256 para hash de entrada.
- vocab: suporte a pontuações inteiras do tokenizador.
- mtmd: pular miniaturas para imagens LFM2 não agrupadas.
- server: salvar blocos processados do mtmd como marcador de posição.
- ui: impor ordem alfabética dos membros da enumeração e refatorar o nome das Ferramentas Integradas.
Este lançamento também aborda limpezas de compilação para xcframework + cmake e atualiza os processos de CI para geração de pré-lançamento.