O projeto llama.cpp lançou a compilação b10369, introduzindo suporte para o modelo de texto-para-fala pocket-tts. Esta atualização inclui uma nova implementação de convoluções transpostas usando GEMM e col2im para otimizar o desempenho.
- O tempo de geração por quadro cai em 80% no CUDA e em 50% na CPU em comparação com implementações anteriores.
- A saída corresponde à implementação de referência com uma correlação de 0.999994 e contagens de quadros idênticas.
- Os pacotes de idiomas agora ajustam o preenchimento final da fala e o preenchimento de prompts curtos via novas chaves mmproj.
- Um teste com um texto longo em francês mostrou geração dentro de 2% do tempo de referência (22.96s vs 23.44s).
A otimização acelera significativamente a síntese de áudio mantendo a fidelidade, e os arquivos mmproj existentes devem ser convertidos para conter as novas chaves de configuração.