llama.cpp v0.6.0 представляет новый расширенный API пакетов llama_batch_ext для смешанных входных данных токенов и эмбеддингов, а также поддержку гибридной модели GLM-5.3-Flash 320B и модели принятия решений Clef.
- Новый API llama_batch_ext поддерживает эмбеддинги состояния на уровне токена для моделей MTP и deepstack.
- Qwen4Exp теперь предлагает высококачественную поддержку со спекулятивным декодированием MTP, обеспечивая ускорение декодирования примерно в 1.5 раза на DGX Spark.
- Новый серверный API /v1/systemone поддерживает пять моделей принятия решений: laya, julia-1, lev, openjev и kev.
- Metal получает ядро flash attention для тензорного API с F16 KV и ядра MMA mat-mul, работающие на Apple GPU до 3 раз быстрее.
- Веб-интерфейс получил обновление с уровнем данных Hugging Face Hub и конвейером загрузки моделей.
Это расширение расширяет возможности llama.cpp для мультимодальной обработки, производительности спекулятивного декодирования и интеграции моделей принятия решений.