llama.cpp v0.6.0 представляет новый расширенный API пакетов llama_batch_ext для смешанных входных данных токенов и эмбеддингов, а также поддержку гибридной модели GLM-5.3-Flash 320B и модели принятия решений Clef.

  • Новый API llama_batch_ext поддерживает эмбеддинги состояния на уровне токена для моделей MTP и deepstack.
  • Qwen4Exp теперь предлагает высококачественную поддержку со спекулятивным декодированием MTP, обеспечивая ускорение декодирования примерно в 1.5 раза на DGX Spark.
  • Новый серверный API /v1/systemone поддерживает пять моделей принятия решений: laya, julia-1, lev, openjev и kev.
  • Metal получает ядро flash attention для тензорного API с F16 KV и ядра MMA mat-mul, работающие на Apple GPU до 3 раз быстрее.
  • Веб-интерфейс получил обновление с уровнем данных Hugging Face Hub и конвейером загрузки моделей.

Это расширение расширяет возможности llama.cpp для мультимодальной обработки, производительности спекулятивного декодирования и интеграции моделей принятия решений.