Le projet llama.cpp a publié la compilation b10763, qui modifie le comportement par défaut de l'argument mot-clé `preserve_reasoning` du modèle de chat. Le serveur enregistre désormais l'état effectif de ce kwarg et émet un avertissement lorsqu'il est activé par défaut sur les modèles qui le prennent en charge.

  • La méthode `--chat-template-kwargs` pour définir cette option est dépréciée au profit de drapeaux explicites tels que `--reasoning-preserve` ou `--no-reasoning-preserve`.
  • Des binaires précompilés sont disponibles pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm 7.14, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm 7.14) et openEuler.
  • La version inclut des binaires d'interface utilisateur pour toutes les plateformes prises en charge.