Le projet llama.cpp a introduit un analyseur dédié pour le modèle de chat Ling 3.0 (Bailing V3) dans la pull request #28682. Cette modification résout les problèmes où les blocs de pensée pré-ouverts du modèle causaient une classification incorrecte des appels d'outils en tant que contenu de raisonnement, entraînant des échecs des boucles d'agents.

Le nouvel analyseur termine le raisonnement à la balise think de fermeture ou au début d'une balise d'appel d'outil, imitant le comportement dans vLLM et SGLang. Il comprend des tests complets pour les blocs think non fermés, les appels parallèles et divers types d'arguments.

Cette mise à jour garantit que les clients reçoivent correctement les appels d'outils au lieu de contenu vide, permettant aux boucles d'agents de fonctionner correctement avec les modèles Ling 3.0.