El proyecto llama.cpp ha introducido un analizador dedicado para la plantilla de chat de Ling 3.0 (Bailing V3) en el pull request #28682. Este cambio aborda problemas donde los bloques de pensamiento preabiertos del modelo causaban que las llamadas a herramientas se clasificaran incorrectamente como contenido de razonamiento, lo que provocaba fallos en los bucles de agentes.

El nuevo analizador termina el razonamiento en la etiqueta think de cierre o al inicio de una etiqueta de llamada a herramienta, imitando el comportamiento en vLLM y SGLang. Incluye pruebas exhaustivas para bloques think sin cerrar, llamadas paralelas y varios tipos de argumentos.

Esta actualización asegura que los clientes reciban correctamente las llamadas a herramientas en lugar de contenido vacío, permitiendo que los bucles de agentes funcionen correctamente con modelos Ling 3.0.