O projeto llama.cpp introduziu um analisador dedicado para o modelo de chat Ling 3.0 (Bailing V3) no pull request #28682. Esta alteração aborda problemas em que os blocos de pensamento pré-abertos do modelo faziam com que as chamadas de ferramentas fossem classificadas incorretamente como conteúdo de raciocínio, levando a falhas nos loops de agentes.

O novo analisador termina o raciocínio na tag think de fechamento ou no início da tag de chamada de ferramenta, espelhando o comportamento no vLLM e SGLang. Ele inclui testes abrangentes para blocos think não fechados, chamadas paralelas e vários tipos de argumentos.

Esta atualização garante que os clientes recebam corretamente as chamadas de ferramentas em vez de conteúdo vazio, permitindo que os loops de agentes funcionem corretamente com modelos Ling 3.0.