llama.cpp プロジェクトは、pull request #28682 で Ling 3.0 (Bailing V3) チャットテンプレート専用のパーサーを導入しました。この変更は、モデルの事前開かれた思考ブロックがツール呼び出しを推論コンテンツとして誤分類し、エージェントループの失敗につながっていた問題を解決します。
新しいパーサーは、閉じられた think タグまたはツール呼び出しタグの開始時に推論を終了し、vLLM および SGLang の動作を模倣しています。これには、閉じられていない think ブロック、並列呼び出し、およびさまざまな引数のタイプに対する包括的なテストが含まれています。
この更新により、クライアントは空の内容ではなくツール呼び出しを正しく受信し、Ling 3.0 モデルでエージェントループが正常に機能するようになります。