llama.cpp 프로젝트는 pull request #28682에서 Ling 3.0 (Bailing V3) 채팅 템플릿을 위한 전용 파서를 도입했습니다. 이 변경은 모델의 미리 열린 사고 블록이 도구 호출을 추론 콘텐츠로 잘못 분류하여 에이전트 루프가 실패하는 문제를 해결합니다.
새로운 파서는 닫힌 think 태그 또는 도구 호출 태그 시작 시 추론을 종료하며, vLLM 및 SGLang의 동작을 반영합니다. 여기에는 닫히지 않은 think 블록, 병렬 호출 및 다양한 인수 유형에 대한 포괄적인 테스트가 포함되어 있습니다.
이 업데이트는 클라이언트가 빈 콘텐츠 대신 도구 호출을 올바르게 수신하도록 보장하여 Ling 3.0 모델에서 에이전트 루프가 제대로 작동하게 합니다.