llama.cpp 프로젝트는 빌드 b10760을 출시했으며, 이는 추론 중 수치적 불안정성을 방지하기 위해 Qwen3-tts-0.6B 모델에 대한 특정 수정을 포함합니다.

  • mtmd 로더는 이제 qwen3-tts 코드 예측기의 proj_in을 선택적으로 처리하여 이 텐서를 생략하는 참조 구현과 일치합니다.
  • 코드 예측기의 ffn_down 레이어는 활성화가 약 1.5e5에서 피크에 도달하여 F16 한계를 초과하고 NaN 오류를 유발하므로 F32 정밀도로 유지됩니다.

이러한 변경은 그래프가 누락된 가중치를 올바르게 처리하고 이 특정 체크포인트의 고활성화 레이어에서 오버플로를 방지함을 보장합니다.