llama.cpp 프로젝트는 빌드 b11307을 출시하여 추론 디코딩 중 원래 배치 시퀀스를 보존하기 위해 레이어 입력 순서를 수정했습니다. 이 변경은 마스크되지 않은 NextN 임베딩의 토큰 순서가 올바르게 유지되고 텐서 분할과 호환되도록 보장합니다.

  • 오프셋 0에서 마이크로배치 텐서를 복사하여 동기화 후 원래 행 순서를 복원합니다.
  • 레이어 입력 캡처가 비활성화된 경우에도 마스크되지 않은 NextN 행에 대해 원본 토큰 매핑을 사용합니다.
  • WebGPU 예약 및 OpenVINO 은닉 상태 캡처 문제를 수정했습니다.
  • Qwen3.8-27B가 MT-Bench를 동시성 16으로 완료하는 것을 포함하여 256개 CPU/CUDA/텐서 구성에서 검증되었습니다.

이 업데이트는 레이어 입력 및 임베딩의 순서 손상을 방지하여 추론 디코딩 워크플로우의 정확성을 보장합니다.