한 개발자가 NVIDIA의 Nemotron-3-Nano-Omni-30B 모델용 완전한 GGUF 패키지를 출시하여 llama.cpp 생태계에 이전에 누락되었던 오디오 및 비디오 지원을 추가했습니다. 이번 릴리스에는 Q3_K_M부터 BF16까지 다양한 9가지 양자화와 C-RADIO 비전과 Parakeet 오디오 인코더를 모두 통합하는 단일 프로젝터 파일이 포함되어 있습니다.

  • 전용 llama.cpp 포크는 Parakeet/FastConformer 오디오 그래프와 C-RADIO 비디오 그래프를 구현하여 사운드트랙이 포함된 비디오의 일괄 처리를 가능하게 합니다.
  • 비디오 그래프는 NVIDIA의 PyTorch 참조 구현 대비 상대 L2 오차가 0.0019%에 불과하며, 오디오 그래프는 테스트 내레이션을 단어 단위로 정확히 변환합니다.
  • DGX Spark 및 Jetson Thor과 같은 하드웨어를 위한 사전 빌드된 Linux arm64 CUDA 13 바이너리가 제공됩니다.

이 업데이트를 통해 사용자는 호환되는 하드웨어에서 단일 llama-server 인스턴스를 통해 이미지, 텍스트, 오디오, 비디오 모달리티를 동시에 실행할 수 있습니다.