llama.cpp 프로젝트는 백엔드 성능, 광범위한 모델 커버리지, 그리고 더 견고한 서버 운영에 중점을 둔 버전 0.5.0을 출시했습니다. 이 업데이트는 HRM-Text (DFM Mimir 1B) 및 MiMo-V2.6과 같은 새로운 아키텍처에 대한 지원을 도입하고, CUDA 및 Metal 최적화를 통해 계산 효율성을 크게 향상시킵니다.

  • 암시적 GEMM을 사용하여 CUDA conv2d 작업을 가속화합니다.
  • Metal MoE 및 SSM_CONV 융합 최적화를 추가합니다.
  • 서버가 쉼표로 구분된 TCP 주소와 UNIX 소켓을 통해 여러 주소에 바인딩할 수 있도록 합니다.
  • input_image 지원을 추가하여 함수 호출에서 이미지 출력을 가능하게 합니다.
  • ggml을 v0.25.0으로 업데이트하여 백엔드 전반에 하이퍼 커넥션 및 플래시 어텐션 지원을 확장합니다.

이번 릴리스는 라우터가 생성한 자식 프로세스의 안정성을 개선하고 여러 채팅 파서 문제를 수정하여 llama.cpp를 프로덕션 환경에서 배포하는 사용자에게 더 안정적인 운영을 보장합니다.