llama.cpp b11120, Vulkan 내부 심볼을 숨겨 상태 파괴 문제 해결
llama.cpp 프로젝트는 Vulkan 백엔드에서 내부 심볼을 숨김으로써 중대한 버그를 수정한 버전 b11120을 출시했습니다. 이 변경은 내부 심볼이 내보내질 때 발생하던 중복 dlopen 상태 파괴 문제를 방지합니다.
llama.cpp 프로젝트는 Vulkan 백엔드에서 내부 심볼을 숨김으로써 중대한 버그를 수정한 버전 b11120을 출시했습니다. 이 변경은 내부 심볼이 내보내질 때 발생하던 중복 dlopen 상태 파괴 문제를 방지합니다.
llama.cpp 프로젝트는 새로운 hex-dma 기능을 포함하는 빌드 b11118을 출시했으며, 이는 Hexagon Vector eXtended (HVX) FA 마스크 처리에 더 적합한 직접 매핑 DMA 캐시를 소개합니다.
llama.cpp 프로젝트는 타겟 그래프에서 레이어 입력 텐서를 노출하여 HunyuanOCR 모델과 함께 DFlash 추측 디코딩에 대한 지원을 추가했습니다. 이 변경 사항으로 드래프트 모델이 잔류 스트림을 읽을 수 있게 되어, 비추측 실행과 비교할 때 약 0.5의 드래프트 수용률과 바이트 단위로 동일한 OCR 출력을 유지하며 이미지 요청을 성공적으로 실행할 수 있습니다.
llama.cpp 프로젝트는 llama-server 구성 요소가 동시에 여러 네트워크 주소에 바인딩할 수 있는 새로운 기능을 도입한 버전 b11104를 출시했습니다.
llama.cpp 프로젝트는 MiMo-V2.6 모델 변환 지원을 도입한 빌드 b11102를 출시했습니다.
Hugging Face의 Transformers 라이브러리는 이제 기본 ggml 커널을 활용하여 llama.cpp에 가까운 성능을 제공하며 GGUF 양자화된 모델을 로드할 수 있게 되었습니다. 이 통합을 통해 개발자는 지원되는 하드웨어에서 표준 PyTorch 기반 API 내에서 양자화된 체크포인트를 직접 실행할 수 있습니다.
oMLX의 크리에이터이자 유지 관리자입니다. Jun Kim은 MLX 커뮤니티를 지원하기 위해 Hugging Face에 합류했습니다. 이 움직임은 사이드 프로젝트에서 완전히 유지되고 자금 지원되는 이니셔티브로 전환함으로써 오픈소스 프로젝트에 안정성과 더 빠른 개발을 제공하려는 목표입니다.
한 사용자가 ilsp/Llama-Krikri-8B-Instruct 체크포인트를 사용하여 로컬 배포용 무검열 그리스어 네이티브 대규모 언어 모델을 구축할 계획입니다. 제안된 계획은 Heretic(heretic-llm)을 사용하여 모델을 제거하고, GGUF Q4_K_M 형식으로 변환한 후 AMD Ryzen AI MAX+ 395 프로세서와 Vulkan을 탑재한 GMKtec EVO-X3에서 추론을 실행하는 것입니다.
llama.cpp 프로젝트가 버전 b11090을 출시했으며, 여기에는 sm_70 타일 컴파일 오류에 대한 수정이 포함되어 있습니다. 이 업데이트는 Volta 아키텍처와의 불일치를 해결하기 위해 5인자 load_ldmatrix 함수의 타일 모양을 일반화했습니다.
llama.cpp 프로젝트는 `test-llama-archs` 테스트 인프라에 여러 업데이트를 포함하는 빌드 b11081을 출시했습니다. 주요 변경 사항에는 텐서 데이터 표준편차를 구성 가능하게 만들고, 사용 예시를 확장하며, 아키텍처 정규식 패턴에 대한 지원을 추가하는 것이 포함됩니다.
llama.cpp 프로젝트는 JSON enum 처리에 대한 수정 사항을 포함한 빌드 b11074을 출시했습니다. 이 업데이트는 enum 값에 대한 common_json_value 지원을 추가하고, enum 생성자를 기본 형식의 생성자에 위임하여 코드를 단순화합니다.
llama.cpp 프로젝트가 빌드 b11067을 출시했으며, 이는 WebGPU 백엔드를 위해 융합된 GDN + 복사 작업을 도입했습니다.
llama.cpp 프로젝트는 빌드 b11060을 출시했으며, 여기에는 시간 단계 투영 입력이 연속적임을 보장하기 위한 Mamba 모델의 수정 사항이 포함되어 있습니다. 이 변경은 Mamba 구현 내의 메모리 레이아웃 문제를 해결합니다.
llama.cpp 프로젝트가 Qualcomm Hexagon DSP에서 TOP_K 연산자에 대한 지원을 추가하는 버전 b11054를 출시했습니다. 이 업데이트에는 단일 행 처리에 대한 최적화와 행 분할 관련 수정 사항이 포함되어 있습니다.
llama.cpp 프로젝트가 버전 b11055를 출시하여 Hexagon DSP에서 GEGLU_QU 활성화 함수에 대한 지원을 도입했습니다.
llama.cpp 프로젝트는 서버 시작 로그 메시지에 특정 개선을 포함하는 버전 b11053을 출시했습니다. 이 변경은 모호한 마커를 명시적인 소스 태그로 교체하여 모델이 어떻게 로드되는지에 대한 가시성을 향상시킵니다.
llama.cpp 프로젝트가 빌드 b11048을 출시하여 qwen4exp에서 사용하는 새로운 DSV4 HC 연산 변형의 지원을 도입했습니다. 이 업데이트에는 요소별 시그모이드 게이트가 있는 hc_pre와 동일 혼합이 있는 hc_post에 대한 구체적인 구현이 포함됩니다.
Celestium CARE의 NVIDIA 버전이 완료되어 GTX 및 RTX 그래픽 카드용 전문 도구로 제공되었습니다. VRAM 정리, 자동 정리 일정 및 전체 텔레메트리 모니터링과 같은 기능을 제공하기 위해 NVML을 사용합니다.
llama.cpp 프로젝트가 버전 b11046을 출시하여 `flash_attn_f32_f16_bin` 커널에 대한 OpenCL 지원을 도입했습니다. 이 업데이트에는 OpenCL 장치에서 Flash Attention을 위한 보호된 prefill 기능도 포함되어 있습니다.
llama.cpp 프로젝트는 A8 Q6_K 비-MoE 모델을 위한 새로운 OpenCL 이진 커널을 도입한 버전 b11042를 출시했습니다. 이 업데이트에는 OpenCL 백엔드 내의 레이아웃 호환성 수정도 포함되어 있습니다.