vLLM Launcher가 로컬 LLM 추론을 위한 Windows 데스크톱 작업대 제공
WSL2를 통해 로컬 대규모 언어 모델 추론을 관리하도록 설계된 vLLM Launcher라는 새로운 프로젝트가 Windows 데스크톱 애플리케이션으로 출시되었습니다. 이 도구를 사용하면 단일 그래픽 인터페이스에서 vLLM, SGLang 및 llama.cpp를 포함한 여러 엔진 백엔드를 제어할 수 있습니다.
WSL2를 통해 로컬 대규모 언어 모델 추론을 관리하도록 설계된 vLLM Launcher라는 새로운 프로젝트가 Windows 데스크톱 애플리케이션으로 출시되었습니다. 이 도구를 사용하면 단일 그래픽 인터페이스에서 vLLM, SGLang 및 llama.cpp를 포함한 여러 엔진 백엔드를 제어할 수 있습니다.
llama.cpp 프로젝트는 서버의 `get_info` 엔드포인트에 대한 수정을 포함한 빌드 b10331을 출시했습니다. 이전에 명시적인 현재 작업 디렉토리가 제공되지 않은 경우, tools runtime이 구성되어 있더라도 함수가 서버 프로세스의 작업 디렉토리로 잘못 폴백되었습니다.
llama.cpp 프로젝트는 rms_norm, 곱셈, RoPE 연산을 단일 커널로 융합하는 CUDA 최적화를 도입한 버전 b10330을 출시했습니다. 이 변경에는 융합된 연산에 대한 메모리 범위 확인과 브로드캐스트 가중치를 위한 새로운 테스트 케이스가 포함됩니다.
llama.cpp 프로젝트는 Docker를 사용하여 서버 구성 요소 내에서 도구를 격리하는 초기 지원을 도입한 빌드 b10328을 출시했습니다. 이 업데이트에는 도구 I/O 샌드박스 분리와 관련 구성 플래그 이름 변경을 위한 문서 및 코드 적응이 포함되어 있습니다.
llama.cpp 프로젝트는 CUDA에서 양자화된 복사 커널 실행 시 스레드 및 블록 수에 대한 수정을 포함한 버전 b10327을 출시했습니다. 이 업데이트는 pull request #26731에서 식별된 문제를 해결합니다.
llama.cpp 프로젝트는 보코더 패스를 포함하여 타이밍 측정 계산 방식을 수정하는 빌드 b10326을 출시했습니다.
llama.cpp 프로젝트는 Metal에서 GGML_OP_NORM 및 GGML_OP_RMS_NORM 연산에 대한 중요한 수정 사항을 포함하는 버전 b10321을 출시했습니다. 이 업데이트는 스레드 그룹 크기가 부분 SIMD 그룹을 남기도록 설정되었을 때, 누락된 부분 합계로 인해 평균과 분산 계산이 잘못되는 문제를 해결합니다.
llama.cpp 프로젝트는 SYCL 백엔드에서 SSM_CONV 창 로드를 결합하는 성능 최적화를 포함한 빌드 b10322를 출시했습니다.
llama.cpp 프로젝트는 서버 구성 요소에 Least Recently Used (LRU) 스케줄러를 도입한 버전 b10313을 출시했습니다. 이 업데이트에는 요청 병합 처리 및 스트리밍 사례에 대한 수정 사항이 포함됩니다.
llama.cpp 프로젝트는 Qwen3-TTS 파이프라인에 대한 수정을 포함한 빌드 b10311을 출시했습니다. 이 업데이트는 모델이 생성 중에 입력 발화를 두 번 읽는 문제를 해결합니다.
llama.cpp 프로젝트가 서버 구성 요소에 특정 업데이트를 포함한 버전 b10312를 출시했습니다. 주요 변경 사항은 라우터에서 바쁜 모델이 제거되는 문제를 해결하는 것입니다.
llama.cpp 프로젝트는 NVFP4 양자화에 사용되는 UE4M3 스케일링 계수를 올바르게 파싱하기 위한 SYCL GPU 코드 수정을 포함한 버전 b10307을 출시했습니다.
llama.cpp 프로젝트는 SYCL 백엔드 내에서 특정 DSv4 연산에 대한 지원을 도입한 빌드 b10305을 출시했습니다. 이 업데이트에는 LIGHTNING_INDEXER, DSV4_HC_COMB, DSV4_HC_POST 및 DSV4_HC_PRE 연산자의 구현이 포함됩니다.
llama.cpp b10306 릴리스는 게이트드 리니어 유닛(GLU) 연산을 대상으로 하는 SYCL 백엔드의 성능 최적화를 도입합니다. 이 업데이트는 융합된 GLU 연산에 대한 연속적인 고속 경로를 추가하고, 이전에 별개였던 커널을 통합하여 공통 런처를 공유하도록 합니다.
llama.cpp 프로젝트는 mtmd 모듈을 위한 새로운 청크 저장 및 로드 기능을 도입한 빌드 b10298을 출시했습니다. 이 업데이트에는 코드 정리와 추가 테스트도 포함되어 있습니다.
llama.cpp 프로젝트가 빌드 b10293을 출시했으며, 여기에는 gfx1151 아키텍처에 대한 AMD ROCm 지속적 통합 온보딩과 통합 RDNA3.5 GPU의 정확성 문제가 해결되었습니다.
llama.cpp 프로젝트는 Vulkan 백엔드에 대한 중요한 수정 사항과 표준 플랫폼 업데이트를 포함하는 버전 b10291을 출시했습니다. 주요 기술적 변경 사항은 제출 배치 크기 문제를 해결하고 드라이버 오류에 대한 새로운 진단 기능을 도입합니다.
llama.cpp 프로젝트는 ggml 라이브러리에 새로운 `ggml_build_forward_order` 함수를 도입하는 빌드 b10290을 출시했습니다. 이 변경은 mtmd 오디오 그래프의 버그를 해결하며, `ggml_build_forward_expand`를 순수한 순서 힌트로 사용할 때 선택되지 않은 분기가 stale 입력으로 실행되는 문제를 수정합니다.
llama.cpp b10289 릴리스는 서버의 file_glob_search 디렉토리 순회를 강화하여 Windows 심볼릭 링크에서 무한 루프를 방지하고 읽을 수 없는 디렉토리에 대한 오류 보고를 개선했습니다.
QuantCheck라는 새로운 도구는 사전 훈련의 최종 체크포인트가 4비트 양자화에 최적의 선택이 아닐 수 있음을 강조합니다. 벤치마크가 평탄하게 유지되는 동안 취약성이 증가할 수 있기 때문입니다. 저자는 Pythia-160m에서 이 패턴을 관찰했으며, 최종 체크포인트는 동일한 품질의 이전 체크포인트보다 약 4배 더 많은 품질 손상을 입었습니다.