vLLM Launcher가 로컬 LLM 추론을 위한 Windows 데스크톱 작업대 제공
WSL2를 통해 로컬 대규모 언어 모델 추론을 관리하도록 설계된 vLLM Launcher라는 새로운 프로젝트가 Windows 데스크톱 애플리케이션으로 출시되었습니다. 이 도구를 사용하면 단일 그래픽 인터페이스에서 vLLM, SGLang 및 llama.cpp를 포함한 여러 엔진 백엔드를 제어할 수 있습니다.
WSL2를 통해 로컬 대규모 언어 모델 추론을 관리하도록 설계된 vLLM Launcher라는 새로운 프로젝트가 Windows 데스크톱 애플리케이션으로 출시되었습니다. 이 도구를 사용하면 단일 그래픽 인터페이스에서 vLLM, SGLang 및 llama.cpp를 포함한 여러 엔진 백엔드를 제어할 수 있습니다.
llama.cpp 프로젝트는 rms_norm, 곱셈, RoPE 연산을 단일 커널로 융합하는 CUDA 최적화를 도입한 버전 b10330을 출시했습니다. 이 변경에는 융합된 연산에 대한 메모리 범위 확인과 브로드캐스트 가중치를 위한 새로운 테스트 케이스가 포함됩니다.
llama.cpp 프로젝트는 Docker를 사용하여 서버 구성 요소 내에서 도구를 격리하는 초기 지원을 도입한 빌드 b10328을 출시했습니다. 이 업데이트에는 도구 I/O 샌드박스 분리와 관련 구성 플래그 이름 변경을 위한 문서 및 코드 적응이 포함되어 있습니다.
llama.cpp 서버와 UI가 작업 디렉토리 컨트롤을 조건부로 표시하도록 업데이트되었습니다. 이전에는 내장 도구가 노출될 때마다 이 칩이 나타났지만, 실제로 아무 도구도 사용하지 않았습니다.
llama.cpp 프로젝트는 CUDA에서 양자화된 복사 커널 실행 시 스레드 및 블록 수에 대한 수정을 포함한 버전 b10327을 출시했습니다. 이 업데이트는 pull request #26731에서 식별된 문제를 해결합니다.
llama.cpp 프로젝트는 서버 구성 요소에 Least Recently Used (LRU) 스케줄러를 도입한 버전 b10313을 출시했습니다. 이 업데이트에는 요청 병합 처리 및 스트리밍 사례에 대한 수정 사항이 포함됩니다.
llama.cpp 프로젝트가 서버 구성 요소에 특정 업데이트를 포함한 버전 b10312를 출시했습니다. 주요 변경 사항은 라우터에서 바쁜 모델이 제거되는 문제를 해결하는 것입니다.
llama.cpp 프로젝트는 NVFP4 양자화에 사용되는 UE4M3 스케일링 계수를 올바르게 파싱하기 위한 SYCL GPU 코드 수정을 포함한 버전 b10307을 출시했습니다.
llama.cpp 프로젝트는 mtmd 모듈을 위한 새로운 청크 저장 및 로드 기능을 도입한 빌드 b10298을 출시했습니다. 이 업데이트에는 코드 정리와 추가 테스트도 포함되어 있습니다.
llama.cpp 프로젝트는 추론 디코딩을 위한 새로운 모니터링 기능을 도입한 버전 b10282를 출시했습니다. 서버는 이제 /metrics 엔드포인트에 spec-decode 카운터를 포함하여 사용자가 이 기능과 관련된 성능 메트릭을 추적할 수 있습니다.
llama.cpp b10271 릴리스는 UI에 대화별 작업 디렉토리 기능을 도입하여 각 채팅 세션마다 디렉토리를 독립적으로 설정하고 탐색할 수 있도록 합니다.
llama.cpp 프로젝트는 버전 b10270을 출시하여 Qwen3-TTS 모델에 대한 지원을 도입했습니다. 이 업데이트에는 llama-tts 바이너리에 대한 파괴적 변경 사항이 포함되어 있으며, 새로운 텍스트 음성 변환 워크플로우를 처리하기 위해 중요한 아키텍처 수정이 구현되었습니다.
llama.cpp 프로젝트는 로드 과정에서 텐서의 재구성을 허용하는 기능을 도입한 빌드 b10259을 출시했습니다.
llama.cpp 프로젝트는 버전 b10254를 출시하며 DeepSeek V4 Flash 0731 모델용 새 채팅 템플릿을 도입하고 기존 DeepSeek V4 템플릿을 업데이트했습니다.
llama.cpp 프로젝트는 GLM-4.7-Flash 모델에 대한 멀티 토큰 예측(MTP) 지원을 도입한 빌드 b10251을 출시했습니다.
llama.cpp 프로젝트는 Qwen3-Next 모델 계열에 대한 Multi-Token Prediction (MTP) 지원을 도입한 빌드 b10238을 출시했습니다. 이 업데이트에는 MTP 레이어를 처리하기 위한 특정 구현 변경 사항과 코드베이스 내 Python 타입 체크와 관련된 수정 사항이 포함되어 있습니다.
llama.cpp 프로젝트가 빌드 b10237을 출시하여 DeepSeek V3.2 모델에 대한 멀티 토큰 예측(MTP) 지원을 도입했습니다.
llama.cpp 프로젝트는 Metal 백엔드를 통해 DeepSeek V4 하이퍼커넥션 지원을 도입한 빌드 b10232를 출시했습니다. 이 업데이트에는 GGML_OP_DSV4_HC_COMB, GGML_OP_DSV4_HC_PRE 및 GGML_OP_DSV4_HC_POST 연산의 구현이 추가되었습니다.
llama.cpp 프로젝트는 채팅 기록 내에서 추론 콘텐츠를 유지하는 CLI 수정 사항을 포함한 버전 b10219를 출시했습니다. 이전에는 `llama-cli`가 스트림에서 추론을 수집하여 표시했지만 메시지에는 어시스턴트 콘텐츠만 저장되어 있어 `--reasoning-preserve` 플래그가 이후 턴에서 이전 생각을 다시 주입하지 못했습니다.
llama.cpp 프로젝트가 버전 b10213을 출시하여 회전된 키-값 캐시 양자화에 대한 지원을 도입했습니다. 이 업데이트는 광범위한 플랫폼과 하드웨어 가속기에서 사용할 수 있습니다.