Inference efficiency
media Hugging Face Forums · 2시간 전 · 조회수 2회

vLLM Launcher가 로컬 LLM 추론을 위한 Windows 데스크톱 작업대 제공

WSL2를 통해 로컬 대규모 언어 모델 추론을 관리하도록 설계된 vLLM Launcher라는 새로운 프로젝트가 Windows 데스크톱 애플리케이션으로 출시되었습니다. 이 도구를 사용하면 단일 그래픽 인터페이스에서 vLLM, SGLang 및 llama.cpp를 포함한 여러 엔진 백엔드를 제어할 수 있습니다.

github llama.cpp · 3일 전

llama.cpp b10290이 오디오 그래프 실행을 수정하기 위해 ggml_build_forward_order 추가

llama.cpp 프로젝트는 ggml 라이브러리에 새로운 `ggml_build_forward_order` 함수를 도입하는 빌드 b10290을 출시했습니다. 이 변경은 mtmd 오디오 그래프의 버그를 해결하며, `ggml_build_forward_expand`를 순수한 순서 힌트로 사용할 때 선택되지 않은 분기가 stale 입력으로 실행되는 문제를 수정합니다.

media Hugging Face Forums · 3일 전 · 조회수 1회

QuantCheck, 4비트 양자화에 최종 체크포인트가 최선이라고 가정하지 말라고 경고

QuantCheck라는 새로운 도구는 사전 훈련의 최종 체크포인트가 4비트 양자화에 최적의 선택이 아닐 수 있음을 강조합니다. 벤치마크가 평탄하게 유지되는 동안 취약성이 증가할 수 있기 때문입니다. 저자는 Pythia-160m에서 이 패턴을 관찰했으며, 최종 체크포인트는 동일한 품질의 이전 체크포인트보다 약 4배 더 많은 품질 손상을 입었습니다.