Local inference
media Hugging Face Forums · 2시간 전 · 조회수 2회

vLLM Launcher가 로컬 LLM 추론을 위한 Windows 데스크톱 작업대 제공

WSL2를 통해 로컬 대규모 언어 모델 추론을 관리하도록 설계된 vLLM Launcher라는 새로운 프로젝트가 Windows 데스크톱 애플리케이션으로 출시되었습니다. 이 도구를 사용하면 단일 그래픽 인터페이스에서 vLLM, SGLang 및 llama.cpp를 포함한 여러 엔진 백엔드를 제어할 수 있습니다.

github llama.cpp · 8일 전 · 조회수 10회

llama.cpp b10219 채팅 기록에 reasoning_content 유지

llama.cpp 프로젝트는 채팅 기록 내에서 추론 콘텐츠를 유지하는 CLI 수정 사항을 포함한 버전 b10219를 출시했습니다. 이전에는 `llama-cli`가 스트림에서 추론을 수집하여 표시했지만 메시지에는 어시스턴트 콘텐츠만 저장되어 있어 `--reasoning-preserve` 플래그가 이후 턴에서 이전 생각을 다시 주입하지 못했습니다.