Local inference
media Hugging Face Forums · 2時間前 · 2 回表示

vLLM Launcher がローカル LLM 推論用の Windows デスクトップワークベンチを提供

WSL2 を介してローカル大規模言語モデルの推論を管理するために設計された、vLLM Launcher という新しいプロジェクトが Windows デスクトップアプリケーションとしてリリースされました。このツールを使用すると、vLLM、SGLang、llama.cpp を含む複数のエンジンバックエンドを単一のグラフィカルインターフェースから制御できます。

github llama.cpp · 16時間前 · 5 回表示

llama.cpp b10328 が Docker を介したサーバーツールの初期分離を追加

llama.cpp プロジェクトはビルド b10328 をリリースし、Docker を使用してサーバーコンポーネント内のツールを分離する初期サポートを導入しました。このアップデートには、ツール I/O サンドボックスの分離と関連設定フラグのリネームのためのドキュメントとコード適応が含まれています。

github llama.cpp · 5日前 · 5 回表示

llama.cpp b10270 が Qwen3-TTS サポートを追加し、llama-tts に破壊的変更を導入

llama.cpp プロジェクトはバージョン b10270 をリリースし、Qwen3-TTS モデルのサポートを導入しました。このアップデートには llama-tts バイナリに対する破壊的変更が含まれ、新しいテキストから音声への変換ワークフローを処理するための重要なアーキテクチャ修正が実装されました。

github llama.cpp · 8日前 · 10 回表示

llama.cpp b10219 がチャット履歴に reasoning_content を永続化

llama.cpp プロジェクトはバージョン b10219 をリリースし、チャット履歴内に推論コンテンツを永続化する CLI の修正が含まれています。以前は、`llama-cli` がストリームから推論を収集して表示していましたが、メッセージにはアシスタントのコンテンツのみが保存されており、`--reasoning-preserve` フラグが後のターンで以前の思考を再注入できませんでした。