vLLM Launcher がローカル LLM 推論用の Windows デスクトップワークベンチを提供
WSL2 を介してローカル大規模言語モデルの推論を管理するために設計された、vLLM Launcher という新しいプロジェクトが Windows デスクトップアプリケーションとしてリリースされました。このツールを使用すると、vLLM、SGLang、llama.cpp を含む複数のエンジンバックエンドを単一のグラフィカルインターフェースから制御できます。
WSL2 を介してローカル大規模言語モデルの推論を管理するために設計された、vLLM Launcher という新しいプロジェクトが Windows デスクトップアプリケーションとしてリリースされました。このツールを使用すると、vLLM、SGLang、llama.cpp を含む複数のエンジンバックエンドを単一のグラフィカルインターフェースから制御できます。
llama.cpp プロジェクトはバージョン b10330 をリリースし、rms_norm、乗算、RoPE の操作を単一のカーネルに融合する CUDA 最適化を導入しました。この変更には、融合された操作のメモリ範囲チェックと、ブロードキャスト重みのための新しいテストケースが伴います。
llama.cpp プロジェクトはビルド b10328 をリリースし、Docker を使用してサーバーコンポーネント内のツールを分離する初期サポートを導入しました。このアップデートには、ツール I/O サンドボックスの分離と関連設定フラグのリネームのためのドキュメントとコード適応が含まれています。
llama.cpp サーバーと UI が、作業ディレクトリのコントロールを条件付きで表示するように更新されました。以前は、組み込みツールが公開されるたびにこのチップが表示されていましたが、実際にはどのツールも使用していませんでした。
llama.cpp プロジェクトはバージョン b10327 をリリースし、CUDA 上の量子化コピーカーネルの起動におけるスレッド数とブロック数の修正を含んでいます。このアップデートは pull request #26731 で特定された問題を解決します。
llama.cpp プロジェクトはバージョン b10313 をリリースし、サーバー コンポーネントに Least Recently Used (LRU) スケジューラーを導入しました。このアップデートには、リクエストの結合処理とストリーミング ケースの修正が含まれます。
llama.cpp プロジェクトは、サーバー コンポーネントへの特定の変更を含むバージョン b10312 をリリースしました。主な変更点は、繁忙なモデルがルーターから削除される問題を解決することです。
llama.cpp プロジェクトはバージョン b10307 をリリースしました。これには、NVFP4 量子化で使用される UE4M3 スケーリング係数を正しくパースするための SYCL GPU コードの修正が含まれています。
llama.cpp プロジェクトはビルド b10298 をリリースし、mtmd モジュール用の新しいチャンクの保存および読み込み機能を導入しました。このアップデートにはコードのクリーンアップと追加テストも含まれています。
llama.cpp プロジェクトはバージョン b10282 をリリースし、推論デコーディングの新しいモニタリング機能を紹介しました。サーバーは now /metrics エンドポイントに spec-decode カウンターを含み、ユーザーはこの機能に関連するパフォーマンスメトリクスを追跡できます。
llama.cpp b10271 リリースは、UIに会話ごとの作業ディレクトリ機能を導入し、各チャットセッションごとにディレクトリを独立して設定およびナビゲートできるようにします。
llama.cpp プロジェクトはバージョン b10270 をリリースし、Qwen3-TTS モデルのサポートを導入しました。このアップデートには llama-tts バイナリに対する破壊的変更が含まれ、新しいテキストから音声への変換ワークフローを処理するための重要なアーキテクチャ修正が実装されました。
llama.cpp プロジェクトはビルド b10259 をリリースし、ロードプロセス中にテンソルの形状を変更する機能を導入しました。
llama.cppプロジェクトはバージョンb10254をリリースし、DeepSeek V4 Flash 0731モデル用の新しいチャットテンプレートを導入するとともに、既存のDeepSeek V4テンプレートを更新しました。
llama.cpp プロジェクトは、GLM-4.7-Flash モデルのマルチトークン予測 (MTP) サポートを導入したビルド b10251 をリリースしました。
llama.cpp プロジェクトはビルド b10238 をリリースし、Qwen3-Next モデルファミリーに対して Multi-Token Prediction (MTP) サポートを導入しました。このアップデートには、MTP レイヤーを処理するための特定の実装変更と、コードベース内の Python 型チェックに関連する修正が含まれています。
llama.cpp プロジェクトはビルド b10237 をリリースし、DeepSeek V3.2 モデル向けのマルチトークン予測(MTP)サポートを導入しました。
llama.cpp プロジェクトはビルド b10232 をリリースし、Metal バックエンドを介して DeepSeek V4 ハイパー接続のサポートを導入しました。このアップデートにより、GGML_OP_DSV4_HC_COMB、GGML_OP_DSV4_HC_PRE、および GGML_OP_DSV4_HC_POST 演算の実装が追加されました。
llama.cpp プロジェクトはバージョン b10219 をリリースし、チャット履歴内に推論コンテンツを永続化する CLI の修正が含まれています。以前は、`llama-cli` がストリームから推論を収集して表示していましたが、メッセージにはアシスタントのコンテンツのみが保存されており、`--reasoning-preserve` フラグが後のターンで以前の思考を再注入できませんでした。
llama.cppプロジェクトはバージョンb10213をリリースし、回転したキーバリューキャッシュの量子化のサポートを導入しました。このアップデートは幅広いプラットフォームとハードウェアアクセラレーターで利用可能です。