vLLM Launcher がローカル LLM 推論用の Windows デスクトップワークベンチを提供
WSL2 を介してローカル大規模言語モデルの推論を管理するために設計された、vLLM Launcher という新しいプロジェクトが Windows デスクトップアプリケーションとしてリリースされました。このツールを使用すると、vLLM、SGLang、llama.cpp を含む複数のエンジンバックエンドを単一のグラフィカルインターフェースから制御できます。
WSL2 を介してローカル大規模言語モデルの推論を管理するために設計された、vLLM Launcher という新しいプロジェクトが Windows デスクトップアプリケーションとしてリリースされました。このツールを使用すると、vLLM、SGLang、llama.cpp を含む複数のエンジンバックエンドを単一のグラフィカルインターフェースから制御できます。
llama.cpp プロジェクトはビルド b10331 をリリースしました。これにはサーバーの `get_info` エンドポイントの修正が含まれています。以前は明示的な現在の作業ディレクトリが提供されていない場合、tools runtime が設定されていても、関数は誤ってサーバープロセスの作業ディレクトリにフォールバックしていました。
llama.cpp プロジェクトはバージョン b10330 をリリースし、rms_norm、乗算、RoPE の操作を単一のカーネルに融合する CUDA 最適化を導入しました。この変更には、融合された操作のメモリ範囲チェックと、ブロードキャスト重みのための新しいテストケースが伴います。
llama.cpp プロジェクトはビルド b10328 をリリースし、Docker を使用してサーバーコンポーネント内のツールを分離する初期サポートを導入しました。このアップデートには、ツール I/O サンドボックスの分離と関連設定フラグのリネームのためのドキュメントとコード適応が含まれています。
llama.cpp プロジェクトはバージョン b10327 をリリースし、CUDA 上の量子化コピーカーネルの起動におけるスレッド数とブロック数の修正を含んでいます。このアップデートは pull request #26731 で特定された問題を解決します。
llama.cpp プロジェクトはビルド b10326 をリリースし、ボコーダパスを含めることでタイミング測定の計算方法を変更しました。
llama.cppプロジェクトがバージョンb10321をリリースしました。これにはMetalにおけるGGML_OP_NORMおよびGGML_OP_RMS_NORM演算の重要な修正が含まれています。
llama.cpp プロジェクトはビルド b10322 をリリースしました。これには、SYCL バックエンドで SSM_CONV ウィンドウ読み込みを結合するパフォーマンス最適化が含まれています。
llama.cpp プロジェクトはバージョン b10313 をリリースし、サーバー コンポーネントに Least Recently Used (LRU) スケジューラーを導入しました。このアップデートには、リクエストの結合処理とストリーミング ケースの修正が含まれます。
llama.cpp プロジェクトは、Qwen3-TTS パイプラインの修正を含むビルド b10311 をリリースしました。このアップデートは、モデルが生成中に入力発話を2回読み取る問題を解決します。
llama.cpp プロジェクトは、サーバー コンポーネントへの特定の変更を含むバージョン b10312 をリリースしました。主な変更点は、繁忙なモデルがルーターから削除される問題を解決することです。
llama.cpp プロジェクトはバージョン b10307 をリリースしました。これには、NVFP4 量子化で使用される UE4M3 スケーリング係数を正しくパースするための SYCL GPU コードの修正が含まれています。
llama.cpp プロジェクトはビルド b10305 をリリースし、SYCL バックエンド内で特定の DSv4 演算のサポートを導入しました。このアップデートには、LIGHTNING_INDEXER、DSV4_HC_COMB、DSV4_HC_POST、および DSV4_HC_PRE オペレータの実装が含まれます。
llama.cpp b10306リリースは、SYCLバックエンドのパフォーマンス最適化を導入し、特にゲートド・リニアユニット(GLU)演算を対象としています。この更新では、融合されたGLU演算用の連続した高速パスが追加され、以前は別々だったカーネルが共通のランチャーを共有するように統合されました。
llama.cpp プロジェクトはビルド b10298 をリリースし、mtmd モジュール用の新しいチャンクの保存および読み込み機能を導入しました。このアップデートにはコードのクリーンアップと追加テストも含まれています。
llama.cppプロジェクトはビルドb10293をリリースしました。これにはgfx1151アーキテクチャ向けのAMD ROCm継続的インテグレーションの導入と、統合RDNA3.5 GPUの正確性の問題の解決が含まれます。
llama.cpp プロジェクトはバージョン b10291 をリリースしました。これには Vulkan バックエンドの重要な修正と標準的なプラットフォーム更新が含まれています。主な技術的変更は、送信バッチサイズの課題に対処し、ドライバーエラー用の新しい診断機能を導入します。
llama.cpp プロジェクトはビルド b10290 をリリースし、ggml ライブラリに新しい `ggml_build_forward_order` 関数を導入しました。この変更は、mtmd オーディオグラフのバグに対処するもので、`ggml_build_forward_expand` を純粋な順序付けヒントとして使用すると、選択されていないブランチが古い入力を使用して実行されてしまう問題を修正します。
llama.cpp b10289 リリースでは、サーバーの file_glob_search ディレクトリウォークが強化され、Windows ジャンクションでの無限ループが防止され、読み込み不可なディレクトリのエラー報告が改善されました。
QuantCheckという新しいツールは、プレトレーニングの最終チェックポイントが4ビット量子化にとって最適な選択ではない可能性があると強調しています。ベンチマークが平坦なままであっても、脆弱性が増加する可能性があります。著者はPythia-160mでこのパターンを観察し、最終チェックポイントは同等の品質を持つ早期チェックポイントと比較して約4倍の品質ダメージを受けたことを示しました。