Inference efficiency
media Hugging Face Forums · 2時間前 · 2 回表示

vLLM Launcher がローカル LLM 推論用の Windows デスクトップワークベンチを提供

WSL2 を介してローカル大規模言語モデルの推論を管理するために設計された、vLLM Launcher という新しいプロジェクトが Windows デスクトップアプリケーションとしてリリースされました。このツールを使用すると、vLLM、SGLang、llama.cpp を含む複数のエンジンバックエンドを単一のグラフィカルインターフェースから制御できます。

github llama.cpp · 9時間前 · 4 回表示

llama.cpp b10331 がサーバーの get_info を修正し、隔離された作業ディレクトリを正しく報告

llama.cpp プロジェクトはビルド b10331 をリリースしました。これにはサーバーの `get_info` エンドポイントの修正が含まれています。以前は明示的な現在の作業ディレクトリが提供されていない場合、tools runtime が設定されていても、関数は誤ってサーバープロセスの作業ディレクトリにフォールバックしていました。

github llama.cpp · 16時間前 · 5 回表示

llama.cpp b10328 が Docker を介したサーバーツールの初期分離を追加

llama.cpp プロジェクトはビルド b10328 をリリースし、Docker を使用してサーバーコンポーネント内のツールを分離する初期サポートを導入しました。このアップデートには、ツール I/O サンドボックスの分離と関連設定フラグのリネームのためのドキュメントとコード適応が含まれています。

github llama.cpp · 2日前 · 1 回表示

llama.cpp b10306がSYCL GLUフラットパスを追加し、カーネルを統合

llama.cpp b10306リリースは、SYCLバックエンドのパフォーマンス最適化を導入し、特にゲートド・リニアユニット(GLU)演算を対象としています。この更新では、融合されたGLU演算用の連続した高速パスが追加され、以前は別々だったカーネルが共通のランチャーを共有するように統合されました。

github llama.cpp · 3日前 · 1 回表示

llama.cpp b10291 が Vulkan の送信バッチ処理を修正し、DeviceLost デバッグツールを追加

llama.cpp プロジェクトはバージョン b10291 をリリースしました。これには Vulkan バックエンドの重要な修正と標準的なプラットフォーム更新が含まれています。主な技術的変更は、送信バッチサイズの課題に対処し、ドライバーエラー用の新しい診断機能を導入します。

github llama.cpp · 3日前

llama.cpp b10290 が ggml_build_forward_order を追加してオーディオグラフの実行を修正

llama.cpp プロジェクトはビルド b10290 をリリースし、ggml ライブラリに新しい `ggml_build_forward_order` 関数を導入しました。この変更は、mtmd オーディオグラフのバグに対処するもので、`ggml_build_forward_expand` を純粋な順序付けヒントとして使用すると、選択されていないブランチが古い入力を使用して実行されてしまう問題を修正します。

media Hugging Face Forums · 3日前 · 1 回表示

QuantCheck、4ビット量子化において最終チェックポイントが最適であると仮定しないよう警告

QuantCheckという新しいツールは、プレトレーニングの最終チェックポイントが4ビット量子化にとって最適な選択ではない可能性があると強調しています。ベンチマークが平坦なままであっても、脆弱性が増加する可能性があります。著者はPythia-160mでこのパターンを観察し、最終チェックポイントは同等の品質を持つ早期チェックポイントと比較して約4倍の品質ダメージを受けたことを示しました。