Hardware & chips
github llama.cpp · 3日前 · 20 回表示

llama.cpp b11059がMetal FWHTカーネルにF16サポートを追加

llama.cppプロジェクトは、Apple Siliconハードウェア向けのMetalバックエンドに重要な更新をもたらすビルドb11059をリリースしました。主な変更点は、高速ウォルシュ・アダマール変換(FWHT)カーネルへのF16入力サポートの追加であり、変換されたコピーを必要とせずにF16ソースを直接読み取ることが可能になります。

github llama.cpp · 5日前 · 21 回表示

llama.cpp、Vulkanのmul_mat_idエキスパート制限を1024に引き上げ

llama.cppプロジェクトは、Vulkanのmul_mat_id操作におけるホストされたrow-idの制限を256から1024のエキスパート数へ引き上げました。この変更は、Qwen3.8-Flash-Nextのように多数のエキスパートを持つモデルでのパフォーマンスボトルネックに対処するもので、以前は共有配列サイズの制約により低速なコードパスで実行されていました。

github llama.cpp · 7日前 · 20 回表示

llama.cpp b10994 が mul_mm_id の大規模活性化における Metal NaN を修正

llama.cpp b10994 リリースには、活性化値が f16 範囲を超えた場合に `mul_mm_id` 演算で NaN 出力が発生する問題を解決する Metal バックエンドの修正が含まれています。この欠陥により、以前は Apple Silicon デバイス上で 32 トークン以上のプリフィルステップ中に Mistral Small 4 などのモデルが完全に NaN の語彙を生成していました。

lab NVIDIA Research · 7日前 · 16 回表示

ShareMMUは低オーバーヘッドで信頼できないアクセラレータ間の安全なアドレス変換共有を可能にする

研究者らは、複数の信頼できないアクセラレータが共有仮想アドレス空間内で事前に翻訳されたアドレスを安全に再利用できるようにするIOMMU設計であるShareMMUを発表しました。このアプローチは、大きな共有翻訳傍受バッファ(TLB)に関連するサイドチャネルリスクを軽減しつつ、高いパフォーマンスを維持します。

media Hugging Face Forums · 11日前 · 13 回表示

ベンダーニュートラルなメモリ予算対応実行を備えたAIランタイムの提案

Hugging Faceフォーラムでの提案は、NVIDIA、AMD、Intelといった特定のハードウェアベンダーからアプリケーションコードを切り離すために設計された共通のGPU実行およびメモリ管理レイヤーについて述べています。この目的は、ユーザーがバックエンド固有のフラグ、デバイスマップ、またはオフロード戦略を手動で設定するのではなく、メモリ予算を指定できるようにすることです。

lab NVIDIA Research · 11日前 · 21 回表示

NVIDIA、GPU加速プライベート情報取得のためのGPIRをリリース

NVIDIAの研究チームは、格子ベースプロトコルに固有の高いサーバー側計算とメモリトラフィックに対処することで、GPU上でのプライベート情報取得(PIR)を加速するシステムGPIRを発表しました。このシステムは、チップ内データ再利用を最大化するために、演算レベルとステージレベルのカーネルの間で動的に切り替えるステージ対応型ハイブリッド実行モデルを採用しています。

lab NVIDIA Research · 11日前 · 21 回表示

NVIDIAがPPMLのMPCおよびFHEのパフォーマンスとコストを特性評価

新しい研究は、プライバシー保護機械学習推論のための安全なマルチパーティ計算(MPC)および完全ホモモフィック暗号(FHE)の統一されたシステムレベルでの特性評価を示しています。この作業は、複数のCNNおよびTransformerモデルにおいて、2つのMPCバリアント—算術/バイナリ共有変換および関数秘密共有—とFHEを評価します。

media Together AI Blog · 13日前 · 16 回表示

Together GPU Clustersに50%コストのプリエンプティブルノードを追加

Together AIは、Kubernetes上のTogether GPU Clusters向けにプリエンプティブルコンピューティングのパブリックプレビューを発表し、中断許容ワークロードに対して低コストのオプションを提供します。プリエンプティブルノードは未使用のNVIDIA accelerated容量を利用し、オンデマンド料金の固定50%で請求されます。

github llama.cpp · 13日前 · 19 回表示

llama.cpp b10891、共有メモリへのフォールバックによりPowerVR Vulkanのクラッシュを修正

llama.cppプロジェクトは、PowerVR GPUにおける重大な安定性問題を解決するバージョンb10891をリリースしました。このアップデートでは、Vulkanバックエンドが量子化解除された行列-ベクトル乗算(dmmv)演算に対して共有メモリへのリダクションにフォールバックするように変更されました。

lab OpenAI News · 15日前 · 39 回表示

MITのGPT-5.6 SolがCodexを介して量子チップのキャリブレーションを自動化

MITのエンジニアリング・クアンタム・システムズ・グループのBeatriz Yankelevichは、Codexと統合されたGPT‑5.6 Solを使用して、超伝導量子ビットの定期的な測定を自律的に実行し、精緻化しました。この統合により、AIエージェントは実験室ソフトウェアを操作し、結果を分析し、人間の絶え間ない監視なしに次のステップを決定できます。

github llama.cpp · 16日前 · 44 回表示

llama.cpp b10839がVulkanのGET_ROWSにおけるアラインメントされていないオフセットによるクラッシュを修正

llama.cppプロジェクトはバージョンb10839をリリースし、テンソル行の取得操作中にアラインメントされていないオフセットが原因で発生していたVulkanバックエンドでの深刻なクラッシュを解消しました。従来、Qwen3-TTSやQwen3-VLなどのモデルでは、`minStorageBufferOffsetAlignment`に対するアラインメント違反に対してシェーダーがアサートを行うため、非ゼロのビューオフセットを持つ`ggml_view`を使用すると失敗していました。今回の更新では、量子化済みおよび非量子化済みの両方のパスでアラインメントされたオフセットのネイティブサポートを実装し、CPUフォールバックを不要にしました。