トピック · Inference efficiency
lab Microsoft Research Blog · 8日前 · 28 回表示

Microsoft Research、物理AI推論のオフロードがロボットの性能とバッテリー寿命を向上させることを示す

Microsoft Researchは、物理AI推論がオンボードのロボットGPUでのみ実行されなければならないという前提に挑戦し、エッジまたはクラウドインフラストラクチャへのオフロードがモバイルマニピュレーションワークロードを大幅に強化することを実証した。彼らのロボティクスワークロードに対する体系的な調査により、オンボードコンピューティングに依存することが性能、バッテリー寿命、スケーラビリティを制限することが明らかになった。

lab NVIDIA Research · 17日前 · 20 回表示

FastGen-PDDが高速な動画・画像生成のための並列デコーディング蒸留を導入

研究者らが、拡散モデルやフローマッチングモデルの推論を加速するための簡素化された軌道ベース手法であるParallel Decoding Distillation (PDD)を紹介する。現在の手法が最適化が困難な変分スコア蒸留や敵対的損失に依存しているのに対し、PDDは1回のネットワーク評価で複数のノイズ除去ステップを予測する。

lab NVIDIA Research · 20日前 · 28 回表示

NVIDIA、GPU加速プライベート情報取得のためのGPIRをリリース

NVIDIAの研究チームは、格子ベースプロトコルに固有の高いサーバー側計算とメモリトラフィックに対処することで、GPU上でのプライベート情報取得(PIR)を加速するシステムGPIRを発表しました。このシステムは、チップ内データ再利用を最大化するために、演算レベルとステージレベルのカーネルの間で動的に切り替えるステージ対応型ハイブリッド実行モデルを採用しています。

lab NVIDIA Research · 20日前 · 26 回表示

NVIDIAがPPMLのMPCおよびFHEのパフォーマンスとコストを特性評価

新しい研究は、プライバシー保護機械学習推論のための安全なマルチパーティ計算(MPC)および完全ホモモフィック暗号(FHE)の統一されたシステムレベルでの特性評価を示しています。この作業は、複数のCNNおよびTransformerモデルにおいて、2つのMPCバリアント—算術/バイナリ共有変換および関数秘密共有—とFHEを評価します。

lab OpenAI News · 20日前 · 37 回表示

OpenAI、Habitatストレージサービスを毎秒7000万リクエストにスケール

OpenAIは、内部オンラインストレージプラットフォームであるHabitatをスケーリングし、ほぼ40の地理的領域にわたる10億人以上の週次ChatGPTユーザーに対して毎秒7000万件以上のリクエストを処理可能にした。このシステムは現在500ペタバイト以上のデータを扱っており、単純なPythonクライアントサイドライブラリから複雑な分散サービスへと進化している。

media AI News (smol.ai) · 19日前 · 52 回表示

DeepSeekが極限の推論効率に焦点を当てたオープンウェイトモデルV4.1-Flashをリリース

DeepSeekは、極限の推論効率と低コストを実現するために設計された新しいオープンウェイトのフラッグシップモデルであるV4.1-Flashをリリースしました。このモデルは、アクティブな計算量とKV/キャッシュのコストを大幅に削減するために、因果的なエンコーダ・デコーダアーキテクチャを利用しています。

media MarkTechPost · 21日前 · 56 回表示

DeepSeekが1MコンテキストとFP4 KVキャッシュを搭載したDeepSeek-V4.1-Flashをリリース

DeepSeek AIは、100万トークンのコンテキストウィンドウと、グローバルキャッシュのフットプリントをトークンあたり890バイトに削減するFP4 KVキャッシュを備えたマルチモーダルMixture-of-ExpertsモデルであるDeepSeek-V4.1-Flashをリリースしました。このモデルは、因果的なエンコーダ・デコーダアーキテクチャとCompressed Sparse Attention 2 (CSA2) を活用し、パフォーマンスを維持しながらメモリ要件を大幅に削減しています。

media Hugging Face Forums · 4時間前

RAGにおいてテキストの代わりにLLMネイティブな潜在記憶を取得する提案

Hugging Faceでの議論は、RAGシステムにおける従来のテキスト検索をLLMネイティブな潜在表現に置き換えることを提案しています。このアイデアは、インデックス作成中に文書をモデル内部の状態にエンコードし、推論時にそれらの状態を取得することで、取得されたテキストの再処理コストを回避する可能性があります。

github llama.cpp · 21時間前 · 1 回表示

llama.cpp b11307 が推論デコーディングのためにバッチ順序を保持

llama.cpp プロジェクトはビルド b11307 をリリースし、推論デコーディング中に元のバッチシーケンスを保持するためにレイヤー入力の順序を修正しました。この変更により、マスクされていない NextN 埋め込みのトークン順序が正しく維持され、テンソル分割と互換性を持つことが保証されます。

github llama.cpp · 22時間前 · 7 回表示

llama.cpp b11306 が因果的注意の切り替えによりグラフ再割り当て中止を修正

llama.cpp プロジェクトは、デコーディング中のグラフ形状の変化によって引き起こされるクラッシュに対処するビルド b11306 をリリースしました。このアップデートは、特定のスケジューリング制約下での再割り当て失敗を防ぐために `causal_attn` フラグの処理を変更します。

github llama.cpp · 23時間前 · 3 回表示

llama.cpp b11302 で ThreadSanitizer のスパースインデクサにおけるデータ競合を修正

llama.cpp プロジェクトは、CIパイプラインでThreadSanitizerによって特定された重大な並行性問題を解決するビルド b11302 をリリースしました。この更新では、複数のCPUスレッドが同じメモリ要素に誤って書き込んでいたスパースアテンションメカニズム内のデータ競合を解消しました。