アリババ、5兆〜10兆パラメータのAIモデルを計画し新チップを発表
アリババは、5兆から10兆のパラメータを含む人工知能モデルを開発する計画を発表しました。このロードマップに伴い、同社はインフラストラクチャのニーズをサポートするために設計された新しいカスタムチップも発表しました。
アリババは、5兆から10兆のパラメータを含む人工知能モデルを開発する計画を発表しました。このロードマップに伴い、同社はインフラストラクチャのニーズをサポートするために設計された新しいカスタムチップも発表しました。
Huaweiは、中国国内の需要が利用可能な供給を上回っているため、人工知能チップの国際的な拡大を一時停止しました。この戦略的シフトにより、AMDやNvidiaなどの競合他社は、Huaweiのグローバル市場参入による即時の圧力に直面しなくなりました。
Hugging Faceでの提案は、AIにおける2つの相互に関連する問題について議論しています:個別の大規模モデルのトレーニングへの依存と、エコシステムが汎用GPUに依存していることです。
llama.cppプロジェクトは、Apple Siliconハードウェア向けのMetalバックエンドに重要な更新をもたらすビルドb11059をリリースしました。主な変更点は、高速ウォルシュ・アダマール変換(FWHT)カーネルへのF16入力サポートの追加であり、変換されたコピーを必要とせずにF16ソースを直接読み取ることが可能になります。
llama.cppプロジェクトは、Vulkanのmul_mat_id操作におけるホストされたrow-idの制限を256から1024のエキスパート数へ引き上げました。この変更は、Qwen3.8-Flash-Nextのように多数のエキスパートを持つモデルでのパフォーマンスボトルネックに対処するもので、以前は共有配列サイズの制約により低速なコードパスで実行されていました。
llama.cpp プロジェクトはバージョン b10997 をリリースし、RDNA3.5 アーキテクチャのサポートのために Mixture of Experts (MoE) ncols_opt タイルヒューリスティックに変更を加えました。
llama.cpp b10994 リリースには、活性化値が f16 範囲を超えた場合に `mul_mm_id` 演算で NaN 出力が発生する問題を解決する Metal バックエンドの修正が含まれています。この欠陥により、以前は Apple Silicon デバイス上で 32 トークン以上のプリフィルステップ中に Mistral Small 4 などのモデルが完全に NaN の語彙を生成していました。
研究者らは、複数の信頼できないアクセラレータが共有仮想アドレス空間内で事前に翻訳されたアドレスを安全に再利用できるようにするIOMMU設計であるShareMMUを発表しました。このアプローチは、大きな共有翻訳傍受バッファ(TLB)に関連するサイドチャネルリスクを軽減しつつ、高いパフォーマンスを維持します。
著者は、消費者向けNVIDIA GPU上で熱を考慮したQLoRAファインチューニングを行うためのWindows優先ランタイムであるMOLTを開発し、RTX 4060 Laptop GPUで100万個のQwen 1.5Bトレーニングターゲットを用いてUnslothとのベンチマークを実施しました。
あるユーザーが、DeepSeek V4.1モデルをNVIDIA A100 GPUで実行し、公式APIを上回るパフォーマンスを実現するカスタム実装を開発しました。
Hugging Faceフォーラムでの提案は、NVIDIA、AMD、Intelといった特定のハードウェアベンダーからアプリケーションコードを切り離すために設計された共通のGPU実行およびメモリ管理レイヤーについて述べています。この目的は、ユーザーがバックエンド固有のフラグ、デバイスマップ、またはオフロード戦略を手動で設定するのではなく、メモリ予算を指定できるようにすることです。
研究者らは、state-of-the-artなORAM-ANNシステムの設計を反転させることで帯域幅とアクセス数をバランスさせ、disk-oblivious近似最近傍(ANN)検索のコスト効率の高いアプローチであるOnyxを提案した。
NVIDIAの研究チームは、格子ベースプロトコルに固有の高いサーバー側計算とメモリトラフィックに対処することで、GPU上でのプライベート情報取得(PIR)を加速するシステムGPIRを発表しました。このシステムは、チップ内データ再利用を最大化するために、演算レベルとステージレベルのカーネルの間で動的に切り替えるステージ対応型ハイブリッド実行モデルを採用しています。
新しい研究は、プライバシー保護機械学習推論のための安全なマルチパーティ計算(MPC)および完全ホモモフィック暗号(FHE)の統一されたシステムレベルでの特性評価を示しています。この作業は、複数のCNNおよびTransformerモデルにおいて、2つのMPCバリアント—算術/バイナリ共有変換および関数秘密共有—とFHEを評価します。
Together AIのカーネルチームは、NVIDIA Vera Rubin NVL72プラットフォームの新機能を活用するためにThunderKittensライブラリを最適化し、特にNVFP4およびFP8行列乗算のパフォーマンス向上を対象としています。
Together AIは、Kubernetes上のTogether GPU Clusters向けにプリエンプティブルコンピューティングのパブリックプレビューを発表し、中断許容ワークロードに対して低コストのオプションを提供します。プリエンプティブルノードは未使用のNVIDIA accelerated容量を利用し、オンデマンド料金の固定50%で請求されます。
llama.cppプロジェクトは、PowerVR GPUにおける重大な安定性問題を解決するバージョンb10891をリリースしました。このアップデートでは、Vulkanバックエンドが量子化解除された行列-ベクトル乗算(dmmv)演算に対して共有メモリへのリダクションにフォールバックするように変更されました。
MITのエンジニアリング・クアンタム・システムズ・グループのBeatriz Yankelevichは、Codexと統合されたGPT‑5.6 Solを使用して、超伝導量子ビットの定期的な測定を自律的に実行し、精緻化しました。この統合により、AIエージェントは実験室ソフトウェアを操作し、結果を分析し、人間の絶え間ない監視なしに次のステップを決定できます。
Anthropicは過去11ヶ月間でGoogleとAWSを中心に、14.8GWに相当する5170億ドルのコンピュート容量リースを取得しました。この拡大には、AkamaiやFluidstackなどのクラウドプロバイダーとの大型取引、およびNscaleとの450億ドルの契約が含まれます。
llama.cppプロジェクトはバージョンb10839をリリースし、テンソル行の取得操作中にアラインメントされていないオフセットが原因で発生していたVulkanバックエンドでの深刻なクラッシュを解消しました。従来、Qwen3-TTSやQwen3-VLなどのモデルでは、`minStorageBufferOffsetAlignment`に対するアラインメント違反に対してシェーダーがアサートを行うため、非ゼロのビューオフセットを持つ`ggml_view`を使用すると失敗していました。今回の更新では、量子化済みおよび非量子化済みの両方のパスでアラインメントされたオフセットのネイティブサポートを実装し、CPUフォールバックを不要にしました。