llama.cpp b10306がSYCL GLUフラットパスを追加し、カーネルを統合
llama.cpp b10306リリースは、SYCLバックエンドのパフォーマンス最適化を導入し、特にゲートド・リニアユニット(GLU)演算を対象としています。この更新では、融合されたGLU演算用の連続した高速パスが追加され、以前は別々だったカーネルが共通のランチャーを共有するように統合されました。
llama.cpp b10306リリースは、SYCLバックエンドのパフォーマンス最適化を導入し、特にゲートド・リニアユニット(GLU)演算を対象としています。この更新では、融合されたGLU演算用の連続した高速パスが追加され、以前は別々だったカーネルが共通のランチャーを共有するように統合されました。
llama.cpp b10255リリースは、Q4_0–Q8_0量子化フォーマットとFP32を含む非FP16キーバリュー(KV)キャッシュをサポートするために、oneDNN SDPAパスを拡張します。この更新により、K/Vテンソルを処理前にデバイス上でデ量子化または密集FP16に変換することで、融合型 systolic カーネルがネイティブFP16パスと同一に実行可能になります。
LuceboxはAMDと提携し、推論速度においてNvidia DGX Sparkを上回るheterogeneousなコンシューマー向けハードウェア構成を実証しました。このシステムは、AMD Radeon AI PRO R9700 GPUとStrix Haloプロセッサを組み合わせて、284BのDeepSeek V4 Flashモデル全体を実行します。
本記事は、エンタープライズAIにおける主要な制約要因がモデルの知能ではなくGPUの利用率であり、使用の有無にかかわらず時間単位でコストが発生する航空機の稼働率に類似していると論じています。
パティエンス・ストロングは、現在のニューラルネットワークがソフトウェアで回路をエミュレートするのではなく、物理的なハードウェアとして実装することで、過大な計算電力を消費していると主張しています。論文では、このエミュレーションを重みとバイアスが不揮発性メモリに保存される半導体デバイスに置き換えることを提案しています。
Ai2は、地球観測ファウンデーションモデルをファインチューニングから大規模推論まで移行するためのインフラシステムであるOlmoEarthプラットフォームをローンチした。このプラットフォームは、複数のプロバイダーと解像度間でテラバイト級のマルチモーダル衛星データを処理する際のエンジニアリング課題に対処している。
Moonshot は Hugging Face で Kimi K3 モデルの重みを公開しました。このモデルは 2.8 兆パラメータを持ち、mixture-of-experts アーキテクチャを採用し、トークンごとに 16 のアクティブなエキスパートを使用します。チームは A100、H200、B300 GPU でモデルをデプロイする計画を立てており、ベンチマーク結果は今週中に公開される予定です。
llama.cpp プロジェクトはバージョン b10099 をリリースし、NVFP4 W4A4 アクティベーション量子化の改善のために CUDA バックエンドに重要な更新が含まれています。
IBMは、約80年にわたる科学的貢献を持つ歴史的な研究機関であるHRL Laboratoriesを買収するための最終合意に署名した。この買収は、HRLのシリコンスピン量子ビット工学における高度な専門知識を統合することで、IBMの量子コンピューティングのビジョンを加速させることを目的としている。
AMDとAnthropicは、AIサーバーに数十億ドル規模の主要な合意を結び、Anthropicは来年上半期からAMDのInstinct MI450チップを最大2ギガワット分購入します。同時に、特定の展開マイルストーンが達成されるにつれて、AMDはAnthropicに最大50億ドルを投資し、両社はハードウェアに適したデータセンターの特定に向けて協力します。
SLAIは、Ascend NPU SuperPOD上で兆規模のパラメータを持つMoEモデルのフルパラメータ後処理のためのエンドツーエンド最適化フレームワークであるT-Rexを導入しました。DeepSeek-V4モデルファミリーを対象ワークロードとして使用し、本システムは階層型並列化とカーネル実行の最適化を通じてメモリ圧力と通信オーバーヘッドに対処しています。
SLAIは、Ascend NPU SuperPOD上で兆規模パラメータのMoEモデルのフルパラメータポストトレーニングのためのエンドツーエンド最適化フレームワークであるT-Rexを導入する。DeepSeek-V4モデルファミリーを対象ワークロードとして使用し、本システムは階層型並列処理とカーネル実行の最適化を通じてメモリ圧力と通信オーバーヘッドに対処する。
IBMは米国エネルギー省(DoE)によって、Genesis Mission申請要領の下でプロジェクトを主導する選定を受け、このイニシアチブをサポートするために最大5000万ドル分の量子計算アクセスを提供することにコミットした。
OpenAIは、ジョージア州エフィンガム郡における長期データセンタープロジェクトであるProject Camelliaの詳細を発表し、電力、水、地域社会への恩恵に関する初期のコミットメントを示した。同社は、2028年から2032年の間に3.2ギガワットの電力を供給するため、ジョージア・パワー・カンパニーと契約を結んでいる。
このTLDR AIニュースレターでは、新しいハードウェア、ソフトウェアエージェント、ルーティング最適化など、AI業界のいくつかの進展をカバーしています。
Together AIとY Combinatorは、Y CombinatorのポートフォリオにあるAIネイティブなスタートアップ専用に設計された最初の専用GPUクラスターを提供するためのパートナーシップを発表した。この取り組みは、長期契約を必要とせずに柔軟で費用対効果の高いインフラストラクチャを提供することで、計算リソースへのアクセスという重要なボトルネックを解決することを目指している。
中国の人工知能企業 Moonshot AI は、中国で初めて GPU 容量が枯渇した企業となりました。その結果、同社は新規サブスクリプションの停止とユーザー向けの無料アクセスの廃止を決めました。
Together AIは、GPU推論において異なる信頼性ティアを実現するために必要な具体的なアーキテクチャ要件を詳述し、標準的なSLAの数値が実際にカバーされる障害ドメインを隠蔽していることが多いと主張しています。
NVIDIAは、BlueFieldプロセッサとの極端な共同設計が、Agentic AIワークロードが引き起こすインフラストラクチャの課題に対処する方法を説明している。同社は、エージェントシステムがモデル呼び出し、ツール相互作用、データ参照の複雑な連鎖を引き起こすにつれて、従来のインフラストラクチャパターンではパフォーマンスを維持するのに不十分であると主張している。
NVIDIA は、CUDA 13.3 で carryless multiplication の新しい PTX 命令を導入し、x86 CPU では過去15年以上にわたって存在しながらも GPU がこの操作のネイティブサポートを欠いていた長年のギャップに対応しました。