Hardware & chips
github llama.cpp · 2日前 · 1 回表示

llama.cpp b10306がSYCL GLUフラットパスを追加し、カーネルを統合

llama.cpp b10306リリースは、SYCLバックエンドのパフォーマンス最適化を導入し、特にゲートド・リニアユニット(GLU)演算を対象としています。この更新では、融合されたGLU演算用の連続した高速パスが追加され、以前は別々だったカーネルが共通のランチャーを共有するように統合されました。

github llama.cpp · 5日前 · 2 回表示

llama.cpp b10255がoneDNN SDPAを非FP16 KVキャッシュに拡張

llama.cpp b10255リリースは、Q4_0–Q8_0量子化フォーマットとFP32を含む非FP16キーバリュー(KV)キャッシュをサポートするために、oneDNN SDPAパスを拡張します。この更新により、K/Vテンソルを処理前にデバイス上でデ量子化または密集FP16に変換することで、融合型 systolic カーネルがネイティブFP16パスと同一に実行可能になります。

media Hugging Face Forums · 12日前 · 1 回表示

パティエンス・ストロング、ニューラルネットワークを半導体デバイスとして構築する提案

パティエンス・ストロングは、現在のニューラルネットワークがソフトウェアで回路をエミュレートするのではなく、物理的なハードウェアとして実装することで、過大な計算電力を消費していると主張しています。論文では、このエミュレーションを重みとバイアスが不揮発性メモリに保存される半導体デバイスに置き換えることを提案しています。

lab Hugging Face Blog · 12日前

Ai2が惑星規模の地理空間推論向けOlmoEarthプラットフォームをリリース

Ai2は、地球観測ファウンデーションモデルをファインチューニングから大規模推論まで移行するためのインフラシステムであるOlmoEarthプラットフォームをローンチした。このプラットフォームは、複数のプロバイダーと解像度間でテラバイト級のマルチモーダル衛星データを処理する際のエンジニアリング課題に対処している。

media r/LocalLLaMA · 13日前 · 1 回表示

Kimi K3 の重み公開;A100、H200、B300 へのデプロイメントを計画

Moonshot は Hugging Face で Kimi K3 モデルの重みを公開しました。このモデルは 2.8 兆パラメータを持ち、mixture-of-experts アーキテクチャを採用し、トークンごとに 16 のアクティブなエキスパートを使用します。チームは A100、H200、B300 GPU でモデルをデプロイする計画を立てており、ベンチマーク結果は今週中に公開される予定です。

lab IBM Research (Granite) · 16日前

IBM、シリコンスピン量子ビットの専門知識を持つHRL Laboratoriesを買収

IBMは、約80年にわたる科学的貢献を持つ歴史的な研究機関であるHRL Laboratoriesを買収するための最終合意に署名した。この買収は、HRLのシリコンスピン量子ビット工学における高度な専門知識を統合することで、IBMの量子コンピューティングのビジョンを加速させることを目的としている。

media TLDR AI · 17日前 · 1 回表示

AMDとAnthropicの契約:AMDがMI450チップを供給し50億ドル投資

AMDとAnthropicは、AIサーバーに数十億ドル規模の主要な合意を結び、Anthropicは来年上半期からAMDのInstinct MI450チップを最大2ギガワット分購入します。同時に、特定の展開マイルストーンが達成されるにつれて、AMDはAnthropicに最大50億ドルを投資し、両社はハードウェアに適したデータセンターの特定に向けて協力します。

arxiv arXiv cs.AI · 17日前 · 4 回表示

SLAIのT-RexがAscend SuperPOD上でDeepSeek-V4のフルパラメータ後処理を可能にする

SLAIは、Ascend NPU SuperPOD上で兆規模のパラメータを持つMoEモデルのフルパラメータ後処理のためのエンドツーエンド最適化フレームワークであるT-Rexを導入しました。DeepSeek-V4モデルファミリーを対象ワークロードとして使用し、本システムは階層型並列化とカーネル実行の最適化を通じてメモリ圧力と通信オーバーヘッドに対処しています。

arxiv arXiv cs.CL · 17日前 · 1 回表示

SLAIのT-RexがAscend SuperPOD上でDeepSeek-V4のフルパラメータポストトレーニングを可能にする

SLAIは、Ascend NPU SuperPOD上で兆規模パラメータのMoEモデルのフルパラメータポストトレーニングのためのエンドツーエンド最適化フレームワークであるT-Rexを導入する。DeepSeek-V4モデルファミリーを対象ワークロードとして使用し、本システムは階層型並列処理とカーネル実行の最適化を通じてメモリ圧力と通信オーバーヘッドに対処する。

lab OpenAI News · 18日前 · 2 回表示

OpenAI、エフィンガム郡のProject Camelliaデータセンターへのコミットメントを明らかにする

OpenAIは、ジョージア州エフィンガム郡における長期データセンタープロジェクトであるProject Camelliaの詳細を発表し、電力、水、地域社会への恩恵に関する初期のコミットメントを示した。同社は、2028年から2032年の間に3.2ギガワットの電力を供給するため、ジョージア・パワー・カンパニーと契約を結んでいる。

media Together AI Blog · 20日前 · 2 回表示

Together AIとY CombinatorがYCスタートアップ向け専用GPUクラスターを立ち上げ

Together AIとY Combinatorは、Y CombinatorのポートフォリオにあるAIネイティブなスタートアップ専用に設計された最初の専用GPUクラスターを提供するためのパートナーシップを発表した。この取り組みは、長期契約を必要とせずに柔軟で費用対効果の高いインフラストラクチャを提供することで、計算リソースへのアクセスという重要なボトルネックを解決することを目指している。

lab NVIDIA Technical Blog · 24日前 · 2 回表示

NVIDIA、BlueFieldの共同設計を提案してAgentic AIファクトリのスケーリングを図る

NVIDIAは、BlueFieldプロセッサとの極端な共同設計が、Agentic AIワークロードが引き起こすインフラストラクチャの課題に対処する方法を説明している。同社は、エージェントシステムがモデル呼び出し、ツール相互作用、データ参照の複雑な連鎖を引き起こすにつれて、従来のインフラストラクチャパターンではパフォーマンスを維持するのに不十分であると主張している。