CUDAの実装が更新され、FlashAttentionに対して全体タイルのスケジューリング戦略を優先するようになりました。この変更は、フレームワーク内のアテンションメカニズムの実行フローを最適化することを目的としています。
CUDAはFlashAttentionの全体タイルスケジューリングを優先
Eqx-zooはHugging Faceモデルの検証済みEquinoxポートを提供
著者はeqx-zooを構築しました。これは、Hugging Face HubのチェックポイントをプレーンなEquinoxモジュールとして直接読み込み、各モデルをtransformersライブラリに対して検証するライブラリです。現在、生成にはLlama、Qwen2、Qwen3、Qwen3-MoEをサポートし、埋め込みにはBERT、RoBERTa、XLM-RoBERTaをサポートしています。
llama.cpp b11401 リリースでログ記録が修正され、Windows で ANSI カラーが有効に
llama.cpp b11401 リリースはサーバールーティングモードのログ記録の問題を解決し、Windows コンソールでの ANSI カラーのサポートを追加しました。このアップデートにより、子プロセスのログが状態コマンドから正しく分離され、Windows ターミナルでカラー出力が適切にレンダリングされます。
Aleph Alphaが78.1Bの英語・ドイツ語MoEモデルKolibriを公開、アクティブパラメータは3.46B
Aleph Alphaは、バイリンガルの英語とドイツ語タスク向けに設計されたオープンウェイトのMixture-of-Experts言語モデルであるKolibri-1をリリースしました。このモデルは781億個の総パラメータを持ちますが、トークンごとに34.6億個のみがアクティブになり、単一のB200、B300、またはH200 GPUで実行することができます。
llama.cpp b11390 が CUDA MMQ メモリ障害を修正
llama.cpp プロジェクトはバージョン b11390 をリリースしました。これは、エキスパート数がマイクロバッチサイズより大幅に大きい場合に発生する CUDA MMQ メモリ障害の修正を含んでいます。
llama.cpp b11382 が WebGPU fill/set_rows に f16 サポートを追加
llama.cpp プロジェクトはビルド b11382 をリリースし、WebGPU バックエンドの重要なアップデートを含んでいます。このリリースでは、WebGPU 実装内の `fill` および `set_rows` 操作に対して 16 ビット浮動小数点 (f16) サポートが追加されました。