今週のAIニュースでは、Z.ai、Tencent、Alibabaによる大規模なオープンウェイトモデルのリリースと、推論インフラストラクチャおよびエージェントベンチマークに関する開発が注目されています。
- Z.aiは、エージェンティックコーディングとサイバー防御向けに744Bの総パラメータを持つGLM-5.3をリリースし、そのFlashバリアントは低コストで高品質を提供します。
- Tencentは、コード生成タスクにおいてHy3と比較して大幅なパフォーマンス向上を示す770BのMoEモデルであるHy4-previewをローンチしました。
- Alibabaは、低コストかつ長文脈のマルチモーダル推論向けに設計された125BのMoEモデルであるQwen3.8-Flashを導入しましたが、初期レポートではFP8量子化に関する安定性の問題が指摘されています。
- vLLMは、スペキュラティブデコーディング手法を比較するベンチマークを発表し、普遍的な勝者はおらず、ワークロード固有のチューニングが重要であると強調しました。
- Alibaba Accioは、回答品質だけでなく実際のタスク完了を測定する107タスクのベンチマークであるCommerceAgentBenchをオープンソース化しました。
- Googleの研究によると、永続的なウィキに保存されたポータブルスキルはモデルファミリー間で効果的に転移し、ファインチューニングよりもより堅牢なエージェント能力を提供する可能性があります。