今週のAIニュースでは、Z.ai、Tencent、Alibabaによる大規模なオープンウェイトモデルのリリースと、推論インフラストラクチャおよびエージェントベンチマークに関する開発が注目されています。

  • Z.aiは、エージェンティックコーディングとサイバー防御向けに744Bの総パラメータを持つGLM-5.3をリリースし、そのFlashバリアントは低コストで高品質を提供します。
  • Tencentは、コード生成タスクにおいてHy3と比較して大幅なパフォーマンス向上を示す770BのMoEモデルであるHy4-previewをローンチしました。
  • Alibabaは、低コストかつ長文脈のマルチモーダル推論向けに設計された125BのMoEモデルであるQwen3.8-Flashを導入しましたが、初期レポートではFP8量子化に関する安定性の問題が指摘されています。
  • vLLMは、スペキュラティブデコーディング手法を比較するベンチマークを発表し、普遍的な勝者はおらず、ワークロード固有のチューニングが重要であると強調しました。
  • Alibaba Accioは、回答品質だけでなく実際のタスク完了を測定する107タスクのベンチマークであるCommerceAgentBenchをオープンソース化しました。
  • Googleの研究によると、永続的なウィキに保存されたポータブルスキルはモデルファミリー間で効果的に転移し、ファインチューニングよりもより堅牢なエージェント能力を提供する可能性があります。