Z.aiが拡張されたポストトレーニング付きGLM-5.3をリリース
Z.aiは、ベースモデルGLM-5.2のポストトレーニングを拡張することで、エージェント型コーディングベンチマークで最先端のパフォーマンスを達成する新モデルGLM-5.3を発表しました。約750Bパラメータを持つこのモデルは、現在Kimi K3を上回り、Claude Fable 5およびGPT-5.6-Solと同等かそれ以上の性能を各種ベンチマークで示しています。
Z.aiは、ベースモデルGLM-5.2のポストトレーニングを拡張することで、エージェント型コーディングベンチマークで最先端のパフォーマンスを達成する新モデルGLM-5.3を発表しました。約750Bパラメータを持つこのモデルは、現在Kimi K3を上回り、Claude Fable 5およびGPT-5.6-Solと同等かそれ以上の性能を各種ベンチマークで示しています。
GLMチームはGLMモデルのバージョン5.3をリリースしました。
Z.aiは、743BパラメータのモデルのアップデートであるGLM-5.3をリリースしました。これはベースモデルの再学習ではなく、スケーリングされたポストトレーニングを通じてパフォーマンスの向上を実現しています。今回のリリースは現在、Z.ai API、GLM Coding Plan、およびZCode経由で利用可能であり、公開ウェightsはセキュリティ評価を経てローンチから約2週間後に公開される予定です。
Mistralは現在、現在のフラッグシップモデルであるMistral Medium 3.5よりもさらに安価なGLM-5.2モデルをホストしています。
低所得および中所得環境向けに設計された専用検索拡張生成(RAG)システムであるVITAが、HealthBenchベンチマークにおいて汎用大規模言語モデルと比較評価されました。GPT-4.1ジャッジによって採点された4,023問の質問において、VITAはルーブリックのポイントの51.9%を獲得し1位となり、GPT-5.4、o4-mini、Gemini 3.1 Pro、Claude Sonnet 4.6を上回りました。
Macaron-V1は、経験知能のために設計されたオープンなエージェントモデルファミリーであり、実際の環境からの学習と展開後の継続的な学習を可能にします。このシステムは2つの目標に焦点を当てています:モデルとハーネスのペアの再帰的改善による適応、およびユーザーごとのターンごとに専門家のLoRAアダプターを選択するMixture-of-LoRA (MoL) アーキテクチャを通じた協調です。
Macaron-V1は、経験知能のために設計されたオープンなエージェントモデルファミリーであり、システムが現実世界の経験から学習し、デプロイ後も改善を続けることを可能にします。アーキテクチャは2つの目標を中心に構成されています:モデルとハーネスのペアの再帰的な自己改善による適応、およびユーザーごとのターンごとに専門アダプターを選択するMixture-of-LoRA (MoL) システムを通じた協調です。
Zhipu の次期モデル GLM-5.3 のドキュメントが登場し、数秒後に削除されました。ページは消える前に Bing によってインデックスされていました。
GitHubのz-ai-sdk-javaリポジトリで、GLM 5.3のコミットブランチが特定されました。
新しいDeepSeek V4-Flashモデルは、ArtificialAnalysis指数で50のスコアを達成しました。この結果により、GLM-5.2およびGPT-5.6 Lunaにわずか1ポイント及ばない位置にあります。
研究者らが、コンピュータ操作エージェントの軌跡に対して審判役として機能するビジョン言語モデル(VLMs)の信頼性を評価するために設計された現実的なベンチマークであるOSRewardを紹介している。本研究では、最先端のVLMsでさえ体系的な寛容性バイアスに苦しんでおり、スケーリングには費用が高すぎる一方で、手頃な価格のオープンソースモデルは性能が劣ることが明らかになった。
xAIはSuperGrok Heavyのサブスクライバー向けに「Build Mode」をリリースし、ユーザーがセットアップなしでチャットから直接ウェブサイト、アプリ、ゲーム、ダッシュボードを生成、編集、プレビュー、公開できるようになった。同時に、最先端AI企業の1000人以上の従業員が、米政府に対して自動AI開発の最先端を意図的に制御するためのツールの開発に向けた国際的な取り組みを支援するよう求める声明に署名した。
llama.cpp プロジェクトは、GLM_DSA (GLM-5.2) モデルアーキテクチャ向けの NextN/MTP 推測デコーディングサポートを導入するビルド b10174 をリリースしました。
Moonshotは、2.8TパラメータのMixture-of-ExpertsモデルであるKimi K3の完全な詳細、重み、およびサポートインフラストラクチャを公開しました。このモデルは、トークンあたり約104Bのパラメータがアクティブです。
PIVOT(Proxy Indexing Via One full-prefix Traversal)は、DeepSeek Sparse Attention(DSA)インデクサのためのトレーニング不要なドロップイン置換であり、近くのクエリグループ間で1つのプレフィックススキャンを共有することで計算の冗長性を削減します。各クエリに対して個別にすべての先行トークンをスコアリングする代わりに、PIVOTはグループを単一のプロキシクエリに集約して候補セットを取得し、そこから各クエリのためにトップkトークンが選択されます。
本レポートでは、大規模言語モデルの社会的知能を測定し、内部化し、グラウンディングすることで強化することを目的とした統合フレームワークであるZingを紹介しています。著者らは、17の二次次元と3,481件の専門家検証済みインスタンスにわたる心理学基盤のベンチマークであるSoMBenchを発表しました。これにより、現在のLLMには大幅な改善の余地があり、どのモデルもほぼ天井性能に達していないことが明らかになりました。
Moonshot AIのKimi K3、DeepSeek V4 Pro、Zhipu AIのGLM-5.2という3つのオープンウェイトなスパースMixture-of-Expertsモデルの比較は、長期のコーディングおよびエージェントワークロードにおけるその能力、ライセンス条項、推論コストを評価するものである。