ラボ · Zhipu AI
media Interconnects · 1時間前 ライブ

Z.aiが拡張されたポストトレーニング付きGLM-5.3をリリース

Z.aiは、ベースモデルGLM-5.2のポストトレーニングを拡張することで、エージェント型コーディングベンチマークで最先端のパフォーマンスを達成する新モデルGLM-5.3を発表しました。約750Bパラメータを持つこのモデルは、現在Kimi K3を上回り、Claude Fable 5およびGPT-5.6-Solと同等かそれ以上の性能を各種ベンチマークで示しています。

media MarkTechPost · 11時間前 · 2 回表示

Z.aiがポストトレーニングによりコーディングとサイバーセキュリティを強化したGLM-5.3をリリース

Z.aiは、743BパラメータのモデルのアップデートであるGLM-5.3をリリースしました。これはベースモデルの再学習ではなく、スケーリングされたポストトレーニングを通じてパフォーマンスの向上を実現しています。今回のリリースは現在、Z.ai API、GLM Coding Plan、およびZCode経由で利用可能であり、公開ウェightsはセキュリティ評価を経てローンチから約2週間後に公開される予定です。

arxiv arXiv cs.LG · 2日前 HealthBench · 51.9% · 5 回表示

VITA臨床RAGシステムはHealthBenchで最先端LLMと同等またはそれ以上の性能

低所得および中所得環境向けに設計された専用検索拡張生成(RAG)システムであるVITAが、HealthBenchベンチマークにおいて汎用大規模言語モデルと比較評価されました。GPT-4.1ジャッジによって採点された4,023問の質問において、VITAはルーブリックのポイントの51.9%を獲得し1位となり、GPT-5.4、o4-mini、Gemini 3.1 Pro、Claude Sonnet 4.6を上回りました。

arxiv arXiv cs.LG · 4日前 · 2 回表示

Macaron-V1が継続学習のためのMixture-of-LoRAを用いたオープンなエージェントモデルファミリーを導入

Macaron-V1は、経験知能のために設計されたオープンなエージェントモデルファミリーであり、実際の環境からの学習と展開後の継続的な学習を可能にします。このシステムは2つの目標に焦点を当てています:モデルとハーネスのペアの再帰的改善による適応、およびユーザーごとのターンごとに専門家のLoRAアダプターを選択するMixture-of-LoRA (MoL) アーキテクチャを通じた協調です。

arxiv arXiv cs.CL · 4日前 · 10 回表示

Macaron-V1が継続的学習のためのMixture-of-LoRAを用いたオープンなエージェントモデルファミリーを導入

Macaron-V1は、経験知能のために設計されたオープンなエージェントモデルファミリーであり、システムが現実世界の経験から学習し、デプロイ後も改善を続けることを可能にします。アーキテクチャは2つの目標を中心に構成されています:モデルとハーネスのペアの再帰的な自己改善による適応、およびユーザーごとのターンごとに専門アダプターを選択するMixture-of-LoRA (MoL) システムを通じた協調です。

arxiv arXiv cs.CL · 15日前 · 3 回表示

OSRewardがクロスプラットフォームのコンピュータ操作用報酬モデルに対する標準化された評価を導入

研究者らが、コンピュータ操作エージェントの軌跡に対して審判役として機能するビジョン言語モデル(VLMs)の信頼性を評価するために設計された現実的なベンチマークであるOSRewardを紹介している。本研究では、最先端のVLMsでさえ体系的な寛容性バイアスに苦しんでおり、スケーリングには費用が高すぎる一方で、手頃な価格のオープンソースモデルは性能が劣ることが明らかになった。

media TLDR AI · 16日前 · 34 回表示

xAIがBuild Modeをリリース;研究者らがAIのペースダウン協力を要請

xAIはSuperGrok Heavyのサブスクライバー向けに「Build Mode」をリリースし、ユーザーがセットアップなしでチャットから直接ウェブサイト、アプリ、ゲーム、ダッシュボードを生成、編集、プレビュー、公開できるようになった。同時に、最先端AI企業の1000人以上の従業員が、米政府に対して自動AI開発の最先端を意図的に制御するためのツールの開発に向けた国際的な取り組みを支援するよう求める声明に署名した。

arxiv arXiv cs.CL · 18日前 · 3 回表示

PIVOTはクエリグループ間でプレフィックススキャンを共有し、トークンレベルのスパースアテンションを高速化する

PIVOT(Proxy Indexing Via One full-prefix Traversal)は、DeepSeek Sparse Attention(DSA)インデクサのためのトレーニング不要なドロップイン置換であり、近くのクエリグループ間で1つのプレフィックススキャンを共有することで計算の冗長性を削減します。各クエリに対して個別にすべての先行トークンをスコアリングする代わりに、PIVOTはグループを単一のプロキシクエリに集約して候補セットを取得し、そこから各クエリのためにトップkトークンが選択されます。

arxiv arXiv cs.CL · 18日前 · 2 回表示

ZingフレームワークがSoMBenchベンチマークとActioグラウンディングによりLLMの社会的知能を向上

本レポートでは、大規模言語モデルの社会的知能を測定し、内部化し、グラウンディングすることで強化することを目的とした統合フレームワークであるZingを紹介しています。著者らは、17の二次次元と3,481件の専門家検証済みインスタンスにわたる心理学基盤のベンチマークであるSoMBenchを発表しました。これにより、現在のLLMには大幅な改善の余地があり、どのモデルもほぼ天井性能に達していないことが明らかになりました。

media MarkTechPost · 27日前 SWE-bench Verified · 80.6% · 24 回表示

ベンチマーク、ライセンス、推論コストで比較されるKimi K3、DeepSeek V4 Pro、GLM-5.2

Moonshot AIのKimi K3、DeepSeek V4 Pro、Zhipu AIのGLM-5.2という3つのオープンウェイトなスパースMixture-of-Expertsモデルの比較は、長期のコーディングおよびエージェントワークロードにおけるその能力、ライセンス条項、推論コストを評価するものである。