Anthropicは「GLM-5.3と高度なサイバー能力の拡散」と題した研究論文を発表し、GLM-5などのオープンソースモデルが悪意のあるサイバー活動にどのように利用されているかを検討しています。 記事では、これらのモデルが脅威アクターによって広く採用され、セキュリティコミュニティ内でその能力を宣伝する役割を果たしていることが強調されています。 この分析は、高度なAIモデルの二重使用性質とそのサイバー脅威を増幅させる可能性に関する懸念の高まりを示しています。
media
r/LocalLLaMA
·
1日前
·
open_models
Anthropicの研究、GLM-5と高度なサイバー能力の拡散を関連付け
翻訳元 English → 日本語
関連記事
blog
Simon Willison
·
23時間前
·
2 回表示
Anthropic、GLM-5.3がサイバーレッドチームで完全な制御フローハイジャックを達成
AnthropicのFrontier Red Teamは、内部Binary Exploitationベンチマークの100タスクで中国製モデルGLM-5.3を評価し、4%の試行で完全な制御フローハイジャックを開発できることを発見しました。
media
r/LocalLLaMA
·
1日前
·
15 回表示
AnthropicがGLM-5.3と高度なサイバー能力の拡散を分析
Anthropicは、GLM-5.3とその高度なサイバー能力の拡散における役割を検査する研究論文を発表しました。
arxiv
arXiv cs.CL
·
14日前
·
24 回表示
Wikipedia上のlog(N)質問ゲームでフロンティアモデルを評価
ある研究では、6つのフロンティア言語モデルが、質問者がN個のWikipediaのパラグラフからターゲットを正確にlog2(N)回のyes/no質問で特定する2エージェント間の通信タスクにおいて評価された。実験は4〜1024パラグラフのドキュメントセット全体で408ゲームを実行し、テストされたモデル間で顕著なパフォーマンスの格差が明らかになった。
media
TLDR AI
·
34日前
·
66 回表示
GLM-5.3 FlashがコーディングベンチマークでClaude Opus 4.8に迫る
Z.aiは、以前匿名でテストされたモデルox-alphaがGLM-5.3-Flashであることを明らかにしました。これは320BパラメータのMixture of Experts (MoE)モデルで、18Bのパラメータがアクティブです。
media
Together AI Blog
·
40日前
·
77 回表示
GLM-5.3はDeepSWEにおいてClaude Fable 5の精度を第五のコストで達成
DeepSWEベンチマークにおけるGLM-5.3とClaude Fable 5の比較により、両モデルがほぼ同一のファーストショット精度(69.0%対69.7%)を達成している一方で、GLM-5.3は大幅にコスト効率が良く、複数試行シナリオでもより優れたパフォーマンスを示すことが明らかになった。