トピック · Benchmark results
lab NVIDIA Research · 19日前 · 21 回表示

ReasoningBombは大型推論モデルに病的に長い推論を引き起こす

研究者らは、大型推論モデル(LRM)における明示的な多段階推論の高い計算コストを悪用する、推論時のサービス拒否(PI-DoS)攻撃を形式化しました。彼らは、被害者モデルを病的に長く、しばしば終了しない推論トレースへと駆り立てる短い自然言語プロンプトを生成する攻撃者を訓練する、強化学習ベースのフレームワークであるReasoningBombを発表します。

lab Hugging Face Blog · 1日前 · 8 回表示

NVIDIAがゼロショット表形式予測用のオープンなKumo Tabularファウンデーションモデルをリリース

NVIDIAは、トレーニングや特徴エンジニアリングを必要とせず、コンテキスト内学習を通じて動作する表形式の分類および回帰用のオープンなファウンデーションモデルであるKumo Tabularをリリースした。構造化因果モデルによって生成された人工データのみで事前学習されており、28Mから215Mパラメータの3つのサイズで提供されている。

media The Batch · 5日前 Humanity's Last Exam · 61.4% · 11 回表示

AnthropicがClaude Opus 5.5をリリース、TypeSafeがJev分類モデルを公開

Anthropicは、Claude Opus 5の低コスト後継であるClaude Opus 5.5をリリースした。これはArtificial AnalysisのIntelligence Index v4.3およびVals AIのVals Indexで総合知能ベンチマークにおいて首位を獲得している。同時に、OpenAI出身者のDiogo Almeidaによって設立されたTypeSafeは、大規模言語モデルよりも低コストでテキストを分析し、事前に定義された出力を返すために設計された汎用分類モデルであるJevを発表した。

media Latent Space · 8日前 · 27 回表示

AnthropicがClaude Opus 5.5をリリース、文章力が向上しコストも削減

Anthropicは、新しいClaude 5.5ファミリーの最初のモデルであるClaude Opus 5.5をリリースしました。これは以前の世代に対するより効率的な代替手段として位置づけられています。このモデルは、Opus 5の実行コストと比較して40%低く抑えながら、ほとんどのタスクにおいてClaude Fable 5.1のレベルでパフォーマンスを発揮するように設計されています。

media MarkTechPost · 8日前 GDPval-AA (Elo) · 1695.0Elo · 23 回表示

SpaceXAIがGrok 4.7をリリース、より大規模なベースモデルと改善されたベンチマーク

SpaceXAIは、Grok 4.6と比較してより大規模なベースモデルと拡張された強化学習ランを用い、コーディング、エージェントタスク、ナレッジワーク向けの新しいフラッグシップモデルであるGrok 4.7をリリースした。このモデルは、前任者と同じ価格構造を維持しつつ、自己検証、長文脈処理、安全性の面で強化された機能を提供する。

media The Batch · 19日前 GPQA Diamond · 96.3% · 32 回表示

OpenAIがGPT-6 Astraをリリース、低コストでリーダーボード首位を獲得

OpenAIは、主要なAIリーダーボードでトップまたはそれに準じる順位を達成しつつ、競合モデルよりも大幅に少ないトークン数で使用し、コストを抑えた新しいフラッグシップビジョン言語モデルであるGPT-6 Astraをリリースしました。このモデルはOpenAIの重要セキュリティ基準を満たすように設計されており、高度なサイバー機能は選択された組織にのみ制限されています。

blog Simon Willison · 27日前 Artificial Analysis Intelligence Index · 66.0% · 51 回表示

OpenAI、ARC-AGI 3とセキュリティ強化を備えたGPT-6 Astraをリリース

OpenAIは、ChatGPT Plus、Pro、Business、Enterpriseユーザー向けに利用可能な新モデル「GPT-6 Astra」をリリースした。また、OpenAI APIおよびAWS経由でも提供されている。このモデルの入力トークン100万個あたり10ドル、出力トークン100万個あたり50ドルで価格設定されており、Claude Fable 5に対する競合ポジションに位置づけられている。

media AI News (smol.ai) · 29日前 · 50 回表示

AnthropicがClaude Fable 5.1およびMythos 5.1をリリース、キャッシュ読み込み価格の引き下げを実施

Anthropicは、コーディングおよびナレッジワークのための新フラッグシップモデルとしてClaude Fable 5.1とClaude Mythos 5.1をリリースし、自律的なマルチステップタスクに対応可能であることをアピールした。今回のリリースでは、キャッシュ読み込み価格が100万トークンあたり0.25ドルに大幅引き下げされ、100万トークンのコンテキストウィンドウもサポートされている。

media MarkTechPost · 7時間前

NVIDIAの研究者がCosmos 3動画モデルの物理推論を改善するPhysis-Langを公開

NVIDIA、MIT、オックスフォード大学の研究者らは、自己進化型の物理言語をキャプションに統合することで動画の世界モデルを強化するフレームワーク「Physis-Lang」を発表した。この手法は、生成された動画の物理エラーを修正するために、データ選別、モデル学習、推論に使用される最適化可能な表現として物理言語を取り扱う。

media Hugging Face Forums · 10時間前

AI Compute RadarがヒートスコアでアリババQwenとGoogleをトップのオープンモデルラボとしてランク付け

AI Compute Radarは、46の追跡対象オープンモデルのうち15ラボをランク付けする「メーカーボード」を発表し、ヒートスコアと呼ばれる複合指標を使用している。このランキングは各ラボがトップ10に入っているモデルの数によって決定され、同点の場合は最上位の順位と30日間の合計ダウンロード数で決着をつける。