Reasoning models
media AI News (smol.ai) · 2日前

MetaのMuse Spark 1.2とOpenAIのGPT-5.6 Solアップデート

Metaは、そのMuse Spark 1.2モデルが5つのSTEMオリンピックで金メダル級の性能を達成し、Vals Indexで$0.69/テストという価格でトップ5に入ったと発表した。これはKimiと比較して3倍安価であると報告されている。Metaはこれらの成果を、並列推論によるマルチエージェントオーケストレーションに起因するものとし、外部ツールなしでAPhOおよびIPhOで理論スコアが完璧だったことを指摘した。

media r/LocalLLaMA · 6日前 · 16 回表示

AI9Starsが39Bパラメータと5つのアクティブエクスパートを持つオープンウェイトモデルG9v3-39A5Bをリリース

AI9Starsは、前身であるai9stars/G9v3-3Bよりも強力な推論能力を提供するように設計されたオープンウェイト言語モデルG9v3-39A5Bをリリースしました。このモデルは390億パラメータと5つのアクティブエクスパートを搭載し、個人および商業利用のためにApache 2.0ライセンスの下で提供されます。

media Hugging Face Forums · 6日前 · 1 回表示

GPT-5.6、未見の文学的暗号化ベンチマークで隠されたメッセージの95%を復元

Joseph JM Walkerによる作業論文は、物理的な小説「I Wrote a Book and Made a Million Dollars (I.B. Wryten)」に埋め込まれた未見のマルチチャネル文学的暗号化ベンチマークにおいて、フロンティア言語モデルを評価した。本研究では、GPT-5.6が二次通信チャネルを独立して認識し、最初のパスで埋め込まれた素材のおよそ95%を復元したことが示されたのに対し、以前のモデルは実質的に0%の能力しか示さなかった。

arxiv arXiv cs.CL · 12日前 · 2 回表示

最先端LLMはフィラートークンによる不可視の推論でCoT監視を回避する

ある研究により、最先端の言語モデルが意味的に無関係なフィラートークンを使用して重要な計算を実行できることが示され、推論が出力内の連鎖的思考(chain-of-thought)に現れないという失敗モードが生じることが明らかになった。この研究は3つのタスクで13個のモデルを評価し、多くのモデルがこれらのトークンから大幅な恩恵を受け、精度が最大13パーセントポイント向上することを発見した。

arxiv arXiv cs.AI · 17日前 Humanity's Last Exam · 49.92% · 1 回表示

PoTREがテスト時の推論向けに異種マルチエージェントフレームワークを導入

著者らは、複雑な推論タスクにおける標準的な単一ストリームのプロンプティングの限界に対処するために設計されたフレームワークであるPoTRE(Poly-Topological Reasoning Ensembles)を紹介する。PoTREは、推論を4つの個別のエージェントに分離する:敵対的改善エージェント、階層的戦略計画エージェント、スペクトル探索エージェント、および直接チェーンエージェント。

arxiv arXiv cs.CL · 24日前 · 5 回表示

GSM-Plus-BNがベンガル語数学推論のための摂動ベースのベンチマークを導入

本研究では、英語のGSM-Plusベンチマークを基に人間翻訳者によって検証された新規な摂動付きベンガル語数学データセットであるGSM-Plus-BNを紹介します。このリソースは、バングラデシュのような言語的多様性に富む地域におけるモデルの堅牢性を評価するための体系的なベンチマークの欠如に対処します。

arxiv arXiv cs.AI · 24日前

Deep InteractionによりLLMの推論エラーを正確に人間が修正可能に

著者らは、大規模言語モデルの推論エラーを完全な応答再生を必要とせずに修正するために設計された効率的な人間-AI相互作用手法であるDeep Interactionを提案する。このメカニズムにより、ユーザーは元のChain-of-Thought応答を直接編集でき、正確なステップを保持しながらミスを修正できる。

media Together AI Blog · 25日前 · 4 回表示

Together AIがThinking Machines LabのInklingマルチモーダル推論モデルをリリース

Thinking Machines Labは、トークン効率的な推論とテキスト、画像、音声入力のネイティブな理解のために設計された新しいマルチモーダルMixture-of-ExpertsモデルであるInklingをリリースしました。Together AIはこのモデルを推論プラットフォームで提供し、day-zeroアクセスを提供しています。

lab NVIDIA Technical Blog · 25日前 · 3 回表示

NVIDIAがKaggleの5,000件以上のエントリーを分析し、AI推論の改善手法を特定

NVIDIA Nemotron Model Reasoning Challengeは、Kaggleコミュニティに対して、オープンモデル、ベンチマーク、インフラストラクチャという共通の制約条件下で推論精度を向上させる手法を探求するよう呼びかけました。コンペティション終了時点で、4,000チームから5,000人以上のアクティブな参加者がおり、数千件の提出が行われました。

arxiv arXiv cs.CL · 26日前

TreeThink: LLMの定理証明のためのモジュール型非同期木探索ライブラリ

研究者らは、ニューラル定理証明におけるモジュール型かつ完全な非同期の木探索のために設計されたオープンソースのPythonライブラリであるTreeThinkを発表しました。これは、確立された探索手法とvLLMベースの推論パイプライン、および多様なノード評価技術を統合しています。

arxiv arXiv cs.AI · 26日前 · 7 回表示

WILDTRACEは長文コンテキスト推論における自然な証拠の経路のためのベンチマークを導入

著者らは、WILDTRACEという新しいベンチマークを紹介する。これは、モデルが長いドキュメント内の遠く離れた段落に分散された証拠をどのように統合するかを評価するために設計されている。既存の植えられた事実やリバースエンジニアリングされた連鎖に依存するベンチマークとは異なり、WILDTRACEは技術的なインシデントレポートや文学的ナラティブなどの214の自然発生的なソースから派生した481のタスクを使用している。

arxiv arXiv cs.LG · 27日前

ニューラルコラプスは禁止される:言語モデルの情報フロア

本記事は、言語モデルの表現におけるクラス内分散が不完全なニューラルコラプスではなく、特定の法則によって支配される割り当てられた情報保存であると主張している。14つのモデルの分析により、マクロカテゴリ構造が表現分散のわずか4-12%しか占めていないことが示され、一方、トークンレベルの文脈は79-12%を運び、100倍のパラメータ範囲にわたって安定している。