トピック · Evaluation & benchmarks
lab OpenAI News · 7日前 · 25 回表示

OpenAI、AIのメンタルヘルス対応を評価するための「MentalHealthBench」を公開

OpenAIは、現実的なメンタルヘルス会話においてAIシステムがどのように対応するかを評価するために設計されたオープンベンチマークであるMentalHealthBenchを導入した。22カ国から80人以上の資格を持つメンタルヘルスの専門家が関与して開発されたこのベンチマークは、安全性、文脈の探求、ユーザーの自律性の維持といった重要な行動面におけるモデルの能力を評価する。

media Don't Worry About the Vase · 22日前 · 20 回表示

思考連鎖の有効性が低下するにつれ、OpenAIのAstraモデルは監視がより困難に

OpenAIは、新しいAstraモデルが以前の反復よりも大幅に監視が難しいことを認め、思考連鎖(CoT)監視の有効性の低下を示しています。この傾向は、モデルの能力が増加するにつれて、CoT分析を通じて不整合を検出する能力が減少し、現在の監視システムが1年以内に信頼性を失う可能性を示唆しています。

lab Hugging Face Blog · 4時間前 · 1 回表示

Open TTS Leaderboardがスケーラブルな多言語TTS評価を公開

Open TTS Leaderboardは、Text-to-Speech (TTS) 評価における断片化と標準化の欠如に対処するため、遅くアリーナベースの人間による好みスコアに依存するのではなく、客観的な指標を使用してリリースされました。Qwen3 ASRおよびWavLM埋め込みを用いて、明瞭性、速度、話者類似性の各モデルを評価します。

media Hugging Face Forums · 11時間前 · 1 回表示

独立研究者が IssueTrojanBench の 42 の実プロンプト注入攻撃に対して Kavach を評価

独立した研究者が KavachBench を公開しました。これは、GitHub issue ペイロードから派生した 42 の悪意あるツール呼び出しアクションの_corpus_である IssueTrojanBench に対して、AI コーディングエージェントのガードレール Kavach を評価するためのベンチマークです。

arxiv arXiv cs.CL · 2日前 · 1 回表示

複数ターンLLMの汚染における認識論的ポリシーの分岐に関する研究

"複数ターンLLC汚染における認識論的ポリシーの分岐:プロトコル勾配調査"と題された研究は、会話履歴に注入された誤った前提を大規模言語モデルがどのように処理するかを評価するものであり、この失敗モードはセッションレベルの汚染と呼ばれています。研究者たちは、温度ゼロで22,500ターンを用いて10の知識領域においてGPT-5.4 Mini、Gemini-3.1 Flash-Lite、GLM-4.5-Airをテストしました。

arxiv arXiv cs.CL · 2日前 · 1 回表示

Rep2ActはVAD-Rベンチマークにおける新規 abstention を改善するためにVLM表現を整合させる

研究者たちは、Vision Answerability Diagnosis with Rationales (VAD-R) を導入した。これは、ショートカットの手がかりなしに答えられない質問に対して回答を控えるビジョン言語モデルの能力を評価するために設計された新しいベンチマークである。本研究は、隠れ状態が回答可能性を区別できる一方で、現在のモデルはこの情報を明示的な意思決定に変換できないことを明らかにした。

media Hugging Face Forums · 2日前 · 1 回表示

Ujjal Bhattacharjee が証拠レビューのための構造化エージェント議論をテストする研究設計を提案

Ujjal Bhattacharjee は、固定された支出と期限の制約下で、構造化された挑戦と修正が証拠レビュータスクを改善するかどうかを評価するための方法論的枠組みを提案しました。この提案では、単一のレビュアー、独立した集約、構造化された審議、および Jev 評価者との審議を比較する4つの条件の実験が概説されています。

media Hugging Face Forums · 3日前 · 1 回表示

SecFathy、敵対的失敗により専門化された8B XSSモデルを拒否

開発者のSecFathyは、XSS脆弱性分析用に設計された8Bのセキュリティモデルである「XSS Specialist」という研究プロトタイプをオープンソース化した。このプロジェクトは当初、取得とLoRAを用いて専門性の限界を押し広げることを目指していたが、小さな識別子の変更が誤った安全判定を引き起こす敵対的なニアミステストで失敗したため、最終的にモデルを拒否することになった。

media Hugging Face Forums · 3日前 · 9 回表示

Claude Opus 5とTetsuが自プロジェクトの6つの空虚なCIチェックを発見

9月27日、Claude Opus 5と3BモデルのTetsuは、パブリックリポジトリにある6つの個別の継続的インテグレーション(CI)チェックを特定した。これらは本来測定すべきものを検証せずにグリーンまたは合格と報告していた。問題は、古いダイジェストのために有効な再起動を拒否するデプロイメントゲートから、無意味なパフォーマンス差を受け入れる空虚な閾値を持つタイミングベンチマークまで多岐にわたった。

media Hugging Face Forums · 4日前 · 7 回表示

Jevの効率性主張と技術的革新性に対するコミュニティの懐疑

記事では、著者がこれらの主張を支える実質的な証拠をほとんど見つけられなかったにもかかわらず、「Jev」がLinkedIn上で革命的なAIブレイクスルーとして喧伝され、関心が高まっていることが議論されています。著者は、Jevが巨大な効率性と新しいパラダイムを推進している一方で、評価データや技術的詳細が不足しており、それが真のアーキテクチャの革新なのか、単なる再パッケージ化された分類に過ぎないのかという疑問を投げかけています。

media Hugging Face Forums · 7日前 · 12 回表示

RLHFによって訓練されたAIシステムにおける人為的な過信の分析

現代の大規模言語モデルは体系的に過信しており、技術的な較正の失敗ではなく、学習インセンティブのために誤った回答に対して高い自信を示します。人間のフィードバックによる強化学習(RLHF)の間、人間の評価者は権威的で決定的に聞こえる回答を報酬付けし、モデルが不確実性が罰せられることを学習する原因となります。

arxiv arXiv cs.CL · 7日前 · 2 回表示

WebMREベンチマークがウェブエージェントにおけるガイドと行動の相互強化を明らかにする

著者らは、WebMREを紹介する。これは541のタスクと5,293のステップからなるオフラインベンチマークで、成功したWebArenaの軌道から派生しており、環境ドリフトなしでウェブエージェントのチェックポイントをスコアリングするための決定論的なプロトコルを提供することを目的としている。このフレームワークは、人間向けのガイド文と接地された行動をペアにして、それらの間の相互強化効果を研究する。

lab Hugging Face Blog · 8日前 · 25 回表示

AISIが5つのベンチマークにおける6つの最先端モデルの検証済み評価結果を公開

英国AIセキュリティ研究所(AISI)は、ベンチマークの再現性を向上させるため、EvalEvalのEvaluation Cardsプラットフォームを通じて公に報告された評価手法と知見を公開しました。今回のリリースには、HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro、Terminal-Bench 2.0という5つの特定のベンチマークに関する検証済み結果、文脈、および設定情報が含まれています。

media Hugging Face Forums · 9日前 · 14 回表示

CosmicUndercurrentがLLMの全体システム協調をテストするためのPrincipia-Structurae-Realitatisを公開

CosmicUndercurrentは、大規模言語モデルにおける構造的な初期化がグローバルな不整合を軽減できるかどうかを検証するために設計されたモデル非依存の推論フレームワークをオープンソース化した。このプロジェクトでは、ローカルな正しさと比較して、2段階のプロセスが全体システムの協調性を向上させるかどうかを探求している。