ベンチマーク · coding

HumanEval+

saturated 1 結果 1 モデル

HumanEval+ は、OpenAI のコード生成ベンチマーク HumanEval を厳密に拡張した版です。手作業で書かれた元の 164 問の Python プログラミング課題はそのままに、(EvalPlus フレームワークによって)約 80x のテストケースを追加し、pass@k 指標(通常は pass@1)で採点します。

詳しく見る
各項目は、望ましい挙動を記述した Python の関数シグネチャと自然言語の docstring(多くは doctest 例つき)を与え(例:「しきい値より厳密に大きいリスト要素を順序を保って返す」)、モデルはそれを実装する関数本体を生成しなければなりません。
採点方法
指標は pass@k です。各問題について n >= k 個の補完をサンプリングし、そのうち c 個が全テストに合格し、不偏推定量 pass@k = 1 - C(n-c, k) / C(n, k) を 164 問で平均します(最も多く報告されるのは pass@1)。補完は拡張されたテストスイート全体に合格した場合のみ正解とみなされるため、HumanEval+ のスコアは素の HumanEval より低くなります。
検証方法
各補完は、時間とメモリの制限の下で隔離されたサンドボックス内で拡張テストスイートに対して実行され、すべてのテストケース(元のテストに加え EvalPlus 生成の入力)に合格した場合のみ受理されます。部分点はなく、1 つでも失敗またはタイムアウトすれば、そのサンプル全体が不合格になります。
重要な理由
HumanEval の元のテストは疎で、微妙に誤った解が通り抜けて報告される合格率を水増ししてしまいます。HumanEval+ の約 80x 密なテストはこうした偽陽性を暴き、モデルの順位を並べ替えるため、コード生成モデルにとって標準的で、より厳しい正当性チェックとなっています。
解説付きの例
課題
HumanEval+ 様式の代表的な項目——docstring と doctest を伴う型付き Python シグネチャで、モデルは関数本体を補完します: ```python from typing import List def above_threshold(numbers: List[float], threshold: float) -> List[float]: """Return the numbers from the input list that are strictly greater than the given threshold, preserving their original order. >>> above_threshold([1.0, 5.5, 2.3, 8.0], 3.0) [5.5, 8.0] """ ```
解答
```python
from typing import List

def above_threshold(numbers: List[float], threshold: float) -> List[float]:
    return [n for n in numbers if n > threshold]
```
解説
このリスト内包表記はしきい値より厳密に大きい要素だけを保持し入力順序を維持するため、仕様と doctest([5.5, 8.0])を満たします。採点はこれを完全な HumanEval+ スイート——空リスト、負数、全要素が等しい値など自動生成された多数の境界ケース——で実行し、すべてのテストに合格した場合にのみ 1 点を与えます。
0 3.5 7 10.5 14 2026-07-13 Qwen3.5-4B · 13 · 2026-07-13
Qwen3.5-4B
タイムライン
日付 モデル スコア ソース
2026-07-13 Qwen3.5-4B 13.0% Flintは推論トレースを圧縮してトークン使用量を削減しつつ精度を維持