벤치마크 · coding

HumanEval

saturated 8 결과 6 모델

HumanEval은 자연어 설명으로부터 올바른 Python 코드를 작성하는 모델의 능력을 측정하며, 첫 시도에 푼 문제의 비율인 pass@1로 채점한다.

자세히 보기
예시
전형적인 문제는 함수 시그니처와 그 docstring을 제공하고 — 예를 들어 "n보다 작은 모든 소수의 목록을 반환하라" — 모델은 함수 본문을 채워야 한다.
채점 방식
지표는 pass@1로, 생성된 각 풀이를 숨겨진 unit 테스트로 실행하며, 점수는 164개 문제 중 풀이가 자신의 모든 테스트를 통과한 비율이다.
검증 방식
완전히 자동이며, 풀이는 해당 문제의 숨겨진 unit 테스트를 모두 통과할 때만 정답으로 인정된다. 사람의 판단이나 문자열 정확 일치는 없다.
왜 중요한가
널리 쓰인 초기 코드 생성 벤치마크 중 하나로 프로그래밍 능력의 표준 기준이 되었지만, 지금은 상위 모델들의 점수가 너무 높아 사실상 포화되어 모델 간 변별력이 거의 없다.
예제 풀이
문제
이 Python 함수의 본문을 완성하여 숨겨진 유닛 테스트를 통과하도록 하세요: ```python from typing import List def below_zero(operations: List[int]) -> bool: """You're given a list of deposit and withdrawal operations on a bank account starting at zero balance. Detect whether the balance ever drops below zero and return True at that point; otherwise return False. >>> below_zero([1, 2, 3]) False >>> below_zero([1, 2, -4, 5]) True """ ```
해답
from typing import List


def below_zero(operations: List[int]) -> bool:
    balance = 0
    for op in operations:
        balance += op
        if balance < 0:
            return True
    return False
풀이
누적 잔액을 유지하면서 각 연산을 순서대로 더하고, 잔액이 0 미만이 되는 순간 True를 반환합니다; 루프가 끝나면 잔액이 한 번도 음수가 되지 않았다는 뜻이므로 False를 반환합니다. HumanEval은 모델의 완성 결과를 프롬프트에 이어 붙여 숨겨진 유닛 테스트로 실행해 채점하며(pass@k), 모든 assert가 통과할 때만 해결로 인정합니다.
0 24.5 49 73.5 98 2023-03-14 2024-11-13 2026-07-16 Grok-1.5 · 74.1 · 2024-03-28 Claude 3.5 Sonnet · 92 · 2024-06-20 Claude 3.5 Sonnet · 92 · 2024-06-20 Qwen2-72B · 64.6 · 2024-07-15 Qwen2-72B · 64.6 · 2024-07-15 Granite 4.0 3B · 83.5 · 2026-07-16 GPT-4 · 67 · 2023-03-14 GPT-4o · 90.2 · 2024-05-13
Grok-1.5 Claude 3.5 Sonnet Qwen2-72B Granite 4.0 3B GPT-4 GPT-4o
타임라인
날짜 모델 점수 출처
2026-07-16 Granite 4.0 3B 83.5% IBM이 고품질 코드의 방대한 합성 데이터셋인 CodeAlchemy를 오픈소스로 공개
2024-07-15 Qwen2-72B 64.6% Qwen2 기술 보고서: 최대 72B 규모의 밀집형 및 MoE 모델 소개
2024-07-15 Qwen2-72B 64.6% Qwen 팀, 72B 밀집 및 MoE 모델이 포함된 Qwen2 시리즈 출시
2024-06-20 Claude 3.5 Sonnet 92.0% Anthropic, Claude 3.5 Sonnet의 향상된 코딩 및 비전 벤치마크를 포함한 추가 문서 출시
2024-06-20 Claude 3.5 Sonnet 92.0% Anthropic
2024-05-13 GPT-4o 90.2% OpenAI
2024-03-28 Grok-1.5 74.1% xAI, 추론 능력 향상 및 128K 컨텍스트를 갖춘 Grok-1.5 출시
2023-03-14 GPT-4 67.0% OpenAI