한 연구는 질문자가 N개의 위키백과 단락 중 대상 항목을 정확히 log2(N)개의 예/아니오 질문으로 식별하는 두 에이전트 간 통신 작업에서 여섯 개의 프론티어 언어 모델을 평가했습니다. 이 실험은 4~1024개 단락으로 구성된 문서 세트에서 총 408번의 게임을 진행했으며, 테스트된 모델들 간에 현저한 성능 격차를 드러냈습니다.
- Claude Opus는 68게임 중 28승에 그쳤으며, GLM-5.3, GPT-5.6 Sol, Grok 4.6, Gemini 3.8 Flash, Kimi K3는 45%~56%의 승률을 기록했습니다.
- 상위 다섯 모델은 세트 크기가 증가함에 따라 승률이 감소하는 경향(r=-0.973)을 보였으며, 이는 p=0.928일 때 win=p^(log2 N) 공식에 부합합니다.
- 오류는 정답 오답과 식별 실패로 절반씩 분포했으며, Claude Opus는 34번의 만장일치 오류 중 32번을 "No"라고 잘못 답변함으로써 저질렀습니다.
- 질문당 정보량은 승률과 양의 상관관계(r=+0.88)를 보였으며, 문서 제목을 기준으로 분할하여 질문당 완전한 1비트를 추출한 모델은 단 두 개뿐이었습니다.
- 추론 토큰 소모량은 모델 간 4.5배 차이가 났으나 성공도와는 거의 관련이 없었으며, 추적 성장량이 신뢰성 향상과 일치하지 않았기 때문입니다.
이 결과는 대부분의 선도적 모델이 이러한 비대칭 정보 환경에서 미미하게 구분 가능하지만, Claude Opus는 동급 모델들에 비해 현저히 낮은 성능을 보였음을 나타냅니다.