Evaluation & benchmarks
arxiv arXiv cs.CL · 2일 전

M$^3$R-Bench는 다중 모달 은유 이해를 위한 증거 기반 벤치마크를 소개합니다

연구자들은 증거 기반 다중 모달 은유 이해를 평가하기 위해 설계된 인간 검증 주석이 포함된 1,000개의 이미지-텍스트 인스턴스를 포함하는 통합 벤치마크인 M$^3$R-Bench를 소개합니다. 이 벤치마크는 개념적 은유 이론에 기반한 은유 발생, 대상-소스 매핑, 감정 및 단계별 설명에 대한 결합 주석을 제공합니다.

arxiv arXiv cs.AI · 3일 전

SciCode-Verified는 벤치마크 결함을 수정하여 모델의 진정한 과학적 코딩 능력을 드러낸다

저자들은 SciCode 벤치마크에서의 점수 정체 현상이 모델 능력의 한계가 아니라 평가 도구의 중대한 결함에서 비롯된 것임을 확인했습니다. 65개의 테스트 문제에 대한 도메인 전문가 감사 결과 263개의 결함이 발견되었으며, 이 중 192개는 재현 불가능한 정답과 지나치게 엄격한 허용 오차 등의 문제로 인해 올바른 솔루션이 잘못 거부되는 원인이 되었습니다.

media Hugging Face Forums · 6일 전 · 조회수 1회

GPT-5.6, 미출현 문학 암호화 벤치마크에서 숨겨진 메시지의 95% 복원

Joseph JM Walker의 작업 논문은 물리적 소설 "I Wrote a Book and Made a Million Dollars (I.B. Wryten)"에 내장된 미출현 다채널 문학 암호화 벤치마크에서 최전방 언어 모델들을 평가합니다. 이 연구는 GPT-5.6이 2차 통신 채널을 독립적으로 인식하고 첫 번째 시도에서 내장된 자료의 약 95%를 복원한 반면, 이전 모델들은 효과적으로 0%의 능력을 보였다고 밝혔습니다.

media Hugging Face Forums · 7일 전 · 조회수 8회

Levent Bulut가 객관적 투영에 대한 LLM 주석 신뢰성 벤치마킹

Levent Bulut는 터키어 내러티브 코퍼스의 기계 생성 주석 신뢰성을 평가하기 위해 세 가지 연구로 구성된 벤치마크를 발표했으며, 자동 판독자와 인간 판단 간에 상당한 불일치를 드러냈습니다. 이 연구는 Gemini 2.5 Flash, Grok, ChatGPT 5.5, Claude Fable 5 High를 포함한 규칙 기반 감지기와 모델들을 사용하여 120개와 100개의 장면에서 여섯 가지 이항 공예 특성을 테스트했습니다.

media Hugging Face Forums · 8일 전 · 조회수 2회

장수명 에이전트 시스템에는 새로운 거버넌스 용어가 필요하다는 주장

저자는 현대의 자체 호스팅 장수명 에이전트 시스템을 단순히 "맞춤형 어시스턴트" 또는 "메모리 plus 페르소나"로 설명하는 것이 더 이상 기술적으로 충분하지 않다고 주장합니다. 이러한 오래된 프레임은 복잡한 런타임 동작을 단순한 스타일과 검색으로 축소하여 지속성, 기원 및 권위 규율의 중요한 차이를 무시합니다.

arxiv arXiv cs.CL · 9일 전 · 조회수 2회

OSReward는 크로스플랫폼 컴퓨터 사용 보상 모델에 대한 표준화된 평가를 도입합니다

연구자들은 컴퓨터 사용 에이전트 궤적에 대한 심판 역할을 하는 비전-언어 모델(VLM)의 신뢰성을 평가하기 위해 설계된 현실적인 벤치마크인 OSReward를 소개합니다. 이 연구는 최신 VLM조차도 체계적인 관용 편향에 시달리며 규모 확장에 너무 비싸다는 점을, 반면 저렴한 오픈 모델은 성능이 낮다는 점을 보여줍니다.

lab NVIDIA Research · 12일 전 · 조회수 8회

NVIDIA는 다중 모달 모델의 공간 추론을 위한 계층적 진단 프레임워크인 Spatial-IQ를 출시했다

NVIDIA 연구진은 다중 모달 대규모 언어 모델(MLLMs)의 공간 지능을 해체하기 위해 설계된 진단 프레임워크인 Spatial-IQ를 출시했습니다. 모델을 블랙 박스로 취급하는 기존 벤치마크와 달리, 이 접근 방식은 쌓여 있는 3D 구조에서의 객체 카운팅을 인간 발달 단계와 일치하는 아홉 가지 지각 및 인지 하위 작업으로 분해합니다.

arxiv arXiv cs.AI · 12일 전

Aethis Eligibility Module는 신경-기호 아키텍처를 사용하여 LLM 규칙 평가 오류를 수정합니다

본 기사는 exception chain collapse라고 불리는 최전방 대규모 언어 모델의 실패 클래스를 문서화하고 있으며, 여기서 모델은 중첩된 조건부 규칙을 잘못 평가합니다. 이를 해결하기 위해 저자들은 Aethis Eligibility Module을 제시하는데, 이는 LLM이 작성한 규칙과 결정론적 실행을 위한 SMT 기반 레이어를 결합한 신경-기호 아키텍처입니다.

arxiv arXiv cs.CL · 12일 전

Zing 프레임워크가 SoMBench 벤치마크와 Actio 기반 추론을 통해 LLM의 사회적 지능을 향상

이 보고서는 Zing를 소개합니다. Zing는 대규모 언어 모델의 사회적 지능을 측정하고, 내재화하며, 기반 추론함으로써 향상시키는 데 설계된 통합 프레임워크입니다. 저자들은 17개의 하위 차원과 3,481명의 전문가가 검증한 인스턴스를 아우르는 심리학 기반 벤치마크인 SoMBench를 제시합니다. 이는 현재 LLM에 상당한 개선의 여지가 있으며 어떤 모델도 거의 최고점 성능에 도달하지 못했음을 보여줍니다.

media Hugging Face Forums · 15일 전

Claude Fable 5와 ChatGPT 5.5의 '보여주기, 말하지 않기' 감지 평가

후속 연구는 Claude Fable 5와 ChatGPT 5.5를 인간 주석원과 함께 구체화된 은유의 추론 기능에 대해 100개의 장면을 사용하여 테스트했습니다. 분석 결과 LLM 간 감지 임계값에서 상당한 차이가 드러났으며, Claude는 78개 사례를, ChatGPT는 40개를 식별한 반면 다른 모델들은 거의 제로 건수를 보였습니다.

media Hugging Face Forums · 15일 전

Jeanbosange가 레이어별 활성화 궤적을 검사하기 위한 LIMEN 런타임 감사 프로토타입 출시

Jeanbosange는 오픈 가중치 언어 모델에서 레이어별 활성화 궤적을 검사하도록 설계된 오픈소스 도구 모음인 LIMEN Runtime Audit의 첫 번째 공개 프로토타입을 게시했습니다. 이 도구는 레이어 전체의 숨겨진 상태 시퀀스를 측정 가능한 궤적으로 취급하여 내부 런타임 동작을 비교하기 위한 재현 가능한 관측성 계층을 제공합니다.