주제 · Evaluation & benchmarks
lab NVIDIA Research · 18일 전 · 조회수 9회

NVIDIA는 다중 모달 모델의 공간 추론을 위한 계층적 진단 프레임워크인 Spatial-IQ를 출시했다

NVIDIA 연구진은 다중 모달 대규모 언어 모델(MLLMs)의 공간 지능을 해체하기 위해 설계된 진단 프레임워크인 Spatial-IQ를 출시했습니다. 모델을 블랙 박스로 취급하는 기존 벤치마크와 달리, 이 접근 방식은 쌓여 있는 3D 구조에서의 객체 카운팅을 인간 발달 단계와 일치하는 아홉 가지 지각 및 인지 하위 작업으로 분해합니다.

arxiv τ²-bench (tau2-bench) · 23일 전 · 조회수 3회

τ-bench 1.0.1이 banking_knowledge 채점 방식을 수정하여 신중한 에이전트 행위에 대한 페널티 방지

Sierra Research가 τ-bench 1.0.1을 출시하여 `banking_knowledge` 작업의 채점 방식을 수정하고, 신중한 검증 읽기 수행에 대해 에이전트에 페널티를 부과하지 않도록 하며 여러 데이터 불일치를 수정했습니다. 이 업데이트는 리더보드 재채점 시 점수가 상승만 하도록 보장하며, 이전에 통과했던 시뮬레이션이 실패하지 않습니다.

lab Hugging Face Blog · 1일 전 · 조회수 1회

ICML 2026 오픈 리프로덕션 챌린지, 검토된 논문 중 23%가 허위 주장을 포함하고 있음을 발견

2026년 7월 15일부터 8월 2일까지 진행된 ICML 2026 오픈 리프로덕션 챌린지는 AI 에이전트와 인간의 감독을 통해 채택된 논문의 재현에 커뮤니티를 참여시켰습니다. 이 노력은 지금까지 이루어진 머신러닝 컨퍼런스 중 가장 방대한 공개 주장별 감사로 이어졌습니다.

arxiv arXiv cs.AI · 5일 전 · 조회수 12회

GPT-5와 GPT-5 Nano가 미생물 발암 연구 평가에서 전문가 수준에 도달

GPT-5와 GPT-5 Nano가 미생물 발암 관련 연구 논문의 증거 추출 및 비판적 평가에서 전문가 수준의 성능을 달성했음을 보여주는 연구 결과가 발표되었습니다. 연구진은 MMTV-LV와 유방암에 초점을 맞춘 24편의 논문 데이터셋을 사용하여 도메인 전문가들과 함께 Gemini 2.5 Pro 및 Gemini 2.5 Flash 모델과 함께 이러한 모델들을 벤치마킹했습니다.

arxiv arXiv cs.CL · 5일 전 · 조회수 8회

GPT-5와 GPT-5 Nano가 미생물 발암 증거 추출에서 전문가 수준에 도달

미생물 발암에 대한 체계적 증거 합성을 대상으로 대규모 언어 모델을 벤치마킹한 연구 결과, GPT-5와 GPT-5 Nano가 도메인 전문가와 구별되지 않는 성능을 보였다고 밝혔다. 연구진은 Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5, GPT-5 Nano를 여러 질문 유형에 걸쳐 77개 항목으로 구성된 구조화된 템플릿을 사용하여 24편의 연구 논문에 대해 평가했다.

arxiv arXiv cs.CL · 8일 전 · 조회수 4회

M$^3$R-Bench는 다중 모달 은유 이해를 위한 증거 기반 벤치마크를 소개합니다

연구자들은 증거 기반 다중 모달 은유 이해를 평가하기 위해 설계된 인간 검증 주석이 포함된 1,000개의 이미지-텍스트 인스턴스를 포함하는 통합 벤치마크인 M$^3$R-Bench를 소개합니다. 이 벤치마크는 개념적 은유 이론에 기반한 은유 발생, 대상-소스 매핑, 감정 및 단계별 설명에 대한 결합 주석을 제공합니다.

arxiv arXiv cs.AI · 9일 전

SciCode-Verified는 벤치마크 결함을 수정하여 모델의 진정한 과학적 코딩 능력을 드러낸다

저자들은 SciCode 벤치마크에서의 점수 정체 현상이 모델 능력의 한계가 아니라 평가 도구의 중대한 결함에서 비롯된 것임을 확인했습니다. 65개의 테스트 문제에 대한 도메인 전문가 감사 결과 263개의 결함이 발견되었으며, 이 중 192개는 재현 불가능한 정답과 지나치게 엄격한 허용 오차 등의 문제로 인해 올바른 솔루션이 잘못 거부되는 원인이 되었습니다.

media Hugging Face Forums · 12일 전 · 조회수 3회

GPT-5.6, 미출현 문학 암호화 벤치마크에서 숨겨진 메시지의 95% 복원

Joseph JM Walker의 작업 논문은 물리적 소설 "I Wrote a Book and Made a Million Dollars (I.B. Wryten)"에 내장된 미출현 다채널 문학 암호화 벤치마크에서 최전방 언어 모델들을 평가합니다. 이 연구는 GPT-5.6이 2차 통신 채널을 독립적으로 인식하고 첫 번째 시도에서 내장된 자료의 약 95%를 복원한 반면, 이전 모델들은 효과적으로 0%의 능력을 보였다고 밝혔습니다.

media Hugging Face Forums · 13일 전 · 조회수 10회

Levent Bulut가 객관적 투영에 대한 LLM 주석 신뢰성 벤치마킹

Levent Bulut는 터키어 내러티브 코퍼스의 기계 생성 주석 신뢰성을 평가하기 위해 세 가지 연구로 구성된 벤치마크를 발표했으며, 자동 판독자와 인간 판단 간에 상당한 불일치를 드러냈습니다. 이 연구는 Gemini 2.5 Flash, Grok, ChatGPT 5.5, Claude Fable 5 High를 포함한 규칙 기반 감지기와 모델들을 사용하여 120개와 100개의 장면에서 여섯 가지 이항 공예 특성을 테스트했습니다.

media Hugging Face Forums · 14일 전 · 조회수 2회

장수명 에이전트 시스템에는 새로운 거버넌스 용어가 필요하다는 주장

저자는 현대의 자체 호스팅 장수명 에이전트 시스템을 단순히 "맞춤형 어시스턴트" 또는 "메모리 plus 페르소나"로 설명하는 것이 더 이상 기술적으로 충분하지 않다고 주장합니다. 이러한 오래된 프레임은 복잡한 런타임 동작을 단순한 스타일과 검색으로 축소하여 지속성, 기원 및 권위 규율의 중요한 차이를 무시합니다.

arxiv arXiv cs.CL · 15일 전 · 조회수 3회

OSReward는 크로스플랫폼 컴퓨터 사용 보상 모델에 대한 표준화된 평가를 도입합니다

연구자들은 컴퓨터 사용 에이전트 궤적에 대한 심판 역할을 하는 비전-언어 모델(VLM)의 신뢰성을 평가하기 위해 설계된 현실적인 벤치마크인 OSReward를 소개합니다. 이 연구는 최신 VLM조차도 체계적인 관용 편향에 시달리며 규모 확장에 너무 비싸다는 점을, 반면 저렴한 오픈 모델은 성능이 낮다는 점을 보여줍니다.