주제 · Evaluation & benchmarks
lab OpenAI News · 7일 전 · 조회수 25회

OpenAI, AI의 정신 건강 응답 평가를 위한 MentalHealthBench 출시

OpenAI는 현실적인 정신 건강 대화에서 AI 시스템이 어떻게 반응하는지 평가하기 위해 설계된 오픈 벤치마크인 MentalHealthBench를 소개했습니다. 22개국에서 온 80명 이상의 자격을 갖춘 정신 건강 전문가들과 함께 개발된 이 벤치마크는 안전성, 맥락 탐색, 사용자 주권 보존 등 주요 행동 영역에서 모델의 능력을 평가합니다.

media Don't Worry About the Vase · 22일 전 · 조회수 20회

생각의 사슬 효과성 감소에 따라 OpenAI의 Astra 모델 모니터링이 더 어려워짐

OpenAI는 새로운 Astra 모델이 이전 버전보다 훨씬 더 모니터링하기 어렵다고 인정했으며, 이는 생각의 사슬(CoT) 모니터링의 효과성이 감소했음을 나타냅니다. 이 경향은 모델의 능력이 증가함에 따라 CoT 분석을 통해 불일치를 감지하는 능력이 감소하여 현재 모니터링 시스템이 1년 이내에 신뢰할 수 없게 될 가능성을 시사합니다.

lab Hugging Face Blog · 4시간 전 · 조회수 1회

오픈 TTS 리더보드가 확장 가능한 다국어 TTS 평가를 출시하다

오픈 TTS 리더보드는 느린 아레나 기반 인간 선호도 점수에 의존하는 대신 객관적 지표를 사용하여 텍스트 음성 변환(TTS) 평가의 단편화와 표준화 부재를 해결하기 위해 출시되었습니다. 이 리더보드는 Qwen3 ASR과 WavLM 임베딩을 사용하여 모델의 가청성, 속도 및 화자 유사성을 평가합니다.

arxiv arXiv cs.CL · 2일 전 · 조회수 1회

다중 턴 LLM 오염에서 인식론적 정책의 분리를 밝힌 연구

"Epistemic Policy Divergence in Multi-Turn LLM Contamination: A Protocol-Gradient Investigation"라는 제목의 연구는 대화 기록에 주입된 거짓 전제를 대형 언어 모델이 어떻게 처리하는지 평가하며, 이는 세션 레벨 오염이라는 실패 모드로 명명됩니다. 연구자들은 GPT-5.4 Mini, Gemini-3.1 Flash-Lite, GLM-4.5-Air를 22,500 턴의 온도 제로 조건으로 열 가지 지식 도메인에서 테스트했습니다.

arxiv arXiv cs.CL · 2일 전 · 조회수 1회

Rep2Act가 새로운 VAD-R 벤치마크에서 기권 능력을 향상시키기 위해 VLM 표현을 정렬

연구자들은 Visual Answerability Diagnosis with Rationales(VAD-R)이라는 새로운 벤치마크를 소개했으며, 이는 단서 없이 답할 수 없는 질문에 대해 기권하는 능력과 관련된 시각-언어 모델의 성능을 평가하기 위해 설계되었습니다. 연구 결과, 은닉 상태가 답변 가능성을 구분할 수는 있지만 현재 모델들은 이를 명시적인 결정으로 전환하지 못하는 것으로 드러났습니다.

media Hugging Face Forums · 2일 전 · 조회수 1회

Ujjal Bhattacharjee, 증거 검토를 위한 구조화된 에이전트 논평 테스트 연구 설계 제안

Ujjal Bhattacharjee는 고정된 지출 및 마감 시간 제약 하에서 구조화된 도전과 수정이 증거 검토 작업을 개선하는지 평가하기 위한 방법론적 프레임워크를 제안했습니다. 이 제안은 단일 리뷰어, 독립 집계, 구조화된 심의 및 Jev 평가자와의 심의를 비교하는 네 가지 조건의 실험을 개요로 제시합니다.

media Hugging Face Forums · 3일 전 · 조회수 1회

SecFathy가 적대적 실패로 인해 특수화된 8B XSS 모델을 거부

개발자 SecFathy는 XSS 취약점 분석을 위해 설계된 8B 보안 모델인 XSS Specialist라는 연구 프로토타입을 오픈소스로 공개했습니다. 이 프로젝트는 초기에 검색과 LoRA를 사용하여 전문화의 한계를 밀어붙이는 것을 목표로 했지만, 작은 식별자 변경이 잘못된 안전 판단을 초래하는 적대적 근접 실패 테스트에서 실패했기 때문에 결국 해당 모델을 거부했습니다.

media Hugging Face Forums · 3일 전 · 조회수 9회

Claude Opus 5와 Tetsu가 자체 프로젝트에서 여섯 개의 허술한 CI 검사를 발견하다

9월 27일, Claude Opus 5와 3B 모델인 Tetsu는 공개 저장소에서 측정해야 할 내용을 검증하지 못했음에도 초록색 또는 통과로 보고된 여섯 개의 별도 지속적 통합(CI) 검사를 식별했습니다. 해당 문제들은 오래된 다이제스트로 인해 유효한 재시작을 거부하는 배포 게이트부터 사소한 성능 차이까지 허용하는 허술한 임계값을 가진 타이밍 벤치마크에 이르기까지 다양했습니다.

media Hugging Face Forums · 4일 전 · 조회수 7회

Jev의 효율성 주장과 기술적 독창성에 대한 커뮤니티의 회의론

이 기사는 LinkedIn에서 "Jev"에 대한 관심이 급증한 것을 다루고 있으며, 저자가 이러한 주장을 뒷받침할 실질적인 증거를 거의 찾지 못했음에도 불구하고 Jev는 혁신적인 AI 돌파구로 과장되었습니다. 저자는 Jev가 막대한 효율성과 새로운 패러다임을 홍보함에도 불구하고 평가 데이터와 기술적 세부 사항이 부족하여, 이것이 진정한 아키텍처 혁신인지 아니면 단순히 재포장된 분류에 불과한지에 대한 의문을 제기합니다.

media Hugging Face Forums · 7일 전 · 조회수 12회

RLHF로 훈련된 AI 시스템의 인공적 과신 분석

현대 대규모 언어 모델은 체계적으로 과신하며, 기술적 교정 실패가 아닌 학습 인센티브로 인해 잘못된 답변에 대해 높은 확신을 표현합니다. 인간의 피드백을 통한 강화 학습(RLHF) 동안 인간 평가자는 권위 있고 결정적으로 들리는 답변을 보상하여 모델이 불확실성이 처벌받는 것을 학습하게 만듭니다.

arxiv arXiv cs.CL · 7일 전 · 조회수 2회

WebMRE 벤치마크는 웹 에이전트에서 가이드-액션 상호 보강을 드러낸다

저자들은 WebMRE를 소개한다. 이는 성공적인 WebArena 트래젝토리에서 파생된 541개의 작업과 5,293개의 스텝으로 구성된 오프라인 벤치마크로, 환경 드리프트 없이 웹 에이전트 체크포인트를 평가하기 위한 결정론적 프로토콜을 제공하도록 설계되었다. 이 프레임워크는 인간 중심의 가이드 문장과 지상화된 액션을 짝지어 두 요소 간 상호 보강 효과를 연구한다.

lab Hugging Face Blog · 8일 전 · 조회수 25회

AISI, 5개 벤치마크에서 6개 프론티어 모델에 대한 검증된 평가 결과 공개

영국 AI 보안 연구소(AISI)는 EvalEval의 Evaluation Cards 플랫폼을 통해 벤치마크 재현성을 개선하기 위해 공개 보고된 평가 방법과 결과를 제공했습니다. 이번 릴리스에는 HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, Terminal-Bench 2.0 등 5개 특정 벤치마크에 대한 검증된 결과, 컨텍스트 및 구성 정보가 포함됩니다.

media Hugging Face Forums · 9일 전 · 조회수 14회

CosmicUndercurrent이 LLM 전체 시스템 조정을 테스트하기 위한 Principia-Structurae-Realitatis를 공개

CosmicUndercurrent은 대규모 언어 모델에서 구조적 프라이밍이 전역적 불일치를 줄일 수 있는지 테스트하도록 설계된 모델 비종속 추론 프레임워크를 오픈소스로 공개했습니다. 이 프로젝트는 호스팅되며, 두 단계 프로세스가 지역적 정확성 대비 전체 시스템 조정을 개선하는지 조사합니다.