Benchmark results
arxiv arXiv cs.AI · 3일 전

SciCode-Verified는 벤치마크 결함을 수정하여 모델의 진정한 과학적 코딩 능력을 드러낸다

저자들은 SciCode 벤치마크에서의 점수 정체 현상이 모델 능력의 한계가 아니라 평가 도구의 중대한 결함에서 비롯된 것임을 확인했습니다. 65개의 테스트 문제에 대한 도메인 전문가 감사 결과 263개의 결함이 발견되었으며, 이 중 192개는 재현 불가능한 정답과 지나치게 엄격한 허용 오차 등의 문제로 인해 올바른 솔루션이 잘못 거부되는 원인이 되었습니다.

media AI News (smol.ai) · 4일 전 Terminal-Bench 2 · 67.4% · 조회수 8회

알리바바, 2.4T 파라미터를 갖춘 Qwen3.8-Max와 향후 오픈 가중치 발표

알리바바는 새로운 플래그십 모델인 Qwen3.8-Max를 발표했으며, 이는 장기적 에이전트 작업, 코딩, 다중 모달 추론에 중점을 둔 2.4T 파라미터의 희소 아키텍처라고 설명했습니다. 회사는 다음 주 Qwen3.8-27B 변형과 함께 Qwen3.8-Max의 오픈 가중치를 출시할 것이라고 확인했습니다.

media r/LocalLLaMA · 6일 전 · 조회수 2회

DeepSeek v4 flash가 에이전트 작업에서 속도와 비용 측면에서 오픈 가중치 모델 중 선두

어려운 에이전트 작업에 대한 오픈 가중치 모델의 내부 평가 결과, DeepSeek v4 flash가 동종 제품군 중 가장 빠르고 저렴한 옵션으로 나타났습니다. 이 테스트는 여러 애플리케이션에 걸친 장기 실행 워크플로우를 포함했으며, 완전한 성공이 필요한 결정론적 검사를 통해 점수가 매겨졌습니다.

media Hugging Face Forums · 7일 전 · 조회수 8회

Levent Bulut가 객관적 투영에 대한 LLM 주석 신뢰성 벤치마킹

Levent Bulut는 터키어 내러티브 코퍼스의 기계 생성 주석 신뢰성을 평가하기 위해 세 가지 연구로 구성된 벤치마크를 발표했으며, 자동 판독자와 인간 판단 간에 상당한 불일치를 드러냈습니다. 이 연구는 Gemini 2.5 Flash, Grok, ChatGPT 5.5, Claude Fable 5 High를 포함한 규칙 기반 감지기와 모델들을 사용하여 120개와 100개의 장면에서 여섯 가지 이항 공예 특성을 테스트했습니다.