Benchmark results
lab Hugging Face Blog · 15시간 전 · 조회수 9회

AISI, 5개 벤치마크에서 6개 프론티어 모델에 대한 검증된 평가 결과 공개

영국 AI 보안 연구소(AISI)는 EvalEval의 Evaluation Cards 플랫폼을 통해 벤치마크 재현성을 개선하기 위해 공개 보고된 평가 방법과 결과를 제공했습니다. 이번 릴리스에는 HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, Terminal-Bench 2.0 등 5개 특정 벤치마크에 대한 검증된 결과, 컨텍스트 및 구성 정보가 포함됩니다.

media MarkTechPost · 21시간 전 GDPval-AA (Elo) · 1695.0Elo · 조회수 13회

SpaceXAI가 더 큰 기본 모델과 향상된 벤치마크를 갖춘 Grok 4.7 출시

SpaceXAI는 Grok 4.6보다 더 큰 기본 모델과 확장된 강화 학습 실행을 활용하는 코딩, 에이전트 작업 및 지식 작업을 위한 새로운 플래그십 모델인 Grok 4.7을 출시했습니다. 이 모델은 전작과 동일한 가격 체계를 유지하면서도 자체 검증, 긴 컨텍스트 처리 및 안전성 측면에서 향상된 기능을 제공합니다.

media Interconnects · 2일 전 Artificial Analysis Intelligence Index · 45.0% · 조회수 17회

중국 오픈웨이트 모델이 다운로드와 벤치마크에서 미국산 모델을 앞지르다

저자는 오픈웨이트 모델의 현황에 대한 브리핑을 제시하며, 약 2025년 4월 이후 중국 AI 기업들이 이 분야에서 명확한 선두주자가 되었음을 지적합니다. 이러한 변화는 Hugging Face 다운로드 지표와 능력 벤치마크에서의 성과로 입증됩니다.

media Hugging Face Forums · 6일 전 · 조회수 13회

에이전트 폐기 지수가 341,054개 공개 코딩 에이전트 실행의 폐기 패턴을 점수화

에이전트 폐기 지수는 루프, 무작위 재시도, 과다한 도구 출력, 중단된 실행과 같은 비효율성을 식별하기 위해 11개 공개 데이터셋에서 341,054개 에이전트 궤적을 점수화했습니다. 분석 결과, 루프 및 재시도 행동은 Llama 에이전트와 같은 약한 모델에서 흔하지만 Claude 3.7 Sonnet과 Qwen3-Coder-480B에서는 드뭅니다.

media MarkTechPost · 7일 전 LMSYS Arena (Elo) · 1866.0Elo · 조회수 20회

Prior Labs가 기본 설정으로 2015 오토 카그글 우승자를 제친 TabPFN-3.5 출시

Prior Labs는 데이터셋별 학습이나 튜닝 없이 단일 순전파로 테이블에서 예측하는 표형 파운데이션 모델인 TabPFN-3.5를 출시했습니다. 이 모델은 2015 오토 그룹 제품 분류 챌린지의 프라이빗 리더보드에서 0.375점을 기록하며, Gilberto Titericz와 Stanislav Semenov가 달성한 원래 우승 점수 0.382를 앞섰습니다.

media MarkTechPost · 7일 전 · 조회수 28회

Nums AI가 TabArena에서 단일 모델 중 최상위를 기록한 표형 파운데이션 모델 Causilo를 출시하다

Nums AI는 분류 및 회귀를 위한 사전 학습된 표형 파운데이션 모델인 Causilo를 출시했으며, 이 모델은 TabArena에서 단일 모델 중 가장 높은 Elo 점수를 달성했습니다. 이 모델은 가중치를 업데이트하는 대신 훈련 행을 컨텍스트로 저장하는 인컨텍스트 학습 방식을 활용하며, Apache-2.0 라이선스 하에 Hugging Face에서 코드와 사전 학습된 가중치를 제공합니다.

arxiv arXiv cs.CL · 8일 전 Codeforces (Elo) · 98.2% · 조회수 27회

Stellar Colosseum, 다중 에이전트 추론을 활용해 장기 수학 연구 수행

Stellar Colosseum은 모델 독립적 하네스로, 복잡한 문제에서 언어 모델의 신뢰성 부족 문제를 해결하며 수학 및 이론 컴퓨터 과학 분야의 장기 연구 전반에 추론 작업을 분배하도록 설계되었습니다. 이 시스템은 증명 구성 전에 대체 전략을 탐색하고, 준비 게이트를 통해 경로가 분해에 충분히 성숙했는지 판단하며, 증명 계획을 상호 의존적인 섹션 수준의 하위 문제로 표현합니다.

arxiv arXiv cs.LG · 8일 전 Codeforces (Elo) · 98.2% · 조회수 25회

Stellar Colosseum: 장기 수학과 TCS 연구를 위한 다중 에이전트 하니스

저자들은 Stellar Colosseum을 소개합니다. 이는 수학 및 이론 컴퓨터 과학 분야의 장기 연구에 추론을 할당하도록 설계된 모델 비종속 하니스입니다. 이 시스템은 증명 구성 전에 대체 전략을 탐색하고, 준비 게이트를 사용하여 경로가 분해에 충분히 성숙한 시점을 결정하며, 증명 계획을 상호의존적인 섹션 수준의 하위 문제로 표현합니다.

arxiv arXiv cs.AI · 9일 전 · 조회수 25회

전문가의 재채점 결과, 최첨단 모델이 물리 벤치마크에서 포화 상태에 근접

광범위하게 사용되는 여섯 가지 물리 벤치마크를 감사한 연구에 따르면, 최첨단 언어 모델의 보고된 낮은 점수는 모델의 결함보다는 벤치마킹 오류로 인해 주로 발생했다. 전문가들은 문제 진술, 참조 솔루션 및 모델 응답을 검토하여 실제 오류와 채점자의 실수, 잘못된 참조, 모호한 질문을 구분했다.

lab Cohere Blog · 10일 전 · 조회수 35회

Cohere가 주권형 오픈 가중치 번역 모델인 North Small Translate를 출시하다

Cohere는 CC BY-NC 4.0 라이선스 하에 연구 및 비상업적 용도로 사용할 수 있는 North 시리즈의 첫 번째 번역 모델인 North Small Translate를 출시했습니다. 이 mixture-of-experts 모델은 WMT26 All Languages 벤치마크에서 83.6점을 기록하여 DeepL NextGen과 Google Translate와 같은 독점 모델을 능가합니다.

media MarkTechPost · 10일 전 Terminal-Bench 2 · 92.8% · 조회수 28회

Cognition이 선택적 추론 노력을 갖춘 Kimi K3 사후 학습 코딩 모델 SWE-2 출시

Cognition은 Moonshot AI의 2.8T 파라미터 오픈 모델인 Kimi K3를 강화학습으로 사후 학습한 가장 뛰어난 코딩 모델 SWE-2를 출시했습니다. 이 모델은 FrontierCode 1.1 Main에서 50.0%의 점수를 기록했으며, 비용은 64% 절감하면서 Fable 5.1과 단 한 점 차이로 경쟁하고 있습니다.

lab NVIDIA Research · 11일 전 · 조회수 16회

ReasoningBomb는 대규모 추론 모델에서 병리적으로 긴 추론을 유도한다

연구자들은 대규모 추론 모델(LRM)의 명시적 다단계 추론이 초래하는 높은 계산 비용을 악용하는 추론 시간 서비스 거부(PI-DoS) 공격을 공식화했다. 그들은 ReasoningBomb를 제시했는데, 이는 강화학습 기반 프레임워크로, 피해 모델을 병리적으로 길고 종종 비종료되는 추론 궤도로 몰아넣는 짧은 자연어 프롬프트를 생성하도록 공격자를 훈련시킨다.