Base-10의 찰리 오닐은 Dwarkesh Patel과의 최근 에피소드에서 Kimi와 GLM 모델이 "거의 객관적으로" Opus 5보다 우수하다고 논의했습니다.
이 논의는 AI 발전에 대한 회의론을 다루며, 연구자들이 데이터 정점에 도달한 것이 아니라 상당한 쉬운 과일을 수확했다고 제안합니다. 또한 Patel이 회의론에서 산업이 AGI와 RSI를 만드는 데 잘 가고 있다는 믿음으로 전환하는 과정도 다룹니다.
Base-10의 찰리 오닐은 Dwarkesh Patel과의 최근 에피소드에서 Kimi와 GLM 모델이 "거의 객관적으로" Opus 5보다 우수하다고 논의했습니다.
이 논의는 AI 발전에 대한 회의론을 다루며, 연구자들이 데이터 정점에 도달한 것이 아니라 상당한 쉬운 과일을 수확했다고 제안합니다. 또한 Patel이 회의론에서 산업이 AGI와 RSI를 만드는 데 잘 가고 있다는 믿음으로 전환하는 과정도 다룹니다.
DeepSWE 벤치마크에서 GLM-5.3과 GPT-5.6 Sol을 비교 분석한 결과, 캐스케이딩 라우팅 전략이 단일 모델만 사용하는 것보다 더 뛰어난 성능을 보였습니다. GLM-5.3을 먼저 실행하고 테스트가 실패할 때만 GPT-5.6 Sol로 승격시키는 방식으로 시스템을 운영하면, 작업당 $6.61의 비용으로 85.9%의 작업을 해결할 수 있습니다.
DeepSWE 벤치마크에서의 Kimi K3와 GPT-5.6 Sol 비교 결과, GPT-5.6 Sol이 단일 추론 품질(72.7% 대 68.5%)에서 앞섰지만, Kimi K3는 훨씬 낮은 비용으로 k > 1에 대해 더 높은 pass@k 점수를 달성했습니다.
세 가지 오픈 가중치 희소 Mixture-of-Experts 모델인 Moonshot AI의 Kimi K3, DeepSeek V4 Pro, Zhipu AI의 GLM-5.2를 비교하여 장기적 코딩 및 에이전트 워크로드에 대한 능력, 라이선스 조건, 서빙 비용을 평가합니다.
광범위하게 사용되는 여섯 가지 물리 벤치마크를 감사한 연구에 따르면, 최첨단 언어 모델의 보고된 낮은 점수는 모델의 결함보다는 벤치마킹 오류로 인해 주로 발생했다. 전문가들은 문제 진술, 참조 솔루션 및 모델 응답을 검토하여 실제 오류와 채점자의 실수, 잘못된 참조, 모호한 질문을 구분했다.
Cognition은 Moonshot AI의 2.8T 파라미터 오픈 모델인 Kimi K3를 강화학습으로 사후 학습한 가장 뛰어난 코딩 모델 SWE-2를 출시했습니다. 이 모델은 FrontierCode 1.1 Main에서 50.0%의 점수를 기록했으며, 비용은 64% 절감하면서 Fable 5.1과 단 한 점 차이로 경쟁하고 있습니다.
트래픽 측정과 사이트 개선을 위해 쿠키를 사용합니다. 분석 쿠키를 허용하거나 거부할 수 있습니다. 개인정보처리방침