두 가지 API 설정으로 ARC-AGI-3에서 GPT-5.6 점수가 3배 증가
GPT-5.6에 대한 두 가지 특정 API 설정을 활성화한 결과, ARC-AGI-3 벤치마크에서 성능 점수가 3배로 증가했습니다.
GPT-5.6에 대한 두 가지 특정 API 설정을 활성화한 결과, ARC-AGI-3 벤치마크에서 성능 점수가 3배로 증가했습니다.
Z.ai는 베이스 모델인 GLM-5.2의 사후 학습을 확장하여 에이전트 코딩 벤치마크에서 최첨단 성능을 달성한 새로운 모델 GLM-5.3을 발표했습니다. 약 750B 파라미터를 가진 이 모델은 현재 Kimi K3을 능가하며 다양한 벤치마크에서 Claude Fable 5 및 GPT-5.6-Sol과 동등하거나 이를 초과하는 성능을 보입니다.
DeepSWE 벤치마크에서 DeepSeek-V4 Flash 0731과 GPT-5.6 Luna를 비교한 결과, GPT-5.6 Luna가 더 강력한 엔지니어이지만 두 모델을 모두 사용하는 캐스케이드 전략이 더 낮은 비용으로 더 높은 정확도를 달성합니다.
알리바바는 새로운 플래그십 모델인 Qwen3.8-Max를 발표했으며, 이는 장기적 에이전트 작업, 코딩, 다중 모달 추론에 중점을 둔 2.4T 파라미터의 희소 아키텍처라고 설명했습니다. 회사는 다음 주 Qwen3.8-27B 변형과 함께 Qwen3.8-Max의 오픈 가중치를 출시할 것이라고 확인했습니다.
DeepSeek는 V4 Flash 모델을 업데이트하여 이전 미리보기 버전보다 상당한 성능 향상을 보인 2026-07-31판 새 버전을 출시했습니다. 이번 업데이트에서는 여러 새로운 벤치마크의 결과를 도입하고 기존 벤치마크의 점수도 개선했습니다.
DeepSWE 벤치마크에서의 Kimi K3와 GPT-5.6 Sol 비교 결과, GPT-5.6 Sol이 단일 추론 품질(72.7% 대 68.5%)에서 앞섰지만, Kimi K3는 훨씬 낮은 비용으로 k > 1에 대해 더 높은 pass@k 점수를 달성했습니다.
Anthropic이 Claude Opus 5 모델을 출시하여 코딩 및 일반 능력 지표에서의 성능에 대한 감시와 프론티어 모델 평가에 관한 논쟁을 재점화시켰다.
Anthropic은 벤치마크 점수와 실제 성능에 대해 상당한 논의를 촉발한 새로운 프런티어 모델인 Claude Opus 5를 출시했습니다. Epoch AI의 독립 평가에 따르면 새 모델의 Epoch Capabilities Index(ECI)는 159, SWE-ECI는 161입니다.
Moonshot AI의 오픈 가중치 모델인 Kimi K3는 DeepSWE 벤치마크에서 Anthropic의 Claude Fable 5와 비교할 만한 성능을 달성하면서도 작업당 비용이 훨씬 저렴합니다. 2026년 7월 16일 평가에서 Kimi K3는 pass@1 기준 68.5%를 기록하여 Fable 5의 69.9%에 근접했으나, 다중 시도 시나리오에서는 이를 능가하며 뛰어난 비용 효율성을 보였습니다.
Sierra Research가 τ-bench 1.0.1을 출시하여 `banking_knowledge` 작업의 채점 방식을 수정하고, 신중한 검증 읽기 수행에 대해 에이전트에 페널티를 부과하지 않도록 하며 여러 데이터 불일치를 수정했습니다. 이 업데이트는 리더보드 재채점 시 점수가 상승만 하도록 보장하며, 이전에 통과했던 시뮬레이션이 실패하지 않습니다.
7월 16일, Moonshot AI는 최신 플래그십 모델인 Kimi K3를 출시했습니다. 이는 2.8조 파라미터를 가진 Mixture of Experts (MoE) 아키텍처입니다. 회사는 7월 27일에 모델 가중치를 공개할 것을 약속했습니다.
Moonshot이 Kimi K3를 출시했으며, 이 오픈 가중치 모델은 중국산 모델이 프론티어에 얼마나 근접해 있는지에 대한 재평가를 촉발했습니다. 이번 출시는 코딩, 에이전트 작업, 장기 지식 작업에서 강력한 성능을 특징으로 합니다.
문샷 AI는 총 2.8조 개의 파라미터와 네이티브 멀티모달 입력 기능을 갖춘 새로운 프론티어 클래스 오픈 가중치 모델인 Kimi K3를 소개했습니다. 공식적으로 "오픈 프론티어 인텔리전스"로 포지셔닝된 이 모델은 100만 토큰의 컨텍스트 윈도우를 지원하며, 효율성을 높이기 위해 Kimi Delta Attention(KDA)와 Attention Residuals와 같은 새로운 아키텍처 구성 요소를 활용합니다.
문숏 AI는 2.8조 개의 파라미터와 네이티브 멀티모달 입력을 갖춘 프론티어급 오픈웨이트 모델인 Kimi K3를 출시했습니다. 이 모델은 긴 컨텍스트에서 더 빠른 디코딩을 위한 Kimi Delta Attention(KDA)을 특징으로 하며, 장기적 에이전트 코딩 워크플로우에 적합하게 설계되었습니다.
중국 AI 연구소 문샷 AI는 2.8조 파라미터를 갖춘 Kimi K3를 발표했으며, 이를 지금까지 개발한 가장 강력한 모델로 소개했다. 이 모델은 현재 웹사이트와 API를 통해 이용 가능하며, 2026년 7월 27일까지 오픈 웨이트 릴리스가 예정되어 있다.
DharmaOCR은 도메인 특화 훈련을 통해 Mistral OCR4 및 Unlimited-OCR보다 브라질 포르투갈어에서 더 높은 추출 품질과 안정성을 달성합니다.
Qwen이 Qwen3.8-27B 모델을 출시했으며, ModelScope와 Hugging Face에서 다운로드할 수 있습니다.
본 기사는 Gemini 3.7 Flash 업데이트의 차트를 강조하며, 이전 버전(특히 3.5 및 3.6 Flash)이 Claude 4.8+ 및 GPT 5.5+ 시리즈와 같은 최신 모델에 비해 뒤처졌음을 보여줍니다.
한 Reddit 사용자는 DeepSeek DSv4 Flash 0731 모델을 강조하며 비용 대비 강력한 성능 능력을 지적했습니다. 이 게시물은 모델이 매우 우수한 성능을 발휘한다는 주장을 뒷받침하기 위해 Artificial Analysis Intelligence Index v4.1.1 을 참조합니다.
저소득 및 중산층 국가를 위해 설계된 목적 특화 검색 증강 생성 시스템인 VITA가 HealthBench 벤치마크에서 범용 대규모 언어 모델들과 비교 평가되었습니다. 이 연구는 새로운 최첨단 모델이 출시됨에 따라라도 코퍼스 특화 설계가 경쟁력 있는 성능을 유지할 수 있음을 보여줍니다.