DeepSeek V4 Flash 0731의 ARC-AGI 결과
이 기사는 DeepSeek V4 Flash 0731 모델에 대한 ARC-AGI 벤치마크 결과를 제시합니다. ARC Prize 조직이 호스팅한 공식 결과 페이지로 연결됩니다.
이 기사는 DeepSeek V4 Flash 0731 모델에 대한 ARC-AGI 벤치마크 결과를 제시합니다. ARC Prize 조직이 호스팅한 공식 결과 페이지로 연결됩니다.
DeepSeek는 독립 벤치마크에서 더 큰 DeepSeek-V4-Pro를 능가하는 소형 "Flash" 모델의 업데이트 버전인 DeepSeek-V4-Flash-0731을 출시했습니다. 이번 릴리스는 원래 2,840억 개의 총 파라미터를 가진 Mixture-of-Experts 아키텍처를 유지하면서 새로운 파인튜닝 프로세스를 활용합니다.
DeepSWE 벤치마크에서 DeepSeek-V4 Flash 0731과 GPT-5.6 Luna를 비교한 결과, GPT-5.6 Luna가 더 강력한 엔지니어이지만 두 모델을 모두 사용하는 캐스케이드 전략이 더 낮은 비용으로 더 높은 정확도를 달성합니다.
Artificial Analysis는 에이전틱 인덱스를 업데이트하여 Qwen 3.8 Max를 최고의 전체 모델로 평가하고 Opus 5보다 위에 배치했습니다.
저자들은 SciCode 벤치마크에서의 점수 정체 현상이 모델 능력의 한계가 아니라 평가 도구의 중대한 결함에서 비롯된 것임을 확인했습니다. 65개의 테스트 문제에 대한 도메인 전문가 감사 결과 263개의 결함이 발견되었으며, 이 중 192개는 재현 불가능한 정답과 지나치게 엄격한 허용 오차 등의 문제로 인해 올바른 솔루션이 잘못 거부되는 원인이 되었습니다.
알리바바는 새로운 플래그십 모델인 Qwen3.8-Max를 발표했으며, 이는 장기적 에이전트 작업, 코딩, 다중 모달 추론에 중점을 둔 2.4T 파라미터의 희소 아키텍처라고 설명했습니다. 회사는 다음 주 Qwen3.8-27B 변형과 함께 Qwen3.8-Max의 오픈 가중치를 출시할 것이라고 확인했습니다.
Qwen 3.8 Max는 Debate Benchmark에서 1588점을 달성하여 Qwen 3.7 Max의 1462점 점수를 개선했습니다. 이 벤치마크는 다양한 주제에 대해 적대적이고 다중 턴의 반대 상황에서도 대규모 언어 모델이 주장을 얼마나 잘 유지하는지 평가합니다.
어려운 에이전트 작업에 대한 오픈 가중치 모델의 내부 평가 결과, DeepSeek v4 flash가 동종 제품군 중 가장 빠르고 저렴한 옵션으로 나타났습니다. 이 테스트는 여러 애플리케이션에 걸친 장기 실행 워크플로우를 포함했으며, 완전한 성공이 필요한 결정론적 검사를 통해 점수가 매겨졌습니다.
Qwen3.8-Max (2.4T)는 모든 벤치마크 카테고리에서 Kimi K3 및 DeepSeek V4 Flash에 근접한 성능을 보이며, 코딩 및 소프트웨어 작업에서는 더 우수한 성능을 입증하는 새로운 오픈 가중치 모델입니다.
Qwen 3.8-Max가 출시되었으며 현재 Claude Fable 5 Max에 이어 Vision Arena 리더보드에서 #2위를 차지하고 있습니다.
본 기사는 DeepSeek-V4-Flash-0731 모델이 체스 벤치마크에서 Fable-5, Sol, Kimi-K3를 능가했다고 발표했습니다.
Levent Bulut는 터키어 내러티브 코퍼스의 기계 생성 주석 신뢰성을 평가하기 위해 세 가지 연구로 구성된 벤치마크를 발표했으며, 자동 판독자와 인간 판단 간에 상당한 불일치를 드러냈습니다. 이 연구는 Gemini 2.5 Flash, Grok, ChatGPT 5.5, Claude Fable 5 High를 포함한 규칙 기반 감지기와 모델들을 사용하여 120개와 100개의 장면에서 여섯 가지 이항 공예 특성을 테스트했습니다.
DeepSeek-V4-Flash-0731 모델은 2026년 3월의 최첨단 모델들이 기록한 51점과 동일한 인덱스 점수 50을 달성했습니다.
Reddit에서 유포되고 있는 번역된 밈은 DeepSeek v4 flash의 경쟁 압력으로 인해 경쟁사가 가격을 80% 낮춰야 했음을 나타냅니다. 이 오픈 가중치 모델은 총 2840억 개의 파라미터와 130억 개의 활성 파라미터를 갖추고 있으며, 우수한 가격 대비 성능 지표를 제공합니다.
DeepSeek은 새로 일반적으로 사용 가능한 모델인 DeepSeek V4 Flash가 DeepSWE 벤치마크에서 Anthropic's Sonnet 5 및 xAI's Grok 4.5와 성능 동등성을 달성했다고 주장합니다.
DeepSeek-V4-Flash-0731 모델은 다양한 벤치마크 테스트에서 DeepSeek-V4-Pro-Preview보다 훨씬 뛰어난 성능을 보여줍니다.
새로운 DeepSeek V4-Flash 모델은 ArtificialAnalysis 지수에서 50점을 기록했습니다. 이 결과는 GLM-5.2 및 GPT-5.6 Luna보다 단 한 점 낮은 위치를 차지합니다.
DeepSeek-V4-Flash-0731 모델은 전작과 동일한 가격을 유지하면서 GLM 5.2보다 우수한 성능을 보입니다.
DeepSeek는 V4 Flash 모델을 업데이트하여 이전 미리보기 버전보다 상당한 성능 향상을 보인 2026-07-31판 새 버전을 출시했습니다. 이번 업데이트에서는 여러 새로운 벤치마크의 결과를 도입하고 기존 벤치마크의 점수도 개선했습니다.
한 사용자가 Sonnet 4.6을 사용하여 34개의 원샷 프롬프트를 실행하고 결과로 나온 HTML, 스크린샷 및 GIF를 평가하여 Claude Opus 4.8 대비 Kimi K3를 평가했습니다. 평가 결과 Kimi K3가 Opus 4.8보다 더 나은 결과를 생성했습니다.