LiveBench 벤치마킹 플랫폼이 평가 스위트에 DeepSeek v4.1 Flash 모델을 추가했습니다.
- 이 모델은 5.6 Sol 모델과 동등한 성능을 발휘한다고 설명됩니다.
- 평가에서 비교 대상 모델 가격의 10분의 1 미만으로 이용 가능하다는 점이 주목받고 있습니다.
LiveBench 벤치마킹 플랫폼이 평가 스위트에 DeepSeek v4.1 Flash 모델을 추가했습니다.
"Qwen3.8-Flash-Next, DeepSeek V4 Pro보다 우수"라는 제목의 Reddit 게시물이 사용자 /u/Normal-Phone7762에 의해 r/LocalLLaMA 커뮤니티에 제출되었습니다.
DeepSWE 벤치마크에서 DeepSeek V4 Pro 0813과 Claude Fable 5를 비교한 결과, 두 모델을 모두 사용하는 라우팅 전략은 각각 $8.28의 비용으로 작업의 82.7%를 해결하여 Fable 단독(69.7%)보다 우수하며 비용이 훨씬 저렴합니다.
DeepSWE 벤치마크에서 DeepSeek V4 Pro 0813과 GPT-5.6 Sol을 비교한 결과, 테스트 실패 시 DeepSeek를 먼저 실행하고 GPT-5.6 Sol로 승격하는 방식이 작업당 $3.35의 비용으로 83.0%의 성공률을 달성함을 보여줍니다.
Artificial Analysis는 Qwen3.8-27B 모델의 벤치마크 결과를 게시하여 DeepSeek V4 및 GPT-5.6 Luna Max와의 성능을 직접 비교했습니다.
한 Reddit 사용자는 DeepSeek DSv4 Flash 0731 모델을 강조하며 비용 대비 강력한 성능 능력을 지적했습니다. 이 게시물은 모델이 매우 우수한 성능을 발휘한다는 주장을 뒷받침하기 위해 Artificial Analysis Intelligence Index v4.1.1 을 참조합니다.
트래픽 측정과 사이트 개선을 위해 쿠키를 사용합니다. 분석 쿠키를 허용하거나 거부할 수 있습니다. 개인정보처리방침