DeepSWE에서 DeepSeek-V4 Flash 0731 대 GPT-5.6 Luna: 비용 및 코딩
DeepSWE 벤치마크에서 DeepSeek-V4 Flash 0731과 GPT-5.6 Luna를 비교한 결과, GPT-5.6 Luna가 더 강력한 엔지니어이지만 두 모델을 모두 사용하는 캐스케이드 전략이 더 낮은 비용으로 더 높은 정확도를 달성합니다.
DeepSWE 벤치마크에서 DeepSeek-V4 Flash 0731과 GPT-5.6 Luna를 비교한 결과, GPT-5.6 Luna가 더 강력한 엔지니어이지만 두 모델을 모두 사용하는 캐스케이드 전략이 더 낮은 비용으로 더 높은 정확도를 달성합니다.
Moonshot AI는 장기 코딩과 심층 추론을 위해 설계된 2.8조 파라미터의 오픈 웨이트 모델인 Kimi K3를 출시했습니다. 이는 3조 파라미터 클래스에서 최초의 오픈소스 모델이며 100만 토큰 컨텍스트 창을 지원합니다.
Together AI는 Moonshot의 오픈 가중치 모델을 위한 런치 플랫폼으로 기능하기 위해 Moonshot AI와의 전략적 파트너십을 발표했습니다. 첫 번째로 Kimi K3가 제공됩니다. 이 협력을 통해 개발자는 Together AI의 미국 호스팅 인프라와 도구를 통해 프론티어 릴리스에 제로 데이 접근 권한을 얻게 됩니다.
DeepSWE 벤치마크에서의 Kimi K3와 GPT-5.6 Sol 비교 결과, GPT-5.6 Sol이 단일 추론 품질(72.7% 대 68.5%)에서 앞섰지만, Kimi K3는 훨씬 낮은 비용으로 k > 1에 대해 더 높은 pass@k 점수를 달성했습니다.
Moonshot AI의 오픈 가중치 모델인 Kimi K3는 DeepSWE 벤치마크에서 Anthropic의 Claude Fable 5와 비교할 만한 성능을 달성하면서도 작업당 비용이 훨씬 저렴합니다. 2026년 7월 16일 평가에서 Kimi K3는 pass@1 기준 68.5%를 기록하여 Fable 5의 69.9%에 근접했으나, 다중 시도 시나리오에서는 이를 능가하며 뛰어난 비용 효율성을 보였습니다.
Together AI는 Dedicated Model Inference 플랫폼에 오토스케일링 기능을 추가하여, 인플라이트 요청, 첫 토큰까지의 시간(TTFT), GPU 사용률 등 추론 엔진이 이해하는 지표를 기반으로 배포가 확장되도록 했습니다.
ThunderAgent는 높은 동시성 합성 데이터 생성에서 KV 캐시 스래싱 문제를 해결하기 위해 에이전트 LLM 요청 스케줄링을 위한 프로그램 추상화를 도입한 시스템입니다. 에이전트 워크플로우를 독립적인 요청이 아닌 스케줄 가능한 프로그램으로 처리함으로써 처리량을 크게 향상시키고 지연 시간을 줄입니다.
Together AI는 엔드포인트, 배포 및 불변 구성을 용량 기반 트래픽 분할로 연결하는 전용 모델 추론 플랫폼의 아키텍처를 상세히 설명합니다. 이 시스템은 고정된 비율 대신 유효 용량(가중치에 준비된 복제본 수를 곱한 값)에 따라 요청을 라우팅하여 다운타임 없는 롤아웃과 A/B 테스트와 같은 기능을 가능하게 합니다.
Together는 오픈 가중치 모델에 대한 성능, 비용 및 품질에 대한 완전한 제어권을 사용자에게 제공하도록 설계된 "전용 모델 추론"을 도입하여 추론 플랫폼에 상당한 업데이트를 출시했습니다. 이 업데이트에는 풀 가중치와 LoRA 강화 학습을 포함한 커스텀 트레이닝 기능의 클로즈드 베타도 발표되었습니다.
Together AI와 Y Combinator는 Y Combinator의 포트폴리오에 있는 AI 네이티브 스타트업만을 위해 전용 GPU 클러스터를 제공하기 위한 파트너십을 발표했습니다. 이 계획은 장기적인 계약 없이 유연하고 비용 효율적인 인프라를 제공하여 학습과 추론을 위한 컴퓨팅 접근의 중요한 병목 현상을 해결하는 것을 목표로 합니다.
Together AI는 GPU 추론을 위해 서로 다른 신뢰성 티어에 도달하는 데 필요한 구체적인 아키텍처 요구 사항을 상세히 설명하며, 표준 SLA 수치가 실제로 커버되는 장애 도메인을 종종 숨긴다고 주장합니다.