DeepSWEにおけるDeepSeek-V4 Flash 0731とGPT-5.6 Lunaの比較: コストとコーディング
DeepSWEベンチマークにおけるDeepSeek-V4 Flash 0731とGPT-5.6 Lunaの比較により、GPT-5.6 Lunaがより強力なエンジニアである一方で、両モデルを用いたカスケード戦略は、より低いコストでより高い精度を達成することが明らかになった。
DeepSWEベンチマークにおけるDeepSeek-V4 Flash 0731とGPT-5.6 Lunaの比較により、GPT-5.6 Lunaがより強力なエンジニアである一方で、両モデルを用いたカスケード戦略は、より低いコストでより高い精度を達成することが明らかになった。
Moonshot AIは、長期コーディングと深い推論のために設計された2.8兆パラメータのオープンウェイトモデル「Kimi K3」をリリースしました。これは3兆パラメータクラス初のオープンソースモデルであり、100万トークンのコンテキストウィンドウをサポートします。
Together AIは、MoonshotのオープンウェイトモデルのローンチプラットフォームとなるためのMoonshot AIとの戦略的パートナーシップを発表しました。最初のモデルとしてKimi K3が提供されます。この協力により、開発者はTogether AIの米国ホストインフラとツールを通じて、最先端リリースへのゼロデイアクセスを得ることができます。
DeepSWEベンチマークにおけるKimi K3とGPT-5.6 Solの比較により、GPT-5.6 Solが一発での品質(72.7%対68.5%)でリードしているものの、Kimi K3はk > 1に対してpass@kスコアをより高いコスト効率で達成することが明らかになった。
Moonshot AIが公開するオープンウェイトモデルであるKimi K3は、DeepSWEベンチマークにおいてAnthropicのClaude Fable 5と同等のパフォーマンスを発揮し、タスクあたりのコストを大幅に抑えています。2026年7月16日の評価では、Kimi K3はpass@1で68.5%を達成し、Fable 5の69.9%には及びませんでしたが、複数回の試行シナリオではこれを上回り、コスト効率においても優れていました。
Together AIは、Dedicated Model Inferenceプラットフォームに自動スケーリング機能を追加し、実行中のリクエスト、初回トークンまでの時間(TTFT)、GPU使用率など、推論エンジンが理解するメトリクスに基づいてデプロイメントをスケーリングできるようになった。
ThunderAgentは、高同時実行の合成データ生成におけるKVキャッシュのスラッシングに対処するため、エージェントLLMリクエストのスケジューリングにプログラム抽象化を導入するシステムです。エージェントワークフローを独立したリクエストではなくスケジューリング可能なプログラムとして扱うことで、スループットを大幅に向上させ、レイテンシを削減します。
Together AI は、エンドポイント、デプロイメント、不変設定を容量認識のトラフィック分割で結びつける Dedicated Model Inference プラットフォームのアーキテクチャについて詳述している。このシステムは、固定パーセンテージではなく有効容量(重み×準備完了レプリカ数)に基づいてリクエストをルーティングし、ゼロダウンタイムでのロールアウトや A/B テストなどの機能を実現する。
Togetherは、その推論プラットフォームに重要なアップデートを導入し、オープンウェイトモデルのパフォーマンス、コスト、品質に対する完全な制御をユーザーに提供するために設計された「Dedicated Model Inference」を発表しました。このアップデートでは、フルウェイトとLoRAの強化学習を含むカスタムトレーニング機能のクローズドベータ版も発表されています。
Together AIとY Combinatorは、Y CombinatorのポートフォリオにあるAIネイティブなスタートアップ専用に設計された最初の専用GPUクラスターを提供するためのパートナーシップを発表した。この取り組みは、長期契約を必要とせずに柔軟で費用対効果の高いインフラストラクチャを提供することで、計算リソースへのアクセスという重要なボトルネックを解決することを目指している。
Together AIは、GPU推論において異なる信頼性ティアを実現するために必要な具体的なアーキテクチャ要件を詳述し、標準的なSLAの数値が実際にカバーされる障害ドメインを隠蔽していることが多いと主張しています。