DeepSeek-V4 Flash 0731 与 GPT-5.6 Luna 在 DeepSWE 上的对比:成本与编码
在 DeepSWE 基准测试中对 DeepSeek-V4 Flash 0731 和 GPT-5.6 Luna 进行的比较显示,虽然 GPT-5.6 Luna 是更强的工程师模型,但结合使用这两种模型的级联策略能以更低的成本实现更高的准确率。
在 DeepSWE 基准测试中对 DeepSeek-V4 Flash 0731 和 GPT-5.6 Luna 进行的比较显示,虽然 GPT-5.6 Luna 是更强的工程师模型,但结合使用这两种模型的级联策略能以更低的成本实现更高的准确率。
Moonshot AI发布了Kimi K3,这是一个拥有2.8万亿参数的开源权重模型,专为长周期编码和深度推理设计。它是世界上首个达到3万亿参数级别的开源模型,支持100万token的上下文窗口。
Together AI 宣布与 Moonshot AI 达成战略合作,作为 Moonshot 开源权重模型的发布平台,首批推出 Kimi K3。此次合作通过 Together AI 位于美国的托管基础设施和工具,让开发者能够第一时间获取前沿模型。
在DeepSWE基准测试中对Kimi K3和GPT-5.6 Sol进行比较显示,尽管GPT-5.6 Sol在单次尝试质量方面领先(72.7% vs 68.5%),但Kimi K3以显著更低的成本实现了更高的pass@k分数(k > 1)。
月之暗面(Moonshot AI)推出的开源权重模型Kimi K3在DeepSWE基准测试中取得了与Anthropic的Claude Fable 5相当的性能,同时每项任务的成本显著更低。在2026年7月16日的一次评估中,Kimi K3的pass@1达到68.5%,略低于Fable 5的69.9%,但在多次尝试场景中表现更优,并提供了更高的成本效益。
Together AI 已在其专用模型推理平台中添加了自动扩缩容功能,允许部署根据推理引擎可理解的指标(如进行中请求、首字延迟(TTFT)和 GPU 利用率)进行扩缩容。
ThunderAgent 是一个引入程序抽象以进行智能体 LLM 请求调度的系统,旨在解决高并发合成数据生成中的 KV 缓存抖动问题。通过将智能体工作流视为可调度程序而非独立请求,它显著提高了吞吐量并降低了延迟。
Together AI 详细介绍了其专用模型推理平台的架构,该平台通过基于容量感知的流量分割将端点、部署和不可变配置连接起来。该系统根据有效容量(权重乘以就绪副本数)而非固定百分比来路由请求,从而支持零停机发布和 A/B 测试等功能。
Together 已对其推理平台发布重大更新,推出“专用模型推理”功能,旨在让用户完全掌控开源权重模型的性能、成本和质量。此次更新还宣布了自定义训练能力的封闭公测,包括全参数和 LoRA 强化学习。
Together AI 与 Y Combinator 宣布合作,为 Y Combinator 旗下 AI 原生初创企业提供首个专属 GPU 集群。该举措旨在通过提供灵活且具成本效益的训练与推理基础设施,解决计算资源获取的关键瓶颈,且无需长期承诺。