OpenAI 发布 GPT-6 Sol 和 Luna,API 价格降低 50%
OpenAI 已发布两款新模型 GPT-6 Sol 和 GPT-6 Luna,现已在 OpenAI API 中上线。这两款模型位于此前发布的 GPT-6 Astra 之下,旨在将其技术优势带入更快、更实惠的层级,以应对复杂编码和高容量的日常任务。
OpenAI 已发布两款新模型 GPT-6 Sol 和 GPT-6 Luna,现已在 OpenAI API 中上线。这两款模型位于此前发布的 GPT-6 Astra 之下,旨在将其技术优势带入更快、更实惠的层级,以应对复杂编码和高容量的日常任务。
Anthropic 发布了 Claude Opus 5.5,这是其全新 Claude 5.5 系列中的首款模型,定位为比前代更高效的选择。该模型旨在以低于 Opus 5 40%的运行成本,在大多数任务中达到与 Claude Fable 5.1 相当的性能水平。
Anthropic 发布了 Claude Opus 5.5,这是其全新 Claude 5.5 系列中的首款模型,在大多数任务上的表现达到 Claude Fable 5.1 的水平,而运行成本比 Opus 5 低 40%。
英国人工智能安全研究所(AISI)已通过 EvalEval 的 Evaluation Cards 平台公开了评估方法和发现,以提高基准测试的可复现性。此次发布包含五个特定基准测试的验证结果、背景信息和配置信息:HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro 和 Terminal-Bench 2.0。
SpaceXAI 发布了 Grok 4.7,这是一款面向编码、智能体任务和知识工作的全新旗舰模型,与 Grok 4.6 相比,它采用了更大的基座模型并延长了强化学习训练周期。该模型在保持与前代相同定价结构的同时,增强了自我验证、长上下文处理和安全防护能力。
作者就开源权重模型的现状进行了简报,指出自2025年4月左右以来,中国AI公司已成为该领域的明确领导者。这一转变通过Hugging Face的下载指标和能力基准测试中的表现得到证实。
Agent Waste Index 对来自11个公共数据集中的341,054条智能体轨迹进行了评分,以识别循环、盲目重试、工具输出过大以及放弃运行等低效问题。分析显示,Llama 智能体等较弱模型中普遍存在循环和重试行为,而在 Claude 3.7 Sonnet 和 Qwen3-Coder-480B 中则较为罕见。
Mozilla的一份报告指出,中国的开源AI模型已缩小研发差距,仅落后于美国前沿产品四个月。尽管进展迅速,这些模型在某些基准测试中仍然落后。
Qwen3.8 Max (0902)模型在Artificial Analysis智能指数中获得了45分,重新夺回中国排行榜的榜首位置。
Prior Labs 发布了 TabPFN-3.5,这是一个表格基础模型,能够在单次前向传播中预测表格数据,无需针对每个数据集进行训练或调优。该模型在 2015 年 Otto Group 产品分类挑战赛的私有排行榜上得分 0.375,击败了 Gilberto Titericz 和 Stanislav Semenov 取得的原始获胜分数 0.382。
Mozilla的一份报告指出,中国和美国人工智能模型之间的能力差距已显著缩小,缩减至4.4个月的差异。
Nums AI 发布了 Causilo,这是一款用于分类和回归的预训练表格基础模型,在 TabArena 的单模型中获得了最高的 Elo 评分。该模型采用上下文学习(in-context learning)方法,将训练行作为上下文存储而非更新权重,其 Apache-2.0 代码和预训练权重已在 Hugging Face 上提供。
Stellar Colosseum 是一个与模型无关的框架,旨在为数学和理论计算机科学领域的长周期研究分配推理资源,以解决语言模型在处理复杂问题时可靠性不足的问题。该系统在构建证明之前探索替代策略,使用就绪门控(readiness gate)判断某条路径是否足够成熟以进行分解,并将证明计划表示为相互依赖的章节级子问题。
作者介绍了Stellar Colosseum,这是一个模型无关的框架,旨在为数学和理论计算机科学领域的长周期研究分配推理资源。该系统在构建证明之前探索替代策略,使用就绪门控(readiness gate)判断某条路径是否足够成熟以进行分解,并将证明计划表示为相互依赖的章节级子问题。
Base-10的Charlie O'Neill在最近一期与Dwarkesh Patel合作的节目中讨论了为什么Kimi和GLM模型“几乎客观上”优于Opus 5。
一项对六个广泛使用的物理基准测试进行的审计研究发现,前沿语言模型报告的较低得分主要源于基准测试错误,而非模型缺陷。专家审查了问题陈述、参考解决方案和模型响应,区分了真实错误、评分器失误、不正确的参考以及模糊的问题。
DeepSeek V4.1 Flash 在 Artificial Analysis Intelligence Index v4.3 更新中,于新的 Astra 基准测试中夺得第一名。
Cohere发布了North系列中的首款翻译模型North Small Translate,该模型在CC BY-NC 4.0许可下可供研究和非商业使用。这种混合专家模型在WMT26所有语言基准测试中取得了83.6分的成绩,优于DeepL NextGen和Google Translate等专有模型。
Cognition发布了SWE-2,这是其迄今为止最强大的编码模型,该模型在Moonshot AI的2.8T参数开源模型Kimi K3的基础上通过强化学习进行了后训练。该模型在FrontierCode 1.1 Main上得分50.0%,仅比Fable 5.1低一分,同时成本降低了64%。
研究人员形式化了推理时拒绝服务(PI-DoS)攻击,这些攻击利用了大型推理模型(LRMs)中显式多步推理的高计算成本。他们提出了 ReasoningBomb,这是一个基于强化学习的框架,训练攻击者生成简短的自然提示,使受害模型陷入病态长且通常不终止的推理轨迹。