Meta的Muse Spark 1.2和OpenAI的GPT-5.6 Sol更新
Meta宣布其Muse Spark 1.2模型在五场STEM奥林匹克竞赛中获得金牌成绩,并以每测试0.69美元的价格进入Vals指数前五名,据报道比Kimi便宜3倍。Meta将这些成果归因于带有并行推理的多智能体编排,指出在APhO和IPhO中无需外部工具即可获得满分理论成绩。
Meta宣布其Muse Spark 1.2模型在五场STEM奥林匹克竞赛中获得金牌成绩,并以每测试0.69美元的价格进入Vals指数前五名,据报道比Kimi便宜3倍。Meta将这些成果归因于带有并行推理的多智能体编排,指出在APhO和IPhO中无需外部工具即可获得满分理论成绩。
OpenAI发布了其未公开的内部模型Astra的成果,该模型成功解决了十个重要的开放数学问题。这些解答由模型生成,随后由人类研究人员形式化为Lean证书。
AI9Stars发布了G9v3-39A5B,这是一个开权语言模型,旨在提供比其前身ai9stars/G9v3-3B更强的推理能力。该模型具有390亿参数和5个活跃专家,并根据Apache 2.0许可用于个人和商业用途。
约瑟夫·JM·沃克(Joseph JM Walker)撰写的工作论文评估了前沿语言模型在一个嵌入在实体小说《我写了一本书并赚了一百万美元(I.B. Wryten)》中的未见多通道文学密码学基准测试上的表现。研究发现,GPT-5.6 独立识别出次要通信信道,并在首次尝试中恢复了约95%的嵌入内容,而早期模型的有效能力几乎为0%。
OpenAI发布了十个数学和理论计算机科学问题的解决方案,这些问题在至少十年内在其主要结果上没有取得进展,使用的是其下一代主要模型Astra的内部版本。
一项研究表明,前沿语言模型可以利用语义无关的填充令牌执行关键计算,导致推理过程在输出的思维链中不可见的故障模式。该研究评估了三个任务中的13个模型,发现许多模型从这些令牌中获得显著益处,准确率提升高达13个百分点。
作者提出了 PoTRE(Poly-Topological Reasoning Ensembles),这是一个旨在解决标准单流提示在复杂推理任务中局限性的框架。PoTRE 将推理解耦为四个不同的智能体:对抗性精炼智能体、分层战略规划智能体、谱搜索智能体和直接链式智能体。
研究人员提出了等谱优化(Isospectral Optimization, ISO),这是一个针对可验证奖励强化学习(RLVR)的框架,通过在优化输入和输出奇异帧的同时保持模型权重谱固定,解决了缺失的优化层问题。
一位开发者分享了在过去八个月内开发的对话式符号AI架构的进展,旨在解决非神经信息提取中的空白。
该研究推出了 GSM-Plus-BN,这是一个源自英语 GSM-Plus 基准并经人工翻译人员验证的新型扰动孟加拉语数学数据集。该资源旨在解决孟加拉国等语言多样地区缺乏系统性基准来评估模型鲁棒性的问题。
作者提出了Deep Interaction,一种高效的人机交互方法,旨在无需完全重新生成响应即可纠正大语言模型中的推理错误。该机制允许用户直接编辑原始的Chain-of-Thought响应,在保留正确步骤的同时修复错误。
Thinking Machines Lab 发布了 Inkling,这是一种新的多模态混合专家模型,旨在实现高效的 token 推理以及对文本、图像和音频输入的原生理解。Together AI 正在其推理平台上提供该模型,并提供零日访问权限。
研究人员提出了 Ring-Zero,这是一种稳定的训练流水线,可将带有可验证奖励的强化学习扩展到具有一万亿参数的模型,解决了朴素扩展中发现的令牌冗余和可读性差等问题。
研究人员开发了一个新型大规模推理数据集和FukuyamaBench基准,用于评估大型语言模型中的层级机制推理,解决当前化学LLM中常见的物理不一致问题。
一个新的理论框架通过研究一个广义的归纳任务类(统一了上下文n-gram和多跳推理等合成任务)来解释Transformer语言模型中归纳推理能力的涌现。
NVIDIA Nemotron Model Reasoning Challenge 邀请 Kaggle 社区在共享约束(开放模型、基准测试和基础设施)下探索提高推理准确性的技术。比赛结束时,来自 4000 个团队的 5000 多名活跃参与者提交了数千份作品。
研究人员推出了 TreeThink,这是一个开源 Python 库,专为神经网络定理证明中的模块化、完全异步树搜索而设计。它将成熟的搜索方法与基于 vLLM 的推理管道以及多样化的节点评估技术相结合。
作者推出了WILDTRACE,这是一个新的基准测试,旨在评估模型在长文档中整合分散在遥远段落中的证据的能力。与依赖植入事实或逆向工程链条的现有基准测试不同,WILDTRACE使用源自214个自然来源的481项任务,例如技术事故报告文学叙事。
文章认为,语言模型表示中的类内方差并非不完整的神经崩溃,而是由特定定律支配的分配信息存储。对14个模型的分析显示,宏类别结构仅占表示方差的4-12%,而词元内上下文承载了79-91%,在100倍参数范围内保持稳定。
本文认为,构建具备开放式创新能力的更强智能系统,需要创建、稳定并复用新的表示基元,而非仅在固定框架内进行搜索。