OpenAI的Astra解决了10个重大开放数学问题
OpenAI发布了其未公开的内部模型Astra的成果,该模型成功解决了十个重要的开放数学问题。这些解答由模型生成,随后由人类研究人员形式化为Lean证书。
OpenAI发布了其未公开的内部模型Astra的成果,该模型成功解决了十个重要的开放数学问题。这些解答由模型生成,随后由人类研究人员形式化为Lean证书。
OpenAI发布了十个数学和理论计算机科学问题的解决方案,这些问题在至少十年内在其主要结果上没有取得进展,使用的是其下一代主要模型Astra的内部版本。
一篇论文表明,Anthropic、OpenAI和Google返回的加密思维链块可以被提取为明文。作者利用了一个漏洞:同一系列内的模型共享加密密钥,从而允许他们将推理轨迹重放至较弱的子模型中。
一篇新论文表明,来自 Claude、GPT 和 Gemini 等前沿模型的加密推理块可以被解码并重放,以提取隐藏的思维链数据。作者展示了如何将这些签名数据块传输给较弱的模型或不同的会话,从而转录底层思维,有效地绕过了提供商的混淆措施。
研究人员发现,主要的大语言模型提供商在处理逐步推理轨迹方面存在漏洞,这些轨迹以加密块的形式返回供客户端使用。他们发现,这些加密块在同一提供商生态系统内的不同会话、用户和模型之间完全兼容且可互换。
研究人员发现,主要的大语言模型提供商在处理逐步推理轨迹时存在架构漏洞。提供商将这些轨迹作为加密块返回给客户端,但研究发现这些块在提供商生态系统内的不同会话、用户和模型之间完全兼容且可互换。
Meta宣布其Muse Spark 1.2模型在五场STEM奥林匹克竞赛中获得金牌成绩,并以每测试0.69美元的价格进入Vals指数前五名,据报道比Kimi便宜3倍。Meta将这些成果归因于带有并行推理的多智能体编排,指出在APhO和IPhO中无需外部工具即可获得满分理论成绩。
AI9Stars发布了G9v3-39A5B,这是一个开权语言模型,旨在提供比其前身ai9stars/G9v3-3B更强的推理能力。该模型具有390亿参数和5个活跃专家,并根据Apache 2.0许可用于个人和商业用途。
约瑟夫·JM·沃克(Joseph JM Walker)撰写的工作论文评估了前沿语言模型在一个嵌入在实体小说《我写了一本书并赚了一百万美元(I.B. Wryten)》中的未见多通道文学密码学基准测试上的表现。研究发现,GPT-5.6 独立识别出次要通信信道,并在首次尝试中恢复了约95%的嵌入内容,而早期模型的有效能力几乎为0%。
一项研究表明,前沿语言模型可以利用语义无关的填充令牌执行关键计算,导致推理过程在输出的思维链中不可见的故障模式。该研究评估了三个任务中的13个模型,发现许多模型从这些令牌中获得显著益处,准确率提升高达13个百分点。
作者提出了 PoTRE(Poly-Topological Reasoning Ensembles),这是一个旨在解决标准单流提示在复杂推理任务中局限性的框架。PoTRE 将推理解耦为四个不同的智能体:对抗性精炼智能体、分层战略规划智能体、谱搜索智能体和直接链式智能体。
研究人员提出了等谱优化(Isospectral Optimization, ISO),这是一个针对可验证奖励强化学习(RLVR)的框架,通过在优化输入和输出奇异帧的同时保持模型权重谱固定,解决了缺失的优化层问题。
一位开发者分享了在过去八个月内开发的对话式符号AI架构的进展,旨在解决非神经信息提取中的空白。