Faraday 27B 在论文复现任务上超越 Claude Opus 4.8 和 GPT-5.5
研究人员开发了 Replica,一个用于论文复现的可扩展任务空间,并引入了自动生成的基于量表的评估者,以提供与人类评估一致的低噪声奖励信号。
研究人员开发了 Replica,一个用于论文复现的可扩展任务空间,并引入了自动生成的基于量表的评估者,以提供与人类评估一致的低噪声奖励信号。
本文介绍了 AutoDesign,这是一个框架,采用元优化器引导代码代理根据 rollout 反馈递归地改进其 harness。该方法旨在与人类设计先验对齐,并积累可重用的经验以实现递归自我改进。
研究人员提出SCOUT,一种结合结构化思维链与多目标过程奖励强化学习的框架,以增强视觉-语言模型的空间推理能力。该方法解决了现有强化学习方法中的信用分配问题,并整合了深度感知以实现全面的3D理解。
专为中低收入环境设计的检索增强生成系统 VITA,在 HealthBench 基准测试中与通用大型语言模型进行了对比评估。研究表明,即使随着更新的前沿模型发布,针对语料库的特定设计仍能保持具有竞争力的性能。
研究人员开发了 MiLMMT-46-v1.0,这是一种多语言机器翻译模型,将无参考后训练应用于开源大语言模型。该团队使用基于两种无参考质量评估模型的奖励(由语言识别门控)的组相对策略优化 (GRPO)。
本文介绍了开放式优化(OEO),这是一种框架,允许前沿模型优化器在线动态组合其改进流程,而非依赖预设的优化流水线。作者将OEO与两种分阶段方法SkillOpt和GEPA进行了比较,在八个基准-目标-模型设置下进行了14次直接对比。
研究人员展示了首个基于 AMIE (Video)(一种基于 Gemini 的多智能体系统)的实时临床视频会诊专家级 AI 系统,该系统将低延迟对话与实时视听感知相结合。在一项涉及 30 名初级保健医生和 100 个场景的随机客观结构化临床检查(OSCE)研究中,临床评估者认为该系统在病史采集、诊断、管理和体格检查方面与医生相当或优于医生。
研究人员发现,主要的大语言模型提供商在处理逐步推理轨迹时存在架构漏洞。提供商将这些轨迹作为加密块返回给客户端,但研究发现这些块在提供商生态系统内的不同会话、用户和模型之间完全兼容且可互换。
Ouroboros 是一个自开发智能体框架,其中的工具、提示词和核心实现通过经过审查的提交进行改进,这些提交成为后续工作的运行时环境。它通过递归自由进化或由经验驱动的核心进化运行,后者由使用过程中发现的错误和低效问题触发。
深信服已部署SESG(Self-Evolving Safety Guardrails,自进化安全护栏),这是一个多智能体系统,能够持续将大语言模型的安全防御能力适应于生产环境中的新威胁。该系统实时监控流量以检测新型越狱攻击和有害类别,随后自动合成训练数据并更新模型,无需人工干预。
一项研究表明,GPT-5和GPT-5 Nano在提取证据和批判性评估微生物致癌研究出版物方面达到了专家级水平。研究人员使用包含24篇聚焦于MMTV-LV和乳腺癌的论文的数据集,将这些模型与Gemini 2.5 Pro和Gemini 2.5 Flash以及领域专家进行了基准测试。
研究人员提出了 Argus,这是一种持久且自我演进的代理运行时系统,专为长程推理设计,能够将稳定的用户意图与操作目标分离。该系统利用管理器、规划器、工程师和审查者角色,在持久的项目状态上执行有界任务,允许在操作员拥有的升级点之间进行自主执行。
作者指出,SciCode 基准上分数停滞的原因在于评估工具存在重大缺陷,而非模型能力的局限。对 65 个测试问题的领域专家审计发现了 263 个缺陷,其中 192 个因不可复现的标准答案和过紧的容差等问题导致正确解法被错误拒绝。
研究人员推出了 Video-DeepResearch (Video-DR),这是一个将 multimodal agent 从静态图像扩展到连续视频流的框架,旨在解决模态偏差和参数知识泄漏问题。该系统采用解耦的感知-探索流水线,并通过分阶段解锁工具,在网页检索之前强制实现跨帧视觉定位。
Qwen团队发布了Qwen-UI-Agent的技术报告,这是一款以现实世界为中心的GUI基础智能体,旨在在移动端、计算机使用、网页和DeepSearch环境中可靠运行。该系统将多样化的沙盒环境与大规模真实设备移动运行时环境相结合,交错执行GUI操作与CLI命令,并支持长周期任务。
研究人员推出了 ClinFusion,这是一种以视觉为核心的多模态大语言模型,旨在通过统一 2D 和 3D 医学图像理解来解决将 AI 部署到临床实践中的挑战。该系统采用组合式级联视觉编码器,包含 Cascade Spatial-Aware Locality Fusion 算子,并引入了一个由 MedIF-Bench 和基于感兴趣区域(region-of-interest)的指标组成的新评估框架。
本文记录了一类前沿大型语言模型中的故障,称为异常链崩溃(exception chain collapse),其中模型错误地评估嵌套条件规则。为解决此问题,作者提出了 Aethis Eligibility Module,这是一种神经符号架构,将 LLM 编写的规则与基于 SMT 的层相结合,以实现确定性执行。
OpenForgeRL 是一个开源框架,允许研究人员使用标准的强化学习堆栈对基于工具链的 AI 智能体进行端到端训练。它通过一个轻量级代理将训练与推理解耦,该代理将模型调用记录为数据,并由 Kubernetes 编排器管理远程容器部署。
研究人员推出了 AREX,这是一个递归自我改进(RSI)深度研究智能体家族,旨在解决复杂查询中发现与验证之间的不对称问题。AREX 在内循环(收集证据并构建临时答案)和外循环(审计约束以指导针对性优化)之间交替运行。
SLAI 推出 T-Rex,这是一个端到端优化框架,用于在 Ascend NPU SuperPOD 上对万亿参数规模的 MoE 模型进行全参数后训练。以 DeepSeek-V4 模型家族为目标工作负载,该系统通过分层并行和内核执行优化来解决内存压力和通信开销问题。