AIDE^2 实现 AI 研究代理的递归自我改进
研究人员提出了 AIDE^2,该系统通过优化自身代码,为 AI 研究代理实现了递归自我改进的循环。该系统对其内部逻辑提出更改,在 AI 研发任务上对修改后的版本进行基准测试,并仅保留在隐藏评估中表现最佳的改进。
研究人员提出了 AIDE^2,该系统通过优化自身代码,为 AI 研究代理实现了递归自我改进的循环。该系统对其内部逻辑提出更改,在 AI 研发任务上对修改后的版本进行基准测试,并仅保留在隐藏评估中表现最佳的改进。
作者提出了 Growing Harness,这是一种训练范式,它从任务反馈中学习代理的控制结构,而不是依赖标准的、上下文密集的 harness。通过将重复的控制决策转换为可执行代码,并将 LLM 调用保留用于语义推理,该方法旨在创建可复用的专家代理。
研究人员提出了 AIDE^2,该系统通过优化自身代码,为前沿 AI 研究代理实现了递归自我改进的循环。该系统对其内部逻辑提出更改,在 AI 研发任务上对修改后的版本进行基准测试,并仅保留在隐藏评估中表现最佳的更新。
研究人员推出了 Agensh,这是一个可扩展的自组织多代理框架,通过允许并发工作者异步认领子任务并合并进度,消除了中心协调器的瓶颈。
研究人员推出了TelecomGPT-R1,这是一套开源的统一电信推理模型家族,旨在通过对标准、配置和日志进行推理来自动化工程任务。该模型通过涵盖协议、知识、建模和故障四个维度的结构化方法,克服了现有通用和专业大语言模型的局限性。
作者介绍了 Fathom-Vaidya,这是一个拥有 30B 参数的模型,它使用合成数据和基于量表的强化学习来增强诊断和临床医疗保健推理。训练框架首先对来自 MedBullets 的诊断问题应用规则引导的 RL,然后利用具有多维量表的 5.3k 合成多轮场景进行交互式临床任务。
作者介绍了Fathom-Vaidya,这是一个拥有30B参数的模型,它使用合成数据和基于量表的强化学习来增强诊断和临床医疗保健推理。训练框架首先针对使用MedBullets派生问题的诊断准确性,然后通过具有多维量表的5.3k个生成场景解决多轮临床交互。
作者介绍了 Fathom-Vaidya,这是一个拥有 30B 参数的模型,它利用合成数据和基于量表的强化学习来增强诊断和临床医疗保健推理能力。
微软研究院已发布并开源了RetroChimera,这是一个用于逆合成预测的新框架,它结合了两个互补模型以提出高质量的合成路线。该系统将基于Transformer的从头生成模型R-SMILES 2与基于图神经网络(GNN)的NeuralLoc模型相结合,采用一种学习到的集成策略对预测结果进行排序。
作者提出了一种推理系统的设计方案,该系统通过将两个命题分解为更小的组件并搜索逻辑冲突来检测它们之间的矛盾,而不是依赖 LLM 的直接判断。
研究人员介绍了 CodeMidas,这是一种智能体管道,它使用源代码作为唯一输入,从开源代码库中实现的功能构建强化学习环境。 该方法分配智能体计算资源以探索功能、构建基于执行的测试,并通过重复 rollout 验证任务,最终生成涵盖 23 种编程语言的 5,545 个训练任务数据集。 在 GRPO 的帮助下在这些任务上训练 MiMo-V2.5,在五个多样化的基准测试中提升了性能,包括 DeepSWE (+11.7%)、ProgramBench (+17%) 和 Terminal-Bench v2.1 (+8.5%)。 轨迹分析表明,经过 RL 训练的代理表现出更好的行为,例如更深入的代码库探索和更多样化的自我验证。 这些结果确立了源代码作为构建强化学习环境的可扩展基础,能够提升编码智能体在多样化软件任务中的表现。
研究人员推出了TrialAtlas,这是一种记忆增强的多智能体研究组织,旨在协助临床开发规划(CDP)。该系统协调专门用于文献综合、竞争情报和监管分析的智能体,以预测开发风险。
MB-Bidram 发布了一个名为 WideNDepth (WND) 的实验性神经网络架构,旨在将推理能力与知识存储分离。该模型由一个作为内存的“Wide 部分”和一个作为推理器的“Depth 部分”组成。
一位研究者请求一名独立的真人标注员对100个土耳其语叙事场景进行标注,以确定低评分者间一致性是源于任务的解释性本质,还是由于标注定义不明确。研究发现,四个大型语言模型和一个基于规则的检测器彼此之间以及与人类参考标准的一致性大致处于随机水平,Cohen’s κ得分范围在0.000到0.185之间。
独立研究员Mohamed Menasy发布了GlucoEdge,这是一项工程研究,详细阐述了基于连续血糖监测器数据进行五类、15分钟血糖趋势预测的端到端设备端机器学习流水线。该工作引入了一个仅包含2,909个参数的紧凑1D CNN,并涵盖了从PyTorch到LiteRT转换的完整工作流程。
Hugging Face 论坛上的用户提出了一项渐进式知识转移的实验,其中固定大小的学生模型(Qwen 4B)依次从越来越大的教师模型中学习,而不是直接从最大的可用模型中学习。
一位独立研究人员发表了一篇文献综述,分析了量化、剪枝和知识蒸馏等模型压缩技术是否真正降低了实测能耗,还是仅仅减少了 FLOPs。
本文介绍了 Human2Any,这是一种利用约束感知组合规划实现从人到机器人迁移的方法。来源中未提供其他详细信息或正文内容。
OpenAI 发布了 Open-1B,这是一种语言模型,其训练过程中的每一步操作都可以在异构商用硬件上以比特级精度独立复现。这种方法通过为 GPU 内核归约和数据批次排序等不确定性来源施加明确的顺序,解决了开源模型固有的可复现性问题。
Atria Dawn Preview 是一个面向科学研究和工程工作流的基础代理语言模型,通过可验证经验管道进行训练,该管道将工具中介交互与可执行环境相连接。在涵盖真实世界研究、工程和数字工作的16个基准测试中,该模型的表现可与前沿代理相媲美,并在其中五个基准上取得了最高报告分数。