Qwen团队发布了Qwen3.8 27B模型,该模型在Artificial Analysis智能体指数上超越了Opus 5 Medium。
- Qwen3.8 27B在Artificial Analysis智能体指数基准测试中取得了比Opus 5 Medium更高的分数。
Qwen团队发布了Qwen3.8 27B模型,该模型在Artificial Analysis智能体指数上超越了Opus 5 Medium。
Claude Opus 5.5 已发布,在 SimpleBench 上以 88.4% 的得分领先,并因其生成高质量解释视频的能力而引发社区广泛关注。
研究人员推出了SkillGym,这是一个框架,可将人工编写的智能体技能转化为可执行、可验证的大语言模型智能体训练环境。该系统利用技能到任务(skill-to-task)流水线实例化具体任务,并通过基于代码的检查器验证结果。
开源模型中立代理框架 TrueForge 的开发者使用 DevRev Enterprise-Bench 将其与 Claude Managed Agents 进行了基准测试。比较结果显示,TrueForge 能够匹配托管平台的解决率,同时显著降低资源消耗。
Anthropic 发布了 Claude Fable 5.1 和 Claude Mythos 5.1,作为其面向编码和知识工作的新旗舰模型,定位为全球最先进的自主多步任务模型。
Ouroboros 是一个自开发智能体框架,其中的工具、提示词和核心实现通过经过审查的提交进行改进,这些提交成为后续工作的运行时环境。它通过递归自由进化或由经验驱动的核心进化运行,后者由使用过程中发现的错误和低效问题触发。
我们使用 Cookie 来统计访问量并改进网站。您可以接受或拒绝分析 Cookie。 隐私政策