Trase在Hugging Face的GAIA基准测试中夺得第一名,该测试衡量现实世界AI代理的能力,包括推理和工具使用,超越了Meta、Microsoft等机构的提交结果。

  • Trase在450多道题目的基准测试中取得了35.55%的整体成功率。
  • 该系统通过STaR(Self-Taught Reasoner)利用类似人类的操作轨迹进行微调,实现迭代式自我改进。
  • 它使用代码增强基础LLM的操作,将多个工具调用组合成单个代码操作。
  • 顶层代理执行自我批评,以确定在切换工具或调用专用代理之前是否已收集到足够的信息。

文章指出,90% proficiency被视为在复杂任务中替代人类的门槛,这也是Trase旨在达到的目标。