Atria Dawn Preview は、科学的研究およびエンジニアリングワークフローのために設計された基盤エージェント型言語モデルであり、ツールを介した相互作用を実行可能環境に接続する検証可能な経験パイプラインを通じてトレーニングされています。現実の研究、エンジニアリング、デジタル作業にわたる16のベンチマークにおいて、このモデルは最先端のエージェントと競争力があり、そのうち5つで最高の報告スコアを達成しています。

  • トレーニングパイプラインは、ツールを介した相互作用を実行可能環境および外部検証された結果に接続します。
  • 56人の参加者からの769件のタスクレコードの分析により、完了したAI支援タスクの約3分の1がAIなしでは実行不可能であると評価されました。

エージェントは頻繁に手法を提案し改訂を実装しますが、人間は最終的な意思決定の大部分を保持し、判断とフィードバックを通じて探求を導きます。

著者らはこれを重要視しており、これはタスクレベルの実行からプロジェクトレベルのパートナーシップへの移行を示唆しているためです。ここで人間の努力は、何を追求する価値があるか、そして証拠がどのように研究を導くべきかに集中します。