AWS Strands Agentsチームは、PythonおよびTypeScript向けにApache 2.0ライセンスで提供されるオープンソースの汎用エージェントハーネスであるStrands Harnessをリリースしました。このツールは、Claude CodeやCodexのような環境でエージェントのプロトタイピングを行うことと、カスタムループでのデプロイメントの間のギャップを埋めるために設計されています。

  • 6つのベンチマーク(ALFWorld、GAIA、Terminal-Bench 2.1を含む)において、競合するハーネスと比較してトークンコストが28%低く抑えられ、同等の精度を維持しています。
  • ツールの結果が1,500トークンを超過した場合に切り捨て、コンテキスト使用量が85%に達した際に要約をトリガーし、ループ内でのリカバリを処理する、組み込みのコンテキスト管理ルールを備えています。
  • Terminal-Bench 2.1でClaude Fable 5を使用したベンチマークでは、Strands Harnessは69.7の精度で$56.29のコストでしたが、Claude Code($248.05、61.8の精度)と比較して大幅に低コストでありながらスコアでも上回りました。
  • Amazon Bedrock、Anthropic、OpenAI、Google、Ollama、LiteLLMを介して現在の推論モデルで実行をサポートしており、シェル、ファイル、ウェブツールが標準で含まれています。

今回のリリースは、パフォーマンスを犠牲にすることなく効率的なコンテキスト処理を通じて運用コストを削減する、デプロイ可能な汎用エージェントフレームワークを開発者に提供することを目的としています。