Инженер описывает архитектуру и режимы сбоев, с которыми он столкнулся при переходе проектов от простых чат-ботов к надежным агентным системам, способным планировать, использовать инструменты и выполнять многошаговые задачи.
- Цикл агента состоит из ядра рассуждений (LLM), строгого слоя интерфейса инструментов, детерминированного планирования через конечные автоматы и различных типов памяти для контекста, эпизодических данных и долгосрочного состояния.
- Интерфейсы инструментов требуют строгих схем, проверки входных данных, таймаутов и структурированных форматов ошибок с флагами повторной попытки, чтобы предотвратить бесконечные циклы, вызванные необработанными стеками вызовов.
- Оценка должна фокусироваться на надежности траектории, а не на метриках однократного взаимодействия; задача с надежностью 90% на каждом шаге из пяти приводит лишь к ~59% успеха в конце цепочки.
- Эффективные продакшн-агенты опираются на детерминированные защитные механизмы, полную инструментализацию вызовов модели и контрольные точки с участием человека для необратимых действий, а не только на промпт-инжиниринг.
Автор подчеркивает, что надежное развертывание агентов зависит от строгих слоев валидации, структурированной обработки ошибок и реалистичной многошаговой оценки для управления накопляющимися ошибками, присущими связанным операциям.