Уровневое координационное управление приносит ценность только тогда, когда начальное большинство согласия неустойчиво, задача восстанавливаема и непод руководством взаимодействие не может исправить ошибки. При проведении экспериментов по различным моделям и задачам, ни один стиль ведения не превосходит других по точности, что соответствует теории контингентности, а не указывает на неудачу подхода.
Ведение как координационное управление в мультиагентных командах на основе LLM
Ведение как координационный контроль в многоагентных командах на основе LLM
Исследование показало, что стили ведения в многоагентных командах на основе LLM улучшают производительность только тогда, когда начальное согласие нестабильно, восстанавливаемо и не корректируется самопроизвольными взаимодействиями. Координационный контроль на уровне процесса приносит ценность только при определённых условиях, предсказанных теорией команд, и не существует одного стиля ведения, который бы превосходил другие по точности при выполнении различных задач и моделей.
MACR: Явное разрешение конфликтов в инференсе LLM
MACR представляет многоагентную систему рассуждений для разрешения конфликтов знаний в инференсе LLM путем совместной оценки внутренних и внешних знаний. Используя семантическую энтропию для измерения уверенности, MACR применяет три специализированных агента для индукции правил, обнаружения конфликтов и разрешения несоответствий между контекстами. Эмпирические результаты показывают, что MACR превосходит методы, являющиеся самыми передовыми, и обеспечивает интерпретируемые решения конфликтов.
VIMPO: критерий-бесплатная оптимизация политики для больших языковых моделей
VIMPO представляет метод критерий-бесплатной оптимизации политики, который получает функцию значений, имплицированную политикой, из обучения по репликации с регуляризацией КЛ. Он позволяет интегрировать вознаграждение с верификацией без обучения критерия и превосходит GRPO на математических тестах, особенно при шумных вознаграждениях.
Контроль на основе LLM в многоконтролируемых играх
Характеристика иерархической системы, использующей предобученный LLM для выбора политик RL-навыков, превосходит плоскую RL в среде 2v2 King of the Hill. Она соответствует показателю эффективности, достигнутому при ручной разработке дерева поведения, и воспринимается как более человеческая на 60% пользователей, что подчеркивает эффективную координацию и адаптивность без ручного проектирования правил.
Байесовское куррикулярное обучение на латентных многообразиях ЛЛМ
Manifold Bandits вводит Байесовское куррикулярное многообразие (BMC), рамку, которая моделирует выбор задач как структурированную задачу в латентном пространстве ЛЛМ. BMC организует задачи в иерархическое дерево и использует байесовское обучение для направления выбора, раскрывая компромиссы между сигналом обучения, разнообразием задач и релевантностью оценки. Простое приоритизация сложности не приводит к сильной производительности на последующих задачах, что подчеркивает необходимость структуры и выбора, учитывающего тип задачи.