El control de coordinación a nivel de procesos aporta valor únicamente cuando el consenso mayoritario inicial es poco fiable, la tarea es recuperable y la interacción no guiada falla en reparar errores. A través de múltiples modelos y tareas, ningún estilo de liderazgo supera a los demás en precisión, lo que se alinea con la teoría contingente en lugar de sugerir un fallo del enfoque.
Liderazgo como control de coordinación en equipos de LLM multiagente
Liderazgo como control de coordinación en equipos de LLM multiagente
Un estudio encuentra que los estilos de liderazgo en equipos de LLM multiagente solo mejoran el rendimiento cuando el consenso inicial es poco fiable, recuperable y no autocorregido por interacción no dirigida. El control de coordinación a nivel de proceso añade valor solo bajo condiciones específicas predichas por la ciencia de equipos, sin que un único estilo de liderazgo supere a los demás en precisión entre tareas y modelos.
MACR: Resolución explícita de conflictos para inferencia de LLM
MACR introduce un marco de razonamiento multiagente para resolver conflictos de conocimiento en la inferencia de LLM evaluando conjuntamente el conocimiento interno y externo. Utiliza entropía semántica para medir la confianza y emplea tres agentes especializados para inducir reglas, detectar conflictos y resolver inconsistencias entre contextos. Los resultados empíricos muestran que MACR supera a los métodos más avanzados y proporciona resoluciones de conflictos interpretables.
VIMPO: Optimización de política sin crítico para LLMs
VIMPO introduce un método de optimización de política sin crítico que deriva una función de valor implícita por la política a partir del aprendizaje por refuerzo con regularización KL. Permite la incorporación de recompensas verificables sin entrenar un crítico y supera a GRPO en benchmarks matemáticos, especialmente bajo recompensas ruidosas.
Control jerárquico basado en LLM en juegos multiagente
Un sistema jerárquico que utiliza un LLM preentrenado para seleccionar políticas de habilidades de RL supera al RL plano en un entorno King of the Hill 2v2. Igualua el rendimiento de los árboles de comportamiento diseñados a mano en tasa de victoria y es percibido como más humano por el 60% de los usuarios, destacando una coordinación efectiva y adaptabilidad sin diseño manual de reglas.
Aprendizaje de currículo bayesiano en variedades latentes de LLM
Manifold Bandits introduce el Currículo de Variedad Bayesiana (BMC), un marco que modela el muestreo de problemas como un problema estructurado de bandits en el espacio latente de los LLM. BMC organiza las tareas en un árbol jerárquico y utiliza aprendizaje bayesiano para guiar el muestreo, revelando compensaciones entre la señal de aprendizaje, la diversidad de tareas y la relevancia de la evaluación. Priorizar únicamente la dificultad no logra un buen rendimiento en tareas posteriores, subrayando la necesidad de estructura y muestreo consciente del tipo.