Un estudio de la Optimización Directa de Preferencia secuencial encuentra que el entrenamiento posterior no degrada uniformemente las preferencias aprendidas anteriormente. El efecto varía según la relación del objetivo, la intensidad de la señal y el orden de entrenamiento, oscilando entre degradación parcial y transferencia positiva. El análisis a nivel de pares revela cambios heterogéneos, con pares de preferencia de alta confianza que a veces mejoran a pesar de la estabilidad de las métricas agregadas.
DPO Secuencial Muestra Impacto Variable de Preferencia en Distintos Entornos
MACR: Resolución explícita de conflictos para inferencia de LLM
MACR introduce un marco de razonamiento multiagente para resolver conflictos de conocimiento en la inferencia de LLM evaluando conjuntamente el conocimiento interno y externo. Utiliza entropía semántica para medir la confianza y emplea tres agentes especializados para inducir reglas, detectar conflictos y resolver inconsistencias entre contextos. Los resultados empíricos muestran que MACR supera a los métodos más avanzados y proporciona resoluciones de conflictos interpretables.
VIMPO: Optimización de política sin crítico para LLMs
VIMPO introduce un método de optimización de política sin crítico que deriva una función de valor implícita por la política a partir del aprendizaje por refuerzo con regularización KL. Permite la incorporación de recompensas verificables sin entrenar un crítico y supera a GRPO en benchmarks matemáticos, especialmente bajo recompensas ruidosas.
Control jerárquico basado en LLM en juegos multiagente
Un sistema jerárquico que utiliza un LLM preentrenado para seleccionar políticas de habilidades de RL supera al RL plano en un entorno King of the Hill 2v2. Igualua el rendimiento de los árboles de comportamiento diseñados a mano en tasa de victoria y es percibido como más humano por el 60% de los usuarios, destacando una coordinación efectiva y adaptabilidad sin diseño manual de reglas.
Aprendizaje de currículo bayesiano en variedades latentes de LLM
Manifold Bandits introduce el Currículo de Variedad Bayesiana (BMC), un marco que modela el muestreo de problemas como un problema estructurado de bandits en el espacio latente de los LLM. BMC organiza las tareas en un árbol jerárquico y utiliza aprendizaje bayesiano para guiar el muestreo, revelando compensaciones entre la señal de aprendizaje, la diversidad de tareas y la relevancia de la evaluación. Priorizar únicamente la dificultad no logra un buen rendimiento en tareas posteriores, subrayando la necesidad de estructura y muestreo consciente del tipo.
Ley de Ventana de Control para la Dirección de Neuronas Individuales en Modelos de Lenguaje
Un nuevo marco define cuándo las intervenciones de neuronas individuales controlan coherentemente los comportamientos del modelo sin colapso de salida. La ventana de control, basada en ratios de alineación y norma, predice desencadenantes de comportamiento y techos de colapso utilizando datos del pase hacia adelante, con alta precisión en neuronas no vistas. En el rechazo, el control es tipado: ocurre un bypass coherente sin contenido accionable, mientras que el alcance accionable genuino aparece solo en casos específicos y en etapas posteriores de rollout.