Un nuevo conjunto de datos, IFLLM, recopila trayectorias del ratón y datos de fijación ocular de usuarios que interactúan con LLMs. Muestra que la retroalimentación implícita mejora significativamente la alineación de LLMs, aumentando la precisión del modelo de recompensa basado en texto del 55% al 64% y casi triplicando las mejoras en la calidad de respuesta después del entrenamiento DPO en ocho LLMs.
Alineación de LLM usando retroalimentación implícita del usuario
Alineación de LLM mediante Retroalimentación Implícita del Usuario
Un nuevo conjunto de datos, IFLLM, recopila trayectorias del ratón y datos de fijación ocular de usuarios que interactúan con LLMs. Muestra que la retroalimentación implícita mejora significativamente la alineación de LLMs, aumentando la precisión del modelo de recompensa basado en texto del 55% al 64% y casi triplicando las mejoras en la calidad de respuesta después del entrenamiento DPO en ocho LLMs.
MACR: Resolución explícita de conflictos para inferencia de LLM
MACR introduce un marco de razonamiento multiagente para resolver conflictos de conocimiento en la inferencia de LLM evaluando conjuntamente el conocimiento interno y externo. Utiliza entropía semántica para medir la confianza y emplea tres agentes especializados para inducir reglas, detectar conflictos y resolver inconsistencias entre contextos. Los resultados empíricos muestran que MACR supera a los métodos más avanzados y proporciona resoluciones de conflictos interpretables.
Ley de Ventana de Control para la Dirección de Neuronas Individuales en Modelos de Lenguaje
Un nuevo marco define cuándo las intervenciones de neuronas individuales controlan coherentemente los comportamientos del modelo sin colapso de salida. La ventana de control, basada en ratios de alineación y norma, predice desencadenantes de comportamiento y techos de colapso utilizando datos del pase hacia adelante, con alta precisión en neuronas no vistas. En el rechazo, el control es tipado: ocurre un bypass coherente sin contenido accionable, mientras que el alcance accionable genuino aparece solo en casos específicos y en etapas posteriores de rollout.
Optimización de Preferencias Culturales Dirigibles en Modelos de Recompensa
Este artículo presenta SCPO, un nuevo algoritmo de entrenamiento de modelos de recompensa que equilibra diversas preferencias culturales entre subcomunidades. SCPO mejora el rendimiento de los modelos de recompensa de minorías hasta en 7 puntos en dos conjuntos de datos y siete países, mientras que es hasta un 280% más eficiente en el uso de datos de entrenamiento que el ajuste fino con todos los datos. El análisis muestra una reducción del sesgo a través de la evaluación dirigida de las preferencias de la subcomunidad.
Alineación fallida en LLMs: Un estudio cuantitativo
Un nuevo estudio presenta VETO, un conjunto de datos de 2.032 pares contrastivos derivados de BBQ, para cuantificar la alineación fallida en modelos de lenguaje grandes. Define la Tasa de Alineación Fallida (MAR) y encuentra que todos los LLMs evaluados exhiben MARs entre 4.7% y 18.9%, mientras que los participantes humanos logran 0%. La investigación muestra que las señales de alineación pueden amplificar estos fallos, con supresión de evidencia que ocurre en las capas tardías de los modelos y emerge después del entrenamiento por instrucciones.