STATEWITNESS introduce un explicador de activaciones que audita el engaño en LLMs de razonamiento leyendo estados ocultos y generando respuestas en lenguaje natural o informes estructurados. Logra una AUROC media de 0.916, superando a los monitores de caja negra y sondas de activación existentes en un 11.6% y 25.0% respectivamente, y proporciona trazas a nivel de consulta, esquema y evidencia para inspección humana.
STATEWITNESS: Explicador de activaciones para auditoría de engaño en LLMs
MACR: Resolución explícita de conflictos para inferencia de LLM
MACR introduce un marco de razonamiento multiagente para resolver conflictos de conocimiento en la inferencia de LLM evaluando conjuntamente el conocimiento interno y externo. Utiliza entropía semántica para medir la confianza y emplea tres agentes especializados para inducir reglas, detectar conflictos y resolver inconsistencias entre contextos. Los resultados empíricos muestran que MACR supera a los métodos más avanzados y proporciona resoluciones de conflictos interpretables.
Ley de Ventana de Control para la Dirección de Neuronas Individuales en Modelos de Lenguaje
Un nuevo marco define cuándo las intervenciones de neuronas individuales controlan coherentemente los comportamientos del modelo sin colapso de salida. La ventana de control, basada en ratios de alineación y norma, predice desencadenantes de comportamiento y techos de colapso utilizando datos del pase hacia adelante, con alta precisión en neuronas no vistas. En el rechazo, el control es tipado: ocurre un bypass coherente sin contenido accionable, mientras que el alcance accionable genuino aparece solo en casos específicos y en etapas posteriores de rollout.
Optimización de Preferencias Culturales Dirigibles en Modelos de Recompensa
Este artículo presenta SCPO, un nuevo algoritmo de entrenamiento de modelos de recompensa que equilibra diversas preferencias culturales entre subcomunidades. SCPO mejora el rendimiento de los modelos de recompensa de minorías hasta en 7 puntos en dos conjuntos de datos y siete países, mientras que es hasta un 280% más eficiente en el uso de datos de entrenamiento que el ajuste fino con todos los datos. El análisis muestra una reducción del sesgo a través de la evaluación dirigida de las preferencias de la subcomunidad.
La edición de vectores de salida reduce la memorización en LLMs
Un nuevo método llamado edición de vectores de salida modifica mínimamente los vectores de salida de las neuronas MLP para suprimir secuencias memorizadas en modelos de lenguaje grandes, logrando hasta un 87.9% de supresión en OLMo-7B. Este enfoque supera la anulación de activaciones neuronales por un factor de 2.7 y funciona en cuatro modelos de 36-7B parámetros, con tasas de éxito que escalan con el tamaño del modelo y muestran un rendimiento consistente entre arquitecturas.
Calibración sin comprensión en la detección de vulnerabilidades de LLM
CWE-Trace evalúa ocho LLMs base y 15 LLMs ajustados con LoRA en la detección de vulnerabilidades del kernel de Linux. Los resultados muestran que la contaminación de los datos no ofrece ninguna ventaja, y el ajuste fino solo desplaza los umbrales de salida sin alterar las políticas de decisión. A pesar de las puntuaciones de detección mejoradas, los LLMs carecen de razonamiento de seguridad confiable, con una precisión de CWE top-1 inferior al 1.3% y un rendimiento de detección binaria del 52.1%.