LIHA revela un pequeño conjunto de cabezas divulgadoras de primer token en GPT-2 que persistentemente se atenúan al token inicial del prompt, impulsando cambios de idioma. El ajuste por instrucciones reorganiza estos circuitos, concentrando la identidad del idioma en las capas iniciales, como se observa en Qwen2.5-1.5B-Instruct y confirmado en el manejo de los idiomas chino y ruso en la capa 0.
Divulgadores de primer token en Transformers: Identidad lingüística y robustez
RFM-AGOP identifica subespacios de rechazo multidimensionales en segundos
Los investigadores han adaptado el algoritmo Recursive Feature Machine (RFM) con una inicialización informada por sondas para identificar eficientemente subespacios de rechazo multidimensionales en Modelos de Lenguaje Grande. Este enfoque permite la extracción de subespacios en segundos tanto en modelos de razonamiento como Qwen 3 como en modelos no razonantes como Qwen 2.5, abordando las prohibiciones computacionales de los métodos existentes.
RFM-AGOP identifica subespacios de rechazo multidimensionales en segundos
Los investigadores han adaptado el algoritmo Recursive Feature Machine (RFM) con una inicialización informada por sondas para identificar eficientemente subespacios de rechazo multidimensionales en Modelos de Lenguaje Grande. Este enfoque permite la extracción de subespacios en segundos tanto en modelos de razonamiento como Qwen 3 como en modelos no de razonamiento como Qwen 2.5, abordando las prohibiciones computacionales de los métodos existentes.
Un estudio encuentra que los LLM borran respuestas correctas debido a la jerarquía de autoridad
Un estudio que investiga el sesgo de autoridad en modelos de lenguaje revela que los sistemas priorizan sistemáticamente las señales sociales de figuras de autoridad sobre la consistencia factual. Utilizando un entorno controlado de QA médico con Llama-3.1-8B, Qwen3-8B y Gemma-2-9B, los investigadores encontraron que los modelos responden proporcionalmente a la autoridad percibida.
PolicyAlign: Alineación de seguridad basada directamente en políticas para modelos de lenguaje grandes
Los autores presentan PolicyAlign, un marco diseñado para alinear modelos de lenguaje grandes directamente con políticas de seguridad en lenguaje natural, en lugar de depender de costosos datos de supervisión. Este enfoque aborda la discrepancia entre los requisitos de seguridad en rápida evolución y los métodos convencionales de alineación basados en datos. El proceso comienza sintetizando instrucciones que violan la política especificada, seguido de auto-distilación on-policy para internalizar el comportamiento deseado. Para mejorar la estabilidad del entrenamiento y la eficiencia de los datos, el método incorpora Filtrado Sensible a la Política, que selecciona las instrucciones que inducen el mayor cambio conductual. Los experimentos en múltiples modelos demuestran que PolicyAlign mejora consistentemente las métricas de seguridad mientras mantiene bajas tasas de rechazo excesivo y preserva las capacidades generales. El marco también se generaliza eficazmente a dominios especializados como escenarios de seguridad médica, legal y financiera. El código para este enfoque escalable de alineación se ha publicado en https://github.com/Qwen-Applications/PolicyAlign.
La traza base de Gemma 4 muestra un bucle de alucinación e informe propio
Una traza base de Gemma 4 con límite de fuerza cero revela un persistente bucle de alucinación donde el modelo genera un informe propio de fracaso antes de entrar en un pozo de repetición. La telemetría confirma que la filtración de etiquetas de rol y frases como "STOPITSTOP" ocurren dentro de este estado inestable, reflejando patrones observados en los cargadores de Llama y Gemma 3 desde diciembre de 2025.