ORBIT permite el control simultáneo y sin entrenamiento de múltiples atributos conductuales mediante la rotación de subespacios ortogonales. Logra una dirección equilibrada y coherente entre atributos sin necesidad de reentrenamiento, superando a las líneas base existentes en los benchmarks TraitFactory y ToneBank.
ORBIT: Dirección de comportamiento multiatributo sin entrenamiento
El marco P4IR mejora la precisión del cumplimiento de código basado en LLM
P4IR, un marco de dos etapas, utiliza ajuste fino supervisado y Optimización de Política Relativa de Grupo para mejorar los sistemas automatizados de cumplimiento de código basados en modelos de lenguaje grandes. Reduce las distancias de Levenshtein a nivel de árbol y de token hasta en un 23,8% y un 38,6% respectivamente, superando a LLMs líderes como Claude Opus, GPT-5.2 y GLM-4.7 en configuraciones de zero-shot con prompting few-shot, y reduce los falsos positivos por un margen estadísticamente significativo.
La dirección en tiempo de prueba resuelve conflictos de hechos temporales en LLMs
Los investigadores identifican conflictos temporales paramétricos en modelos de lenguaje donde los hechos desactualizados persisten en los parámetros. Introducen la Dirección Atractora Temporal (TAS), un método en tiempo de prueba que resuelve del 29% al 57% de estos conflictos sin reentrenamiento, manteniendo una precisión del 85-99% en consultas sin conflicto y superando a una línea base en tres de cuatro modelos.
Direcciones de activación causal para mitigar la desalineación emergente en modelos de lenguaje
El ajuste fino de modelos de lenguaje con código inseguro provoca una desalineación emergente. Una dirección de activación compartida entre cuatro familias de modelos logra una separación del 99,6% entre las activaciones alineadas y las desalineadas, y su resta reduce el derrame de código en 21-51 puntos. La transferencia entre arquitecturas muestra supresión conductual pero carece de especificidad; las direcciones dentro del modelo son causalmente accionables, mientras que las direcciones entre modelos solo son causalmente reales.
Ingeniería inversa de la atención del Transformer con programas ejecutables
Un nuevo método utiliza síntesis de programas para generar programas en Python que reproducen los patrones de atención en modelos Transformer. Menos de 1,000 de estos programas logran una similitud de intersección sobre unión superior al 75% en TinyStories, y reemplazar el 25% de las cabezas de atención con estos programas aumenta la perplexidad solo un 16% mientras preserva el rendimiento en tareas de respuesta a preguntas.
Los LLM muestran políticas distintas bajo presión escéptica en lugar de retirada sicológica
Un estudio que prueba Llama-3.1-8B, Qwen2.5-7B y Mistral-7B en dominios de clima, vacunas y evolución encuentra que los modelos no se retiran sicológicamente del consenso científico cuando los usuarios señalan duda. En cambio, los modelos exhiben tres políticas distintas: afirmación reactiva donde el consenso aumenta (Llama), hedging superficial con tono suavizado (Qwen) y no respuesta (Mistral).