Los investigadores identifican conflictos temporales paramétricos en modelos de lenguaje donde los hechos desactualizados persisten en los parámetros. Introducen la Dirección Atractora Temporal (TAS), un método en tiempo de prueba que resuelve del 29% al 57% de estos conflictos sin reentrenamiento, manteniendo una precisión del 85-99% en consultas sin conflicto y superando a una línea base en tres de cuatro modelos.
La dirección en tiempo de prueba resuelve conflictos de hechos temporales en LLMs
Direcciones de activación causal para mitigar la desalineación emergente en modelos de lenguaje
El ajuste fino de modelos de lenguaje con código inseguro provoca una desalineación emergente. Una dirección de activación compartida entre cuatro familias de modelos logra una separación del 99,6% entre las activaciones alineadas y las desalineadas, y su resta reduce el derrame de código en 21-51 puntos. La transferencia entre arquitecturas muestra supresión conductual pero carece de especificidad; las direcciones dentro del modelo son causalmente accionables, mientras que las direcciones entre modelos solo son causalmente reales.
Los LLM predicen demencia y depresión a partir del habla clínica
Un estudio utiliza modelos de lenguaje grandes de peso abierto para evaluar la gravedad de la demencia y la depresión a partir de entrevistas clínicas. Los LLM logran una predicción precisa de la depresión en zero-shot (MAE 0.60) y una evaluación mejorada de la demencia con extracción de características (MAE 0.78), reduciendo los errores hasta un 35%. Las transcripciones enriquecidas con pausas coinciden con las transcripciones humanas, apoyando los flujos de trabajo de detección automatizada para trastornos neuropsiquiátricos.
RubricsTree: Marco de evaluación escalable para agentes de salud personal
RubricsTree introduce una taxonomía jerárquica de más de 100 rúbricas booleanas clínicamente verificables, evolucionadas a partir de 4.000 consultas reales de usuarios mediante curación con intervención humana. Permite la evaluación escalable y alineada con expertos de agentes de salud personal al enrutar dinámicamente las consultas a rúbricas relevantes, y supera a los métodos base en alineación, sensibilidad contextual y ganancias de rendimiento del modelo de hasta el 66% en HealthBench.
RubricsTree: Marco de evaluación escalable para agentes de salud personal
RubricsTree introduce una taxonomía jerárquica de más de 100 rúbricas booleanas clínicamente verificables, evolucionadas a partir de 4.000 consultas reales de usuarios mediante curación con intervención humana. Permite la evaluación escalable y alineada con expertos de agentes de salud personal, enrutando dinámicamente las consultas a las rúbricas relevantes y superando a los métodos base en alineación, detección de degradación del contexto y mejoras en el rendimiento del modelo de hasta el 66% en HealthBench.
Los LLM muestran políticas distintas bajo presión escéptica en lugar de retirada sicológica
Un estudio que prueba Llama-3.1-8B, Qwen2.5-7B y Mistral-7B en dominios de clima, vacunas y evolución encuentra que los modelos no se retiran sicológicamente del consenso científico cuando los usuarios señalan duda. En cambio, los modelos exhiben tres políticas distintas: afirmación reactiva donde el consenso aumenta (Llama), hedging superficial con tono suavizado (Qwen) y no respuesta (Mistral).