CircuitLasso permite el aprendizaje de circuitos escalable en modelos de lenguaje grandes mediante el uso de regresión lineal dispersa. Recupera circuitos con precisión estructural comparable a los métodos más avanzados, pero con un costo computacional significativamente menor, y demuestra una propagación semántica interpretable por humanos a través de los componentes del modelo. Los circuitos aprendidos logran un rendimiento comparable en una tarea de generalización de dominio con un costo reducido.
CircuitLasso: Aprendizaje de circuitos escalable para la interpretabilidad de LLM
CircuitLasso: Aprendizaje de circuitos escalable para la interpretabilidad de LLM
CircuitLasso propone un método escalable para aprender circuitos dispersos en modelos de lenguaje grandes utilizando regresión lineal dispersa. Logra una precisión estructural comparable a los métodos basados en intervención de última generación con un costo computacional significativamente menor, mientras permite el descubrimiento eficiente de la propagación de características semánticas y mejora el rendimiento en tareas de generalización de dominio con un costo reducido.
H-RePlan: Recuperación jerárquica para sistemas de agentes multi-dispositivo
H-RePlan introduce un marco de replanificación jerárquica que separa la recuperación de estrategias locales del dispositivo de la replanificación global del orquestador. Supera a las líneas base existentes al lograr una mayor tasa de finalización y adherencia a las instrucciones, con menor costo en tokens, mediante una recuperación consciente del alcance en sistemas de agentes multi-dispositivo.
Fusión global aprendible para tokenización de longitud variable en Transformers de difusión
Un nuevo tokenizador de longitud variable utiliza fusión global aprendible para permitir la alineación de representaciones entre longitudes en modelos de difusión. Este enfoque independiente de los datos supera la semántica dependiente de la posición y mejora el equilibrio entre calidad y costo computacional en la generación de ImageNet 256×256 en comparación con métodos anteriores.
Evolución oculta del contexto visual disfrazado en VLMs
Los tokens visuales ingresan a los modelos de lenguaje grandes como señales crudas y no estructuradas. Su transformación e integración internas dependen de la arquitectura, ya sea como prompts in-context o inyectados en capas intermedias, lo que conduce a distintas trayectorias evolutivas en la representación visual y las características de frecuencia. Encontramos que la atención por sí sola es insuficiente; el rendimiento está impulsado por la calidad de las representaciones visuales en cada capa a través de diferentes paradigmas de integración.
Los Clusters Semánticos Pre-entrenan la Máquina Tsetlin para Interpretabilidad
Un nuevo marco pre-entrena la Máquina Tsetlin utilizando clusters semánticos de modelos de lenguaje, evitando embeddings. El método agrupa muestras de texto en clusters coherentes mediante K-means o Top2Vec, luego utiliza pares cluster-muestra para entrenar una TM sin negación con retroalimentación de Tipo I. Los resultados muestran un rendimiento superior en cinco conjuntos de datos, igualando la precisión a nivel de BERT mientras mantiene la interpretabilidad completa.