Un nuevo marco pre-entrena la Máquina Tsetlin utilizando clusters semánticos de modelos de lenguaje, evitando embeddings. El método agrupa muestras de texto en clusters coherentes mediante K-means o Top2Vec, luego utiliza pares cluster-muestra para entrenar una TM sin negación con retroalimentación de Tipo I. Los resultados muestran un rendimiento superior en cinco conjuntos de datos, igualando la precisión a nivel de BERT mientras mantiene la interpretabilidad completa.
Los Clusters Semánticos Pre-entrenan la Máquina Tsetlin para Interpretabilidad
CircuitLasso: Aprendizaje de circuitos escalable para la interpretabilidad de LLM
CircuitLasso propone un método escalable para aprender circuitos dispersos en modelos de lenguaje grandes utilizando regresión lineal dispersa. Logra una precisión estructural comparable a los métodos basados en intervención de última generación con un costo computacional significativamente menor, mientras permite el descubrimiento eficiente de la propagación de características semánticas y mejora el rendimiento en tareas de generalización de dominio con un costo reducido.
H-RePlan: Recuperación jerárquica para sistemas de agentes multi-dispositivo
H-RePlan introduce un marco de replanificación jerárquica que separa la recuperación de estrategias locales del dispositivo de la replanificación global del orquestador. Supera a las líneas base existentes al lograr una mayor tasa de finalización y adherencia a las instrucciones, con menor costo en tokens, mediante una recuperación consciente del alcance en sistemas de agentes multi-dispositivo.
Evolución oculta del contexto visual disfrazado en VLMs
Los tokens visuales ingresan a los modelos de lenguaje grandes como señales crudas y no estructuradas. Su transformación e integración internas dependen de la arquitectura, ya sea como prompts in-context o inyectados en capas intermedias, lo que conduce a distintas trayectorias evolutivas en la representación visual y las características de frecuencia. Encontramos que la atención por sí sola es insuficiente; el rendimiento está impulsado por la calidad de las representaciones visuales en cada capa a través de diferentes paradigmas de integración.
OneCanvas: Comprensión de escenas 3D mediante reproyección panorámica
OneCanvas permite la comprensión de escenas 3D en Modelos Visión-Lenguaje agregando características de parches sobre un único lienzo panorámico utilizando coordenadas del mundo 3D. Alcanza rendimiento de vanguardia en SQA3D y VSI-Bench, y se generaliza a datos fuera de distribución en SPBench, utilizando significativamente menos capacidad de entrenamiento que los métodos existentes.
Act2Answer evalúa la retención de conocimiento en modelos de visión-lenguaje-acción
Act2Answer introduce un protocolo ligero para evaluar la retención de conocimiento del sentido común y del mundo en modelos VLA, requiriendo que los agentes respondan preguntas mediante acciones de colocación de objetos. Un estudio a gran escala de 7 modelos VLA y 9 líneas base VLM revela que los VLA funcionan bien en conceptos simples pero muestran brechas mayores en categorías semánticas ricas en comparación con sus VLMs fuente, con el co-entrenamiento VQA mejorando la retención de conocimiento y señales pico relevantes para la respuesta observadas en las capas intermedias de VLA.