El creador de EverFern pregunta qué modelos locales funcionan mejor para flujos de trabajo agentes y uso del navegador/ordenador. Señala que la inteligencia del modelo rara vez es el cuello de botella, siendo los sistemas de fiabilidad y recuperación más críticos que la elección del modelo.
Mejores modelos locales para razonamiento en IA agente
H-RePlan: Recuperación jerárquica para sistemas de agentes multi-dispositivo
H-RePlan introduce un marco de replanificación jerárquica que separa la recuperación de estrategias locales del dispositivo de la replanificación global del orquestador. Supera a las líneas base existentes al lograr una mayor tasa de finalización y adherencia a las instrucciones, con menor costo en tokens, mediante una recuperación consciente del alcance en sistemas de agentes multi-dispositivo.
Act2Answer evalúa la retención de conocimiento en modelos de visión-lenguaje-acción
Act2Answer introduce un protocolo ligero para evaluar la retención de conocimiento del sentido común y del mundo en modelos VLA, requiriendo que los agentes respondan preguntas mediante acciones de colocación de objetos. Un estudio a gran escala de 7 modelos VLA y 9 líneas base VLM revela que los VLA funcionan bien en conceptos simples pero muestran brechas mayores en categorías semánticas ricas en comparación con sus VLMs fuente, con el co-entrenamiento VQA mejorando la retención de conocimiento y señales pico relevantes para la respuesta observadas en las capas intermedias de VLA.
Usuario como Engrama: Ediciones paramétricas locales para memoria personal
User as Engram propone almacenar los hechos por usuario como ediciones quirúrgicas con clave hash en una tabla de memoria, dejando el razonamiento en un adaptador compartido. Este diseño logra una precisión de razonamiento indirecto 5.6x mayor y mantiene el rendimiento de razonamiento base, con una huella de memoria 33,000x más pequeña que LoRA por usuario. El enfoque permite ediciones de usuarios independientes que se componen sin pérdidas, superando a los pipelines de recuperación más allá de 100 hechos.
BinTrack: QA espacial de código abierto con búsqueda de trayectoria binaria
BinTrack es un agente de pregunta y respuesta espacial completamente de código abierto que utiliza búsqueda binaria sobre la trayectoria de un robot para localizar respuestas. Logra hasta un 22,8 % más de precisión que otros métodos de código abierto y iguala el rendimiento de modelos cerrados en la categoría global más desafiante del benchmark SpaceLocQA. El sistema también ofrece una inferencia más rápida en un factor de 1,5x e introduce GangnamLoop, un benchmark real al aire libre recopilado con un robot cuadrúpedo.
UltraQuant: Caché KV de 4 bits para agentes con alta carga de contexto
UltraQuant permite el caché KV de 4 bits para agentes con alta carga de contexto, reduciendo el tiempo P50 hasta el primer token en 3.47x en rondas tardías y aumentando el rendimiento de salida en 1.63x sobre la línea base FP8 KV. Logra esto mediante consultas FP8, tensores KV FP4, escalas de grupo UE8M0 y MFMA escalado nativo en GPUs AMD CDNA4, con optimizaciones para kernels de decode-attention y elecciones de diseño robustas como el tratamiento asimétrico K/V y la rotación de Walsh-Hadamard.