BinTrack es un agente de pregunta y respuesta espacial completamente de código abierto que utiliza búsqueda binaria sobre la trayectoria de un robot para localizar respuestas. Logra hasta un 22,8 % más de precisión que otros métodos de código abierto y iguala el rendimiento de modelos cerrados en la categoría global más desafiante del benchmark SpaceLocQA. El sistema también ofrece una inferencia más rápida en un factor de 1,5x e introduce GangnamLoop, un benchmark real al aire libre recopilado con un robot cuadrúpedo.
BinTrack: QA espacial de código abierto con búsqueda de trayectoria binaria
Usuario como Engrama: Ediciones paramétricas locales para memoria personal
User as Engram propone almacenar los hechos por usuario como ediciones quirúrgicas con clave hash en una tabla de memoria, dejando el razonamiento en un adaptador compartido. Este diseño logra una precisión de razonamiento indirecto 5.6x mayor y mantiene el rendimiento de razonamiento base, con una huella de memoria 33,000x más pequeña que LoRA por usuario. El enfoque permite ediciones de usuarios independientes que se componen sin pérdidas, superando a los pipelines de recuperación más allá de 100 hechos.
Mejores modelos locales para razonamiento en IA agente
El creador de EverFern pregunta qué modelos locales funcionan mejor para flujos de trabajo agentes y uso del navegador/ordenador. Señala que la inteligencia del modelo rara vez es el cuello de botella, siendo los sistemas de fiabilidad y recuperación más críticos que la elección del modelo.
H-RePlan: Recuperación jerárquica para sistemas de agentes multi-dispositivo
H-RePlan introduce un marco de replanificación jerárquica que separa la recuperación de estrategias locales del dispositivo de la replanificación global del orquestador. Supera a las líneas base existentes al lograr una mayor tasa de finalización y adherencia a las instrucciones, con menor costo en tokens, mediante una recuperación consciente del alcance en sistemas de agentes multi-dispositivo.
Marco de doble agente para traducción verificada entre modelos
Un marco de doble agente convierte protocolos experimentales en lenguaje natural en comandos ejecutables para plataformas robóticas de laboratorio. Utiliza un Agente Analizador y un motor de mapeo basado en reglas para traducir los protocolos, con un Agente de Validación LLM heterogéneo que asegura la precisión e inicia la autocorrección. El marco permite con éxito la ejecución autónoma de extremo a extremo de experimentos basados en placas de microtitulación como el ensayo de Bradford.
AutoPass: Agentes LLM guiados por evidencia para el ajuste de rendimiento del compilador
AutoPass utiliza evidencia en tiempo de ejecución y del compilador para guiar las decisiones de optimización generadas por LLM, superando a heurísticas expertas y métodos clásicos de autotuneo. Logra aceleraciones geométricas medias de 1.043x en sistemas x86-64 y 1.117x en sistemas ARM64 sin entrenamiento previo ni ajuste fino.