KVEraser permite un borrado localizado eficiente del contexto en modelos de lenguaje grandes al reemplazar únicamente los estados del caché KV de un segmento borrado con estados de dirección aprendidos. Logra un rendimiento cercano al de la recomputación completa en tareas dentro del dominio para longitudes de contexto de 1K a 32K, con solo un aumento de latencia del 24%, y supera a otros métodos aproximados en QA de documentos largos con una aceleración de 3--4x sobre la recomputación completa.
KVEraser: Borrado localizado eficiente del contexto en LLM
EfficientRollout: Descodificación autoespeculativa consciente del sistema para rollouts de RL
EfficientRollout introduce un marco de descodificación autoespeculativa que reduce el rollout y la latencia end-to-end hasta en un 19,6% y un 12,7% respectivamente, sin comprometer la calidad final del modelo. Utiliza un drafter cuantizado derivado del modelo objetivo e integra una política de conmutación consciente del sistema para evitar regímenes limitados por el cómputo, permitiendo una especulación efectiva durante las generaciones de políticas en evolución.
WorldLines: Evaluación de la memoria de agentes encarnados en horizontes temporales largos
WorldLines presenta una evaluación basada en proyectos para la asistencia doméstica encarnada en horizontes temporales largos, capturando secuencias extendidas del hogar con diálogos, acciones y cambios de estado. Permite muestras vinculadas a evidencia para Memoria QA y Planificación de Tareas Encarnadas, y propone ObsMem, un marco de memoria basado en observadores que soporta memorias conscientes de la visibilidad y decisiones conscientes del estado. Los experimentos destacan los desafíos en la observabilidad parcial y la traducción de memoria, con ObsMem proporcionando una arquitectura de referencia más sólida para este tipo de entornos.
LedgerAgent: Estado estructurado para agentes de llamada de herramientas adherentes a la política
LedgerAgent introduce un libro mayor estructurado para mantener los estados de las tareas por separado en agentes de llamada de herramientas. Convierte los estados en prompts y aplica restricciones de la política antes de la ejecución de herramientas, reduciendo las violaciones de la política y mejorando el rendimiento en dominios de atención al cliente.
Cápsulas de estado de ejecución para inferencia de IA en dispositivo con baja latencia
Las cápsulas de estado de ejecución permiten la verificación y restauración de puntos de control vinculados al gráfico del estado completo de ejecución, incluidos los estados KV, recurrentes y de convolución, para la inferencia de IA en dispositivo con baja latencia y lotes pequeños. En RTX 5090 y Jetson AGX Thor, la restauración de cápsulas logra una corrección exacta a nivel de bytes e idéntica a nivel de tokens, con operaciones de GPU de submilisegundo y aceleraciones de TTFT hasta 27x en 16k tokens, demostrando una reducción significativa de latencia en flujos de trabajo de IA interactivos.
LedgerAgent: Estado estructurado para agentes de llamada a herramientas adherentes a la política
LedgerAgent introduce un libro contable estructurado para mantener los estados de las tareas separados en agentes que llaman a herramientas. Convierte estos estados en prompts y aplica restricciones de políticas antes de la ejecución de las herramientas, reduciendo las violaciones de políticas y mejorando el rendimiento en dominios de atención al cliente.