Los modelos Visión-Lenguaje-Acción muestran una redundancia capa por capa severa a pesar de los grandes conteos de parámetros. Un método de compresión sin entrenamiento que utiliza Alineación del Núcleo Centrado elimina capas gemelas, reduciendo la profundidad del modelo hasta un 50% y permitiendo un entrenamiento 40-50% más rápido y una inferencia hasta un 30% más rápida sin pérdida de rendimiento, validado en tareas robóticas de simulación y del mundo real.
El ajuste fino de modelos VLA requiere menos capas de lo pensado
Pose6DAug: Intercambio de objetos multi-vista físicamente plausible
Pose6DAug permite la augmentación de datos robóticos intercambiando objetos en episodios exitosos mientras se preservan trayectorias de poses 6D físicamente válidas. Opera en 3D utilizando una malla anclada por poses temporalmente coherentes, asegurando consistencia multi-vista y plausibilidad física. El ajuste fino de una política VLA con estos datos aumentados mejora las tasas de éxito para objetos nuevos en un 16.5% respecto a las líneas base más avanzadas.
ROVE: Aprendizaje por Refuerzo con Intervenciones Humanas para Manipulación de Humanoides
ROVE permite a los modelos Visión-Lenguaje-Acción humanoides aprender comportamientos de manipulación efectivos utilizando intervenciones humanas imperfectas. Combina una tubería de recopilación de datos con humano en el bucle con Estimación Optimista de Valores y supervisión cruzada de encarnaciones para priorizar acciones de alto valor y mejorar la robustez. ROVE supera a los métodos base en tareas de manipulación ricas en contacto del mundo real mediante ciclos iterativos de rollout e intervención.
El ajuste de prueba y refinamiento mejora el rendimiento de los agentes de codificación
Un nuevo método llamado ajuste de prueba y refinamiento utiliza sondas sintéticas de corrección de errores para mejorar iterativamente los archivos de guía del repositorio con llamadas LLM de un solo disparo, sin bucles de agente ni uso de herramientas. En SWE-bench Verified, alcanza una tasa media de resolución del 33,0 % —14,5 puntos porcentuales más alta que la base de conocimientos estática inicial—, lo que muestra una cobertura mejorada en lugar de una precisión de parche. El método permite a los agentes utilizar presupuestos de pasos más grandes de manera efectiva, y el rendimiento se mantiene estable entre modelos cuando la salida diagnóstica es suficiente.
Cápsulas de estado de ejecución para inferencia de IA en dispositivo con baja latencia
Las cápsulas de estado de ejecución permiten la verificación y restauración de puntos de control vinculados al gráfico del estado completo de ejecución, incluidos los estados KV, recurrentes y de convolución, para la inferencia de IA en dispositivo con baja latencia y lotes pequeños. En RTX 5090 y Jetson AGX Thor, la restauración de cápsulas logra una corrección exacta a nivel de bytes e idéntica a nivel de tokens, con operaciones de GPU de submilisegundo y aceleraciones de TTFT hasta 27x en 16k tokens, demostrando una reducción significativa de latencia en flujos de trabajo de IA interactivos.
Lagrange: Marco disperso de vocabulario abierto para conducción de extremo a extremo
Lagrange introduce un marco disperso basado en energía y de vocabulario abierto para la conducción generalizada de extremo a extremo. Utiliza Modelos Visión-Lenguaje para generar propuestas de objetos independientes de la clase y las codifica en tokens semánticos continuos, lo que permite una generalización robusta a escenarios anómalos mientras se adhiere a la cinemática del vehículo mediante la minimización de la acción lagrangiana.