La memoria flash de un robot se degrada con cada escritura, formando un activo no renovable. Un modelo de precios consciente del desgaste utiliza un precio sombra $η$ para guiar la colocación de la memoria entre RAM, NVM y la nube, con el enrutamiento óptimo dependiendo de si el valor de la tarea aumenta con la persistencia de la memoria. El signo de la asociación valor-escritura $χ$ varía según el despliegue: positivo en manipulación de largo horizonte, nulo en tareas de corto horizonte y negativo en teleoperación. El presupuesto de resistencia es vinculante solo en memoria QLC/eMMC de gama baja, y aunque el enrutamiento consciente del desgaste se alinea con el valor de la tarea, las mejoras reales de rendimiento permanecen sin verificar en los datos.
La resistencia de la memoria flash como capital depreciado en la memoria del robot
La resistencia de la memoria flash como capital depreciado en la memoria del robot
La resistencia de la memoria flash de un robot es un activo no renovable que se degrada con cada escritura. Un modelo de precios consciente del desgaste introduce un precio sombra $η$ para guiar la colocación de la memoria entre RAM, NVM y la nube, con el enrutamiento óptimo dependiendo de la asociación valor-escritura $χ$. Las mediciones empíricas muestran que $χ$ es positivo en manipulación a largo plazo, nulo en tareas a corto plazo y negativo en teleoperación, y el presupuesto de resistencia es limitante solo en memoria QLC/eMMC de gama baja, donde el control consciente del desgaste influye en el enrutamiento basado en el valor de la tarea sin mejorar el rendimiento.
El ajuste de prueba y refinamiento mejora el rendimiento de los agentes de codificación
Un nuevo método llamado ajuste de prueba y refinamiento utiliza sondas sintéticas de corrección de errores para mejorar iterativamente los archivos de guía del repositorio con llamadas LLM de un solo disparo, sin bucles de agente ni uso de herramientas. En SWE-bench Verified, alcanza una tasa media de resolución del 33,0 % —14,5 puntos porcentuales más alta que la base de conocimientos estática inicial—, lo que muestra una cobertura mejorada en lugar de una precisión de parche. El método permite a los agentes utilizar presupuestos de pasos más grandes de manera efectiva, y el rendimiento se mantiene estable entre modelos cuando la salida diagnóstica es suficiente.
H-RePlan: Recuperación jerárquica para sistemas de agentes multi-dispositivo
H-RePlan introduce un marco de replanificación jerárquica que separa la recuperación de estrategias locales del dispositivo de la replanificación global del orquestador. Supera a las líneas base existentes al lograr una mayor tasa de finalización y adherencia a las instrucciones, con menor costo en tokens, mediante una recuperación consciente del alcance en sistemas de agentes multi-dispositivo.
El ajuste fino de modelos VLA requiere menos capas de lo pensado
Los modelos Visión-Lenguaje-Acción muestran una redundancia capa por capa severa a pesar de los grandes conteos de parámetros. Un método de compresión sin entrenamiento que utiliza Alineación del Núcleo Centrado elimina capas gemelas, reduciendo la profundidad del modelo hasta un 50% y permitiendo un entrenamiento 40-50% más rápido y una inferencia hasta un 30% más rápida sin pérdida de rendimiento, validado en tareas robóticas de simulación y del mundo real.
CRAX: Benchmarking rápido y seguro de aprendizaje por refuerzo
CRAX introduce un benchmark de seguridad acelerado y de alta fidelidad para el aprendizaje por refuerzo utilizando MuJoCo XLA. Logra aceleraciones de hasta 100x sobre benchmarks basados en CPU mediante vectorización y aceleración por hardware, presentando seis conjuntos de entornos y tres tareas específicas del agente en tres niveles de dificultad. La evaluación de seis métodos de RL seguro muestra que ningún enfoque domina, destacando los compromisos entre rendimiento y seguridad, con el aprendizaje por currículo y la transferencia de seguridad mejorando los resultados.