Un nuevo método llamado ajuste de prueba y refinamiento utiliza sondas sintéticas de corrección de errores para mejorar iterativamente los archivos de guía del repositorio con llamadas LLM de un solo disparo, sin bucles de agente ni uso de herramientas. En SWE-bench Verified, alcanza una tasa media de resolución del 33,0 % —14,5 puntos porcentuales más alta que la base de conocimientos estática inicial—, lo que muestra una cobertura mejorada en lugar de una precisión de parche. El método permite a los agentes utilizar presupuestos de pasos más grandes de manera efectiva, y el rendimiento se mantiene estable entre modelos cuando la salida diagnóstica es suficiente.
El ajuste de prueba y refinamiento mejora el rendimiento de los agentes de codificación
El ajuste fino de modelos VLA requiere menos capas de lo pensado
Los modelos Visión-Lenguaje-Acción muestran una redundancia capa por capa severa a pesar de los grandes conteos de parámetros. Un método de compresión sin entrenamiento que utiliza Alineación del Núcleo Centrado elimina capas gemelas, reduciendo la profundidad del modelo hasta un 50% y permitiendo un entrenamiento 40-50% más rápido y una inferencia hasta un 30% más rápida sin pérdida de rendimiento, validado en tareas robóticas de simulación y del mundo real.
SoftSkill: Compresión conductual para adaptación contextual
SoftSkill propone un método para comprimir habilidades de lenguaje natural en priores latentes compactos, mejorando el rendimiento en tareas de SearchQA, LiveMath y DocVQA. Supera a SkillOpt entre 5,2 y 12,5 puntos en benchmarks clave, reemplazando cientos o miles de tokens de Markdown con unos pocos tokens virtuales.
AutoPass: Agentes LLM guiados por evidencia para el ajuste de rendimiento del compilador
AutoPass utiliza evidencia en tiempo de ejecución y del compilador para guiar las decisiones de optimización generadas por LLM, superando a heurísticas expertas y métodos clásicos de autotuneo. Logra aceleraciones geométricas medias de 1.043x en sistemas x86-64 y 1.117x en sistemas ARM64 sin entrenamiento previo ni ajuste fino.
Pose6DAug: Intercambio de objetos multi-vista físicamente plausible
Pose6DAug permite la augmentación de datos robóticos intercambiando objetos en episodios exitosos mientras se preservan trayectorias de poses 6D físicamente válidas. Opera en 3D utilizando una malla anclada por poses temporalmente coherentes, asegurando consistencia multi-vista y plausibilidad física. El ajuste fino de una política VLA con estos datos aumentados mejora las tasas de éxito para objetos nuevos en un 16.5% respecto a las líneas base más avanzadas.
AgentFinVQA: QA de gráficos financieros auditable y en las instalaciones
AgentFinVQA introduce una canalización multi-agente para la respuesta a preguntas sobre gráficos financieros que garantiza la auditabilidad y la capacidad de implementación en las instalaciones sin una pérdida significativa de precisión. Supera a los modelos base en +7.68 pp utilizando un backbone propietario y en +4.84 pp con Qwen3.6-27B-FP8 de pesos abiertos, mientras proporciona una señal de confianza a través de la salida del verificador que mejora el enrutamiento de la revisión humana.