Un nuevo método llamado ajuste de prueba y refinamiento utiliza sondas sintéticas de corrección de errores para mejorar iterativamente los archivos de guía del repositorio con llamadas LLM de un solo disparo, sin bucles de agente ni uso de herramientas. En SWE-bench Verified, alcanza una tasa media de resolución del 33,0 % —14,5 puntos porcentuales más alta que la base de conocimientos estática inicial—, lo que muestra una cobertura mejorada en lugar de una precisión de parche. El método permite a los agentes utilizar presupuestos de pasos más grandes de manera efectiva, y el rendimiento se mantiene estable entre modelos cuando la salida diagnóstica es suficiente.
El ajuste de prueba y refinamiento mejora el rendimiento de los agentes de codificación
ExecCritic utiliza RL específico por rol para mejorar agentes de codificación mediante reparación guiada por pruebas
ExecCritic introduce un marco que separa la construcción de pruebas de la reparación del código fuente para evitar una confianza falsa en los agentes de codificación. El sistema emplea un agente de prueba y un agente de reparación, ambos respaldados por Qwen-3.5-35B-A3B, entrenados por separado mediante aprendizaje por refuerzo.
Alibaba lanza pesos de vista previa de Qwen3.8-Flash-Next de 176B para codificación agéntica
Alibaba ha publicado los pesos del modelo Qwen3.8-Flash-Next, que sirven como una vista previa de la próxima arquitectura Qwen4 para que los desarrolladores experimenten y evalúen.
El ajuste fino de modelos VLA requiere menos capas de lo pensado
Los modelos Visión-Lenguaje-Acción muestran una redundancia capa por capa severa a pesar de los grandes conteos de parámetros. Un método de compresión sin entrenamiento que utiliza Alineación del Núcleo Centrado elimina capas gemelas, reduciendo la profundidad del modelo hasta un 50% y permitiendo un entrenamiento 40-50% más rápido y una inferencia hasta un 30% más rápida sin pérdida de rendimiento, validado en tareas robóticas de simulación y del mundo real.
SoftSkill: Compresión conductual para adaptación contextual
SoftSkill propone un método para comprimir habilidades de lenguaje natural en priores latentes compactos, mejorando el rendimiento en tareas de SearchQA, LiveMath y DocVQA. Supera a SkillOpt entre 5,2 y 12,5 puntos en benchmarks clave, reemplazando cientos o miles de tokens de Markdown con unos pocos tokens virtuales.
AutoPass: Agentes LLM guiados por evidencia para el ajuste de rendimiento del compilador
AutoPass utiliza evidencia en tiempo de ejecución y del compilador para guiar las decisiones de optimización generadas por LLM, superando a heurísticas expertas y métodos clásicos de autotuneo. Logra aceleraciones geométricas medias de 1.043x en sistemas x86-64 y 1.117x en sistemas ARM64 sin entrenamiento previo ni ajuste fino.