Un usuario pregunta si se sigue recomendando el ajuste fino supervisado (SFT) seguido de aprendizaje por refuerzo (RL) para entrenar agentes de Qwen 3.5 de 4B o 9B para el uso de múltiples herramientas, o si los enfoques solo con RL producen mejores resultados. La publicación también busca orientación sobre el diseño de recompensas y el manejo de la ejecución paralela de herramientas en flujos de trabajo de agentes.
¿SFT o RL-first para el entrenamiento del agente de herramientas de Qwen 3.5?
Qwen-AgentWorld: Modelos de mundo lingüístico para agentes generales
Qwen-AgentWorld-35B-A3B y Qwen-AgentWorld-397B-A17B son los primeros modelos de mundo lingüístico que simulan entornos agénticos en siete dominios utilizando razonamiento de cadena de pensamiento largo. Entrenados mediante una canalización de tres etapas—CPT, SFT y RL—estos modelos superan a los modelos fronterizos existentes en AgentWorldBench, un benchmark derivado de interacciones del mundo real de cinco modelos en nueve tareas establecidas.
Modelo de Mundo Social para Inteligencia Social de por Vida
El Modelo de Mundo Social descompone la interacción social en cinco dimensiones para permitir el aprendizaje en bucle cerrado. Permite que los modelos de código abierto mejoren y retengan sosteniblemente las capacidades sociales, superando a las líneas base e igualando a Gemini 3 Flash de código cerrado en métricas clave sin olvidar a través de niveles de dificultad.
Observando cómo un asistente de voz local con IA se vuelve menos inteligente
Una prueba en una RTX 5060 Ti mostró que reducir el tamaño del modelo de un asistente de voz local con IA de 9B a 0.8B provoca un descenso pronunciado en la capacidad. El modelo de 9B maneja bien la orquestación de herramientas, mientras que los modelos más pequeños muestran fallos crecientes: el modelo de 4B omite las llamadas a herramientas y adivina hechos, el modelo de 2B sufre deriva semántica, y el modelo de 0.8B falla en operar funciones de agente, activando APIs incorrectas o bucles infinitos.
El ajuste de prueba y refinamiento mejora el rendimiento de los agentes de codificación
Un nuevo método llamado ajuste de prueba y refinamiento utiliza sondas sintéticas de corrección de errores para mejorar iterativamente los archivos de guía del repositorio con llamadas LLM de un solo disparo, sin bucles de agente ni uso de herramientas. En SWE-bench Verified, alcanza una tasa media de resolución del 33,0 % —14,5 puntos porcentuales más alta que la base de conocimientos estática inicial—, lo que muestra una cobertura mejorada en lugar de una precisión de parche. El método permite a los agentes utilizar presupuestos de pasos más grandes de manera efectiva, y el rendimiento se mantiene estable entre modelos cuando la salida diagnóstica es suficiente.
SoftSkill: Compresión conductual para adaptación contextual
SoftSkill propone un método para comprimir habilidades de lenguaje natural en priores latentes compactos, mejorando el rendimiento en tareas de SearchQA, LiveMath y DocVQA. Supera a SkillOpt entre 5,2 y 12,5 puntos en benchmarks clave, reemplazando cientos o miles de tokens de Markdown con unos pocos tokens virtuales.