Un enfoque centrado en los datos mejora el razonamiento de contexto largo en modelos de lenguaje grandes, utilizando ocho conjuntos de datos curados con 14K ejemplos en tareas de recuperación, síntesis multi-evidencia y razonamiento. Al combinarse con entrenamiento GRPO basado mínimamente en resultados, logra ganancias promedio de +7.2 a +6.4 puntos en siete benchmarks, superando conjuntos de entrenamiento RL previos, y mejora el rendimiento agénico en +4.8 y +7.0 puntos en GAIA y BrowseComp respectivamente.
La receta de datos mejora el razonamiento de contexto largo en LLMs
La receta de datos mejora el razonamiento de contexto largo en LLMs
Un enfoque centrado en los datos mejora el razonamiento de contexto largo en modelos de lenguaje grandes, utilizando ocho conjuntos de datos curados con 14K ejemplos en tareas de recuperación, síntesis multi-evidencia y razonamiento. Al combinarse con entrenamiento GRPO basado mínimamente en resultados, logra ganancias promedio de +7.2 a +6.4 puntos en siete benchmarks, superando los conjuntos de entrenamiento RL previos, y mejora el rendimiento agénico en +4.8 y +7.0 puntos en GAIA y BrowseComp respectivamente.
Qwen-AgentWorld: Modelos de mundo lingüístico para agentes generales
Qwen-AgentWorld-35B-A3B y Qwen-AgentWorld-397B-A17B son los primeros modelos de mundo lingüístico que simulan entornos agénticos en siete dominios utilizando razonamiento de cadena de pensamiento largo. Entrenados mediante una canalización de tres etapas—CPT, SFT y RL—estos modelos superan a los modelos fronterizos existentes en AgentWorldBench, un benchmark derivado de interacciones del mundo real de cinco modelos en nueve tareas establecidas.
Modelo de Mundo Social para Inteligencia Social de por Vida
El Modelo de Mundo Social descompone la interacción social en cinco dimensiones para permitir el aprendizaje en bucle cerrado. Permite que los modelos de código abierto mejoren y retengan sosteniblemente las capacidades sociales, superando a las líneas base e igualando a Gemini 3 Flash de código cerrado en métricas clave sin olvidar a través de niveles de dificultad.
¿SFT o RL-first para el entrenamiento del agente de herramientas de Qwen 3.5?
Un usuario pregunta si se sigue recomendando el ajuste fino supervisado (SFT) seguido de aprendizaje por refuerzo (RL) para entrenar agentes de Qwen 3.5 de 4B o 9B para el uso de múltiples herramientas, o si los enfoques solo con RL producen mejores resultados. La publicación también busca orientación sobre el diseño de recompensas y el manejo de la ejecución paralela de herramientas en flujos de trabajo de agentes.
Observando cómo un asistente de voz local con IA se vuelve menos inteligente
Una prueba en una RTX 5060 Ti mostró que reducir el tamaño del modelo de un asistente de voz local con IA de 9B a 0.8B provoca un descenso pronunciado en la capacidad. El modelo de 9B maneja bien la orquestación de herramientas, mientras que los modelos más pequeños muestran fallos crecientes: el modelo de 4B omite las llamadas a herramientas y adivina hechos, el modelo de 2B sufre deriva semántica, y el modelo de 0.8B falla en operar funciones de agente, activando APIs incorrectas o bucles infinitos.