SoftSkill propone un método para comprimir habilidades de lenguaje natural en priores latentes compactos, mejorando el rendimiento en tareas de SearchQA, LiveMath y DocVQA. Supera a SkillOpt entre 5,2 y 12,5 puntos en benchmarks clave, reemplazando cientos o miles de tokens de Markdown con unos pocos tokens virtuales.
SoftSkill: Compresión conductual para adaptación contextual
El ajuste de prueba y refinamiento mejora el rendimiento de los agentes de codificación
Un nuevo método llamado ajuste de prueba y refinamiento utiliza sondas sintéticas de corrección de errores para mejorar iterativamente los archivos de guía del repositorio con llamadas LLM de un solo disparo, sin bucles de agente ni uso de herramientas. En SWE-bench Verified, alcanza una tasa media de resolución del 33,0 % —14,5 puntos porcentuales más alta que la base de conocimientos estática inicial—, lo que muestra una cobertura mejorada en lugar de una precisión de parche. El método permite a los agentes utilizar presupuestos de pasos más grandes de manera efectiva, y el rendimiento se mantiene estable entre modelos cuando la salida diagnóstica es suficiente.
AgentFinVQA: QA de gráficos financieros auditable y en las instalaciones
AgentFinVQA introduce una canalización multi-agente para la respuesta a preguntas sobre gráficos financieros que garantiza la auditabilidad y la capacidad de implementación en las instalaciones sin una pérdida significativa de precisión. Supera a los modelos base en +7.68 pp utilizando un backbone propietario y en +4.84 pp con Qwen3.6-27B-FP8 de pesos abiertos, mientras proporciona una señal de confianza a través de la salida del verificador que mejora el enrutamiento de la revisión humana.
Qwen3.6-27b-mtp-q8 crea una implementación de búsqueda de caminos A* mediante pruebas autónomas
El modelo Qwen3.6-27b-mtp-q8 generó con éxito una implementación de búsqueda de caminos A* para un juego de prueba basado en Java usando Claude Code localmente. El proceso involucró casi 12 horas de desarrollo iterativo donde el modelo creó y ejecutó autónomamente un conjunto de pruebas.
Qwen3.6-27B con 3-Critic Harness iguala la calidad de frontera
Un usuario probó Qwen3.6-27B (8-bit) junto a GLM5.2 utilizando un harness de codificación que emplea tres críticos—revisión de código, revisión de pruebas y Playwright e2e—para validar la calidad de la salida.
Qwen lanza MoE de 35B parámetros para simulación de entornos de agentes
Qwen ha lanzado Qwen-AgentWorld-35B-A3B, un modelo MoE de 35B parámetros con solo unos 3B parámetros activos por token. Está entrenado para simular respuestas de entornos MCP, terminal, ingeniería de software, Android, web y GUI del sistema operativo, prediciendo las siguientes observaciones después de las acciones del agente, lo que permite un entrenamiento eficiente del agente y la simulación del entorno sin ejecución real de herramientas.