Alibaba anuncia Qwen 4 en la Conferencia Apsara
Alibaba ha anunciado oficialmente el lanzamiento de Qwen 4 durante la Conferencia Apsara.
Alibaba ha anunciado oficialmente el lanzamiento de Qwen 4 durante la Conferencia Apsara.
El equipo de Qwen de Alibaba ha lanzado Qwen3.8-Omni-Flash, su primer modelo omnimodal diseñado en torno a capacidades agénticas para la comprensión de audio y video, así como el uso de herramientas. El modelo acepta entradas de texto, imágenes, audio y video para devolver salidas de texto, con una ventana de contexto de 1M de tokens y llamada de funciones nativa.
El equipo de Qwen de Alibaba ha lanzado Qwen3.8-Flash-Next, un modelo Mixture-of-Experts multimodal de pesos abiertos diseñado para anticipar la arquitectura de la próxima serie Qwen4. El punto de control combina una columna vertebral de 125B con una tabla de incrustaciones N-gram de 51B y un módulo de predicción multi-token de 4B, activando solo 6B parámetros por token.
Los investigadores presentan SkillGym, un marco que transforma las habilidades de agentes escritas por humanos en entornos de entrenamiento ejecutables y verificables para agentes de modelos de lenguaje grandes. El sistema utiliza una canalización de habilidad a tarea para instanciar tareas concretas y verificar resultados con verificadores basados en código.
Los investigadores presentan VideoX-Qwen, un marco integrado que combina la construcción escalable de datos con el entrenamiento del modelo para avanzar en la edición de video general e impulsada por instrucciones. El sistema utiliza una canalización de producción que organiza modelos especializados para generar registros de edición direccional, resultando en más de 1.2 millones de muestras de alta calidad en tareas de adición, eliminación, reemplazo y atributos.
Alibaba Cloud ha presentado Qwen3.8-Omni-Flash, un modelo agénico multimodal nativo diseñado para tareas de productividad en el mundo real que mejora sustancialmente la comprensión y el razonamiento multimodal en comparación con los modelos omni anteriores.
Alibaba ha anunciado planes para desarrollar un modelo de inteligencia artificial que contenga entre 5 y 10 billones de parámetros. Junto con esta hoja de ruta, la compañía también presentó un nuevo chip personalizado diseñado para apoyar sus necesidades de infraestructura.
El equipo de Qwen de Alibaba ha lanzado Qwen-Image-2.1, un modelo unificado de generación de texto a imagen y edición de imágenes que consolida los puntos de control anteriores separados en un único transformador de difusión de 7B parámetros.
Qwen ha lanzado Qwen-Image-2.1, un modelo unificado diseñado tanto para la generación como para la edición de imágenes.
El equipo de Alibaba Qwen ha lanzado Qwen3.8-LiveTranslate, un modelo de interpretación simultánea en tiempo real de nueva generación que escucha el habla en vivo y devuelve texto y audio traducidos mientras el hablante aún está hablando. El lanzamiento introduce una nueva arquitectura Interleave diseñada para reducir la latencia y mejorar la calidad de la traducción.
Alibaba ha lanzado un modelo de inteligencia artificial médica de código abierto capaz de detectar cáncer y aproximadamente otras 150 condiciones médicas.
El modelo Qwen3.8 Max (0902) ha logrado una puntuación de 45 en el Índice de Inteligencia de Artificial Analysis, recuperando el primer puesto en el ranking de China.
TRL v1.14 introduce soporte para LoRA en AsyncGRPOTrainer, permitiendo entrenar un adaptador de Low-Rank Adaptation y sincronizar únicamente ese pequeño archivo con los trabajadores de inferencia de vLLM. Esta arquitectura desacopla los trabajos de entrenamiento y generación en máquinas separadas mediante el uso de un Storage Bucket compartido como puente de sistema de archivos, eliminando la necesidad de NCCL o comunicación directa de red entre nodos.
Un estudio caracteriza los "FragileTokens", entradas del vocabulario en modelos de lenguaje de peso abierto que copian con éxito cuando están aisladas, pero presentan errores cuando se insertan en el texto circundante. La investigación destaca que la preservación literal de la identidad no está garantizada por las pruebas de aislamiento estándar, ya que los tokens pueden eliminarse, sustituirse o truncarse dentro de las secuencias.
ExecCritic introduce un marco que separa la construcción de pruebas de la reparación del código fuente para evitar una confianza falsa en los agentes de codificación. El sistema emplea un agente de prueba y un agente de reparación, ambos respaldados por Qwen-3.5-35B-A3B, entrenados por separado mediante aprendizaje por refuerzo.
Los investigadores presentan ExecCritic, un marco que combina una estructura de verificar-revisar-corregir con aprendizaje por refuerzo específico por rol para potenciar agentes de codificación. El sistema separa la construcción de pruebas de la reparación del código fuente, utilizando un agente de Pruebas para generar pruebas nativas del repositorio y un agente de Reparación para revisar el código basándose en retroalimentación de ejecución.
Los autores presentan la Incertidumbre Especulativa (SU), una técnica que recupera una señal de fallo predictivo para agentes LLM de caja negra analizando únicamente sus tokens de salida, sin requerir acceso a logits, pesos o activaciones. Al invertir la decodificación especulativa, un modelo borrador pequeño con pesos abiertos puntúa la trayectoria del agente en una sola pasada hacia adelante para extraer características sensibles a la fase y calibrarlas contra un objetivo verificable.
Los investigadores presentan VisCAD, una suite de modelos base diseñada para ofrecer una generalización amplia y una capacidad sólida para el diseño realista de productos industriales. La suite aborda los desafíos de la generación a nivel de pieza a partir de diversas entradas como renders y texto, así como la generación a nivel de ensamblaje que involucra piezas interactivas.
Ant Group ha abierto el código fuente de Ling-3.0-flash-Fin, el primer modelo de la familia Ant Ling con capacidades financieras mejoradas, desarrollado junto con instituciones financieras líderes y expertos del sector.
Un ingeniero ha liberado como código abierto una reproducción del proyecto viral de Surya Narreddi, que entrena un modelo de programación para pintar acuarelas utilizando JavaScript y aprendizaje por refuerzo. La implementación utiliza la biblioteca TRL y OpenEnv para crear un pipeline de extremo a extremo en Hugging Face para entrenamiento, puntuación e inferencia.