Laboratorio · Alibaba (Qwen)
media MarkTechPost · hace 6 d · 29 vistas

Alibaba Qwen lanza Qwen3.8-Omni-Flash, un modelo omnimodal agéntico con contexto de 1M

El equipo de Qwen de Alibaba ha lanzado Qwen3.8-Omni-Flash, su primer modelo omnimodal diseñado en torno a capacidades agénticas para la comprensión de audio y video, así como el uso de herramientas. El modelo acepta entradas de texto, imágenes, audio y video para devolver salidas de texto, con una ventana de contexto de 1M de tokens y llamada de funciones nativa.

media MarkTechPost · hace 28 d · 74 vistas

El equipo de Qwen de Alibaba lanza Qwen3.8-Flash-Next, una vista previa de 125B que antecede a Qwen4

El equipo de Qwen de Alibaba ha lanzado Qwen3.8-Flash-Next, un modelo Mixture-of-Experts multimodal de pesos abiertos diseñado para anticipar la arquitectura de la próxima serie Qwen4. El punto de control combina una columna vertebral de 125B con una tabla de incrustaciones N-gram de 51B y un módulo de predicción multi-token de 4B, activando solo 6B parámetros por token.

arxiv arXiv cs.CL · ahora mismo SWE-Lancer · 51.47% · 1 vista En vivo

SkillGym internaliza habilidades humanas en LLMs para la resolución de problemas del mundo real

Los investigadores presentan SkillGym, un marco que transforma las habilidades de agentes escritas por humanos en entornos de entrenamiento ejecutables y verificables para agentes de modelos de lenguaje grandes. El sistema utiliza una canalización de habilidad a tarea para instanciar tareas concretas y verificar resultados con verificadores basados en código.

arxiv arXiv cs.AI · hace 23 h · 12 vistas

VideoX-Qwen presenta un marco centrado en datos para la edición de video basada en instrucciones

Los investigadores presentan VideoX-Qwen, un marco integrado que combina la construcción escalable de datos con el entrenamiento del modelo para avanzar en la edición de video general e impulsada por instrucciones. El sistema utiliza una canalización de producción que organiza modelos especializados para generar registros de edición direccional, resultando en más de 1.2 millones de muestras de alta calidad en tareas de adición, eliminación, reemplazo y atributos.

media MarkTechPost · hace 4 d · 21 vistas

El equipo de Alibaba Qwen lanza Qwen3.8-LiveTranslate con arquitectura Interleave

El equipo de Alibaba Qwen ha lanzado Qwen3.8-LiveTranslate, un modelo de interpretación simultánea en tiempo real de nueva generación que escucha el habla en vivo y devuelve texto y audio traducidos mientras el hablante aún está hablando. El lanzamiento introduce una nueva arquitectura Interleave diseñada para reducir la latencia y mejorar la calidad de la traducción.

lab Hugging Face Blog · hace 10 d · 16 vistas

TRL v1.14 AsyncGRPOTrainer permite sincronización solo con LoRA en Hugging Face Jobs

TRL v1.14 introduce soporte para LoRA en AsyncGRPOTrainer, permitiendo entrenar un adaptador de Low-Rank Adaptation y sincronizar únicamente ese pequeño archivo con los trabajadores de inferencia de vLLM. Esta arquitectura desacopla los trabajos de entrenamiento y generación en máquinas separadas mediante el uso de un Storage Bucket compartido como puente de sistema de archivos, eliminando la necesidad de NCCL o comunicación directa de red entre nodos.

media Hugging Face Forums · hace 10 d · 25 vistas

El estudio identifica FragileTokens que fallan en la copia contextual pese a superar las pruebas de aislamiento

Un estudio caracteriza los "FragileTokens", entradas del vocabulario en modelos de lenguaje de peso abierto que copian con éxito cuando están aisladas, pero presentan errores cuando se insertan en el texto circundante. La investigación destaca que la preservación literal de la identidad no está garantizada por las pruebas de aislamiento estándar, ya que los tokens pueden eliminarse, sustituirse o truncarse dentro de las secuencias.

arxiv arXiv cs.AI · hace 15 d SWE-bench Verified · 72.6% · 30 vistas

ExecCritic utiliza RL específico por rol para mejorar agentes de codificación mediante reparación guiada por pruebas

ExecCritic introduce un marco que separa la construcción de pruebas de la reparación del código fuente para evitar una confianza falsa en los agentes de codificación. El sistema emplea un agente de prueba y un agente de reparación, ambos respaldados por Qwen-3.5-35B-A3B, entrenados por separado mediante aprendizaje por refuerzo.

arxiv arXiv cs.CL · hace 15 d SWE-bench Verified · 72.6% · 25 vistas

ExecCritic utiliza RL específico por rol para mejorar agentes de codificación mediante reparación guiada por pruebas

Los investigadores presentan ExecCritic, un marco que combina una estructura de verificar-revisar-corregir con aprendizaje por refuerzo específico por rol para potenciar agentes de codificación. El sistema separa la construcción de pruebas de la reparación del código fuente, utilizando un agente de Pruebas para generar pruebas nativas del repositorio y un agente de Reparación para revisar el código basándose en retroalimentación de ejecución.

arxiv arXiv cs.LG · hace 17 d · 31 vistas

El método de incertidumbre especulativa reduce errores en agentes de ingeniería de software mediante el uso de un modelo borrador

Los autores presentan la Incertidumbre Especulativa (SU), una técnica que recupera una señal de fallo predictivo para agentes LLM de caja negra analizando únicamente sus tokens de salida, sin requerir acceso a logits, pesos o activaciones. Al invertir la decodificación especulativa, un modelo borrador pequeño con pesos abiertos puntúa la trayectoria del agente en una sola pasada hacia adelante para extraer características sensibles a la fase y calibrarlas contra un objetivo verificable.

arxiv arXiv cs.CL · hace 20 d · 37 vistas

VisCAD lanza una suite de modelos base con inteligencia multimodal para CAD industrial

Los investigadores presentan VisCAD, una suite de modelos base diseñada para ofrecer una generalización amplia y una capacidad sólida para el diseño realista de productos industriales. La suite aborda los desafíos de la generación a nivel de pieza a partir de diversas entradas como renders y texto, así como la generación a nivel de ensamblaje que involucra piezas interactivas.