STAGE es una tubería que genera datos de entrenamiento de texto a JSON utilizando LLMs para sintetizar informes y esquemas JSON, validados contra las hojas de cálculo subyacentes. Las evaluaciones en STAGE-Eval muestran que mejora la coincidencia exacta de Qwen3-4B del 31.37% al 74.27% y la precisión de valores del 45.46% al 90.69%.
STAGE: Generación de datos fundamentada en la fuente para texto a JSON
La economía de la IA está comenzando a favorecer a los modelos abiertos
Los recientes lanzamientos de modelos de IA muestran que los modelos de alta inteligencia y bajo costo están cada vez más dominados por modelos de peso abierto como DeepSeek, Qwen, GLM, Kimi y MiniMax. Para la mayoría de las aplicaciones del mundo real, la brecha de rendimiento entre los modelos cerrados de vanguardia y los fuertes modelos abiertos se está reduciendo más rápido que las diferencias de costo, haciendo que los modelos abiertos sean competitivos en términos de capacidad y precio.
Alibaba anuncia Qwen 3.8 Max, un modelo de 2.4T parámetros con pesos abiertos que llegará la próxima semana
El equipo de Qwen de Alibaba ha anunciado Qwen 3.8 Max, un nuevo modelo insignia de 2.4T parámetros centrado en codificación, trabajo agénico a largo plazo y razonamiento multimodal. La compañía confirmó que las versiones de pesos abiertos tanto de Qwen 3.8 Max como del más pequeño Qwen 3.8-27B se lanzarán la próxima semana.
Lanzamiento de peso abierto de Qwen3.8, Kimi Code CLI, pila LLM de Netflix, software de chip de Alibaba
Alibaba anunció el lanzamiento de peso abierto de Qwen3.8, un modelo de 2,4 billones de parámetros, mientras también liberaba como código abierto su pila de software del chip AI Zhenwu para reducir la dependencia del ecosistema CUDA de Nvidia.
Achilles1089 lanza el modelo híbrido Qwen Fable sin censura
El usuario Achilles1089 ha subido a Hugging Face un modelo híbrido "fable y opus 4.8" sin censura, afirmando que los números demuestran su efectividad.
AGC-Bench presenta un benchmark unificado y AGC-Judge para medir la creatividad general artificial
Los investigadores presentan AGC-Bench, un benchmark unificado para la creatividad general artificial construido a partir de 3.101 artículos seleccionados y que cubre 78 conjuntos de datos en dominios como lluvia de ideas y STEM. Para abordar el sesgo en la evaluación automatizada, el equipo ajusta Qwen3-30B en calificaciones corregidas por sesgo para crear AGC-Judge, un modelo de peso abierto que puntúa robustamente nuevos benchmarks de creatividad.