Un usuario pregunta si alguien con recursos informáticos suficientes puede crear un gran conjunto de datos de destilación de 70-1 millones de ejemplos a partir de GLM5.2. El objetivo es permitir un mejor entrenamiento de modelos más pequeños como Qwen3.5, beneficiando a la comunidad en general.
¿Alguien tiene suficiente capacidad de cómputo para crear un conjunto de datos de destilación a partir de GLM5.2?
Z.ai y Alibaba convergen independientemente en una arquitectura de atención lineal 3:1 para GLM-5.3-Flash y Qwen3.8-Flash-Next
Z.ai lanzó GLM-5.3-Flash, un modelo MoE multimodal de 320B parámetros con 18B parámetros activos, mientras que el equipo de Qwen de Alibaba lanzó Qwen3.8-Flash-Next, un modelo de 125B con 6B parámetros activos. A pesar del desarrollo independiente, ambos equipos adoptaron configuraciones arquitecturales casi idénticas.
Z.ai lanza el modelo de codificación GLM-5.3; Cursor se une a SpaceXAI
Z.ai lanzó GLM-5.3, un modelo centrado en codificación y ciberseguridad, construido mediante post-training de su modelo base 743B en lugar de nuevo pretraining. El lanzamiento incluye puntuaciones específicas de benchmarks como Terminal Bench 3.0 en 28.3 y DeepSWE en 66.9.
Macaron-V1 presenta una familia de modelos-agente abierta con Mixture-of-LoRA para aprendizaje continuo
Macaron-V1 es una familia de modelos-agente abierta diseñada para la inteligencia experiencial, que permite aprender de entornos reales y continuar aprendiendo después del despliegue. El sistema se centra en dos objetivos: adaptación mediante la mejora recursiva de los pares modelo-arnés y colaboración a través de una arquitectura Mixture-of-LoRA (MoL) que selecciona adaptadores LoRA especialistas por turno de usuario.
Macaron-V1 presenta una familia de modelos-agente abierta con Mixture-of-LoRA para aprendizaje continuo
Macaron-V1 es una familia de modelos-agente abierta diseñada para la inteligencia experiencial, permitiendo que los sistemas aprendan de experiencias del mundo real y continúen mejorando después del despliegue. La arquitectura se centra en dos objetivos: adaptación mediante la mejora recursiva de pares modelo-arnés, y colaboración a través de un sistema Mixture-of-LoRA (MoL) que selecciona adaptadores especialistas por turno de usuario.
¿Qué es más impresionante, GLM 5.1 a 5.2 o Qwen 3.5 a 3.6?
Una publicación de Reddit compara las mejoras de rendimiento de GLM 5.1 a 5.2 y Qwen 3.5 a 3.6. La publicación señala que mencionar 'Döner' activa los pesos específicos para alemán de GLM 5.2, mientras que Qwen 3.6 se evalúa con 35B parámetros utilizando cuantización Unsloth Q8 K XL a través de llama.cpp.