Пользователь спрашивает, у кого есть достаточные вычислительные ресурсы, чтобы создать большой дистилляционный датасет из 700 000 до 1 миллиона примеров из GLM5.2. Цель — улучшить обучение более маленьких моделей, таких как Qwen3.5, и помочь более широкой сообществу.
У кого есть достаточно вычислительных ресурсов, чтобы создать дистилляционный датасет из GLM5.2?
Z.ai и Alibaba независимо пришли к архитектуре линейного внимания 3:1 для GLM-5.3-Flash и Qwen3.8-Flash-Next
Z.ai выпустила GLM-5.3-Flash, мультимодальную MoE-модель с 320B параметров и 18B активных параметров, в то время как команда Alibaba Qwen выпустила Qwen3.8-Flash-Next, модель на 125B с 6B активных параметров. Несмотря на независимую разработку, обе команды приняли почти идентичные архитектурные конфигурации.
Z.ai запускает модель для кодинга GLM-5.3; Cursor присоединяется к SpaceXAI
Z.ai выпустила GLM-5.3, модель для кодинга и кибербезопасности, созданную на основе дообучения (post-training) своей базовой модели 743B, а не нового препроцессинга (pretraining). В релиз включены конкретные результаты бенчмарков: Terminal Bench 3.0 — 28.3 и DeepSWE — 66.9.
Macaron-V1 представляет открытое семейство агентных моделей с Mixture-of-LoRA для непрерывного обучения
Macaron-V1 — это открытое семейство агентных моделей, предназначенное для экспериментального интеллекта, позволяющее учиться на основе реальных сред и продолжать обучение после развертывания. Система сосредоточена на двух целях: адаптация через рекурсивное улучшение пар модель-обвязка (model-harness) и сотрудничество посредством архитектуры Mixture-of-LoRA (MoL), которая выбирает специализированные адаптеры LoRA для каждого пользовательского хода.
Macaron-V1 представляет открытое семейство агентов-моделей с Mixture-of-LoRA для непрерывного обучения
Macaron-V1 — это открытое семейство агентов-моделей, предназначенное для экспериментального интеллекта, позволяющее системам учиться на реальном опыте и продолжать совершенствоваться после развертывания. Архитектура сосредоточена на двух целях: адаптация через рекурсивное самосовершенствование пар модель- harness, и сотрудничество посредством системы Mixture-of-LoRA (MoL), которая выбирает специализированные адаптеры для каждого пользовательского хода.
Что более впечатляет: GLM 5.1 до 5.2 или Qwen 3.5 до 3.6?
Пост на Reddit сравнивает улучшения производительности GLM 5.1 до 5.2 и Qwen 3.5 до -3.6. В посте отмечается, что упоминание 'Döner' активирует специализированные веса GLM 5.2 на немецком языке, в то время как Qwen 3.6 оценивается с использованием 35B параметров и Quantization Unsloth Q8 K XL через llama.cpp.