Подробный анализ показывает KLD (разделение Кульбака-Лейбера) квантования кэша KV для моделей Qwen3.6-35B-A3B и Gemma4-E2B. Результаты показывают, что квантование q8/q8 практически без потерь на обеих моделях, в то время как q4/q4 работает хорошо на Qwen, но приводит к серьезной деградации на Gemma. Варианты турбо-квантования показывают разнородную производительность: турбо3 и турбо2 обеспечивают экстремальную сжатие кэша, но при значительной потере точности.
Анализ KLD квантования кэша KV для моделей Qwen3.6-35B-A3B и Gemma4-E2B QAT
Дистилляция deepseek-r1:8B в Qwen3-0.6B обеспечивает быстрое структурированное обогащение текста на устройстве
Исследователи демонстрируют, что дистилляция 8B учителя рассуждений (deepseek-r1:8B) в 0.6B модель-студент (Qwen3-0.6B через QLoRA) позволяет выполнять высокообъемное структурированное извлечение с существенно меньшей задержкой и стоимостью. Исследование оценивает этот подход на сопоставлении новостных статей с JSON-объектами, содержащими резюме и категориальные метки, сравнивая дистиллированную модель с базовыми вариантами few-shot промптинга и ограниченного декодирования.
SpectralQuant Qwen3.5 0.8B Q4_K_M восстанавливает 96,5% разрыва с BF16
Компания Spectral Labs выпустила кандидата в релизы для калибровки-осознанного квантования Q4_K_M модели Qwen3.5 0.8B, используя новый метод под названием SpectralQuant. Этот подход направлен на то, чтобы стандартные форматы Q4_K_M вели себя ближе к более крупным форматам квантования, сохраняя при этом совместимость с llama.cpp.
Автоматизированная семантическая локализация ошибок в SysML v2 с использованием LLM, дополненных графом знаний
В данной статье представлен фреймворк с участием человека для автоматического выявления и исправления семантических ошибок в моделях SysML v2, которые не могут быть обнаружены компиляторами. Подход объединяет дообученные малые языковые модели (Small Language Models) с графом предметных знаний, чтобы обосновать предложения по исправлению в рамках корректных инженерных ограничений.
Оценка бенчмарка малых языковых моделей для арабской NLP
Бенчмарк из 240 арабских тестовых заданий в восьми областях и десяти навыках оценивает двенадцать малых языковых моделей в нулевом режиме. Gemma 3 (12B) достигла наивысшей общей оценки (4,548/5), за ним следуют Aya и C4AI Command Arabic, производительность которых связана больше с арабской настройкой и выполнением инструкций, чем с размером модели. Общие недостатки включают утечку промпта, халлюцинации и слабое выполнение задач.
Оценка бенчмарка малых языковых моделей для арабской NLP
Бенчмарк из 240 арабских тестовых заданий в восьми областях и десяти навыках оценивает двенадцать малых языковых моделей в нуля-шот условиях. Gemma 3 (12B) достигла наивысшей общей оценки (4,548/5), за ним следуют Aya и C4AI Command Arabic, производительность которых связана больше с арабской настройкой и выполнением инструкций, чем с размером модели. Общие неисправности включают утечку промпта, халлюцинации и слабое выполнение задач.