HauhauCS выпустил две новые несексуризированные сбалансированные версии моделей Gemma 4: Gemma4-26B-A4B и Gemma4-31B-QAT. Оба варианта включают черновики для многозапросного предсказания (MTP) для обеспечения спекулятивного декодирования, что приводит к значительному ускорению вывода. Модель 26B-A4B демонстрирует примерно 35% прирост скорости, а модель 31B — увеличение на 53%, при этом качество вывода остаётся идентичным благодаря механизму черновиков модели. Эти релизы используют квантование, учитывающее QAT, что делает формат Q4_K_M оптимальным, поскольку более высокая точность не даёт улучшения качества для этих конкретных моделей. Модель 26B-A4B представляет собой архитектуру Mixture of Experts с примерно 4 миллиардами активных параметров на токен, тогда как вариант 31B является плотной моделью, предлагающей более высокие возможности для пользователей с достаточным объёмом VRAM. Обе модели поддерживают работу с изображениями через файлы mmproj и сохраняют контекстное окно длиной 262K токенов. Автор отмечает, что тестирование GenRM не выявило ни одного отказа в ответе на 465 запросов, подтверждая их несексуризированный характер.
Выпущены несексуризированные сбалансированные Gemma4-26B-A4B и 31B-QAT со ускорением за счёт MTP
Specific Labs направляет Gemma-4-31B на отклонение ложных предпосылок без влияния на бенчмарки
Компания Specific Labs выпустила Gemma-4-31B-AntiHal, вариант модели Gemma-4-31B, который оспаривает запросы, основанные на ложных предпосылках, вместо того чтобы галлюцинировать вместе с ними. Модель достигает этого за счет управления представлением на основе интерпретируемости, применяемого к остаточному потоку во время генерации.
Gemma 4 E2B работает со скоростью 255 токенов в секунду в браузере с использованием WebGPU
Gemma 4 E2B достигает скорости 255 токенов в секунду в браузере на устройстве M4 Max с использованием ядер WebGPU. Демо и ядра теперь доступны на Hugging Face для публичного использования.
Google выпустила TimesFM-3 — модель с 330 млн параметров для нативного многомерного прогнозирования
Google Research выпустила TimesFM-3, третье поколение своей базовой модели временных рядов, работающей в режиме zero-shot. Основное обновление по сравнению с версией 2.5 — нативная поддержка многомерных входных данных, позволяющая модели обрабатывать несколько одновременных целевых переменных и ковариат без дообучения.
IFM выпустила K2-Horizon-MoVA-36B-A4B, разреженную MoE-модель с 4B активных параметров
IFM выпустила финальный чекпоинт для K2-Horizon-MoVA-36B-A4B, модели Mixture-of-Experts с механизмом внимания Mixture-of-Values, которая хранит 36B параметров, но использует только 4B на токен. В релиз входят форматы GGUF и ссылки на более мелкие варианты семейства K2-Horizon.
llama.cpp добавляет поддержку NVIDIA Nemotron-3-Puzzle-75B-A9B
llama.cpp вводит поддержку модели NVIDIA Nemotron-3-Puzzle-75B-A9B, обеспечивая вывод для этой архитектуры Mixture of Experts. Обновление реализует инфраструктуру для переменных размеров feed-forward экспертов на слой и маршрутизации top-k, что необходимо, поскольку модель имеет 40 слоев MoE с различными значениями n_ff_exp и top-k.