Gemma 4 E2B достигает скорости 255 токенов в секунду в браузере на устройстве M4 Max с использованием ядер WebGPU. Демо и ядра теперь доступны на Hugging Face для публичного использования.
Gemma 4 E2B работает со скоростью 255 токенов в секунду в браузере с использованием WebGPU
Google обновляет шаблоны чата Gemma 4 с исправлениями вызова инструментов и поддержкой Flash Attention 4
Google выпустила обновление для модели Gemma 4, которое изменяет её шаблоны чата. Изменения устраняют серьёзные проблемы с возможностями вызова инструментов и снижают «ленивость» ответов модели.
Specific Labs направляет Gemma-4-31B на отклонение ложных предпосылок без влияния на бенчмарки
Компания Specific Labs выпустила Gemma-4-31B-AntiHal, вариант модели Gemma-4-31B, который оспаривает запросы, основанные на ложных предпосылках, вместо того чтобы галлюцинировать вместе с ними. Модель достигает этого за счет управления представлением на основе интерпретируемости, применяемого к остаточному потоку во время генерации.
Zer0Fit оборачивает TabFM и TimesFM от Google в локальный MCP-сервер
Разработчик создал Zer0Fit, реализацию с открытым исходным кодом, которая предоставляет фундаментальные модели Google TabFM и TimesFM в виде сервера Model Context Protocol (MCP) для задач машинного обучения без дообучения. Проект позволяет пользователям выполнять прогнозирование, классификацию и регрессию локально, без создания или обучения пользовательских моделей.
Выпущены несексуризированные сбалансированные Gemma4-26B-A4B и 31B-QAT со ускорением за счёт MTP
HauhauCS выпустил две новые несексуризированные сбалансированные версии моделей Gemma 4: Gemma4-26B-A4B и Gemma4-31B-QAT. Оба варианта включают черновики для многозапросного предсказания (MTP) для обеспечения спекулятивного декодирования, что приводит к значительному ускорению вывода. Модель 26B-A4B демонстрирует примерно 35% прирост скорости, а модель 31B — увеличение на 53%, при этом качество вывода остаётся идентичным благодаря механизму черновиков модели. Эти релизы используют квантование, учитывающее QAT, что делает формат Q4_K_M оптимальным, поскольку более высокая точность не даёт улучшения качества для этих конкретных моделей. Модель 26B-A4B представляет собой архитектуру Mixture of Experts с примерно 4 миллиардами активных параметров на токен, тогда как вариант 31B является плотной моделью, предлагающей более высокие возможности для пользователей с достаточным объёмом VRAM. Обе модели поддерживают работу с изображениями через файлы mmproj и сохраняют контекстное окно длиной 262K токенов. Автор отмечает, что тестирование GenRM не выявило ни одного отказа в ответе на 465 запросов, подтверждая их несексуризированный характер.
Выпуск llama.cpp b9741: новые бинарные файлы и поддержка
Версия llama.cpp b9741 добавляет новые бинарные файлы для macOS, Linux, Android, Windows и openEuler на нескольких архитектурах. В релиз включена поддержка Vulkan, CUDA 12.4 и 13.3, OpenVINO, SYCL и ROCm, а также обновлены версии для iOS и Ubuntu.