Анализ затрат показывает, что хостинг diffusiongemma при различных уровнях токенов пользователей приводит к ежемесячным расходам на пользователя от 1,7 евро до 122,8 евро. Исследование показывает, что использование агентного ИИ экономически нецелесообразно для совместного хостинга, хотя расходы могут снизиться при появлении новых GPU или ASIC и сокращении срока износа GPU.
Написанное на листке бумаги математика по совокупным расходам на хостинг diffusiongemma в 2026 году
Эмпирическое исследование квантования OpenPangu на NPUs Ascend
Управляемое исследование оценивает модели OpenPangu 1B и 7B на NPUs Huawei Ascend 910B1 с использованием методов квантования только весов и весов-активации. Результаты показывают, что квантование только весов на 8 бит является без потерь для обеих моделей, в то время как квантование на 4 бита является практическим для модели 7B, но вредным для модели 1B при выполнении задач по логике, математике и программированию. Методы экстремально низкой точности, такие как 2 бита и бинарные, не срабатывают, и W4A4 SmoothQuant приводит к неопределённому перплексити, что указывает на сложность экстремального сжатия на низких битах.
webAI выпускает TwIL-LM — семейство формально-логических моделей на 1,7B и 3B параметров для локальной автоформализации
webAI выпустила TwIL-LM, семейство из двух логических вычислителей с 1,7B и 3B параметров, предназначенных для автоформализации на локальном оборудовании. Модели переводят английский текст в логику первого порядка и проверяют корректность заключений; вариант на 3B параметров достигает макросреднего показателя 0,4218 на задачах формальной логики из обучающей области.
QuantCheck предупреждает против предположения, что финальный чекпоинт лучше всего подходит для 4-битного квантования
Новый инструмент QuantCheck подчеркивает, что финальный чекпоинт предварительного обучения может не быть оптимальным выбором для 4-битного квантования, поскольку бенчмарки могут оставаться плоскими, в то время как хрупкость увеличивается. Автор наблюдал эту закономерность на Pythia-160m, где финальный чекпоинт suffered примерно в четыре раза больше повреждений качества, чем более ранний чекпоинт того же качества.
Meituan выпустила LongCat-Flash-Lite-Sparse с контекстным окном в 1M
Meituan выпустила веса для LongCat-Flash-Lite-Sparse, нового варианта своей модели LongCat-Flash-Lite. Обновление внедряет LongCat Sparse Attention (LSA) для замены плотного MLA и расширяет нативную поддержку длины контекста до 1 миллиона токенов.
OSReward представляет стандартизированную оценку моделей вознаграждения для кроссплатформенного использования компьютера
Исследователи представляют OSReward, реалистичный бенчмарк, предназначенный для оценки надежности моделей «визуальный язык» (VLM), выступающих в роли судей для траекторий агентов, использующих компьютер. Исследование показывает, что даже самые современные VLM страдают от систематической предвзятости к снисходительности и часто слишком дороги для масштабирования, тогда как доступные открытые модели работают плохо.