AI Model Radar публикует методологию расчёта того, помещаются ли 46 отслеживаемых моделей с открытыми весами на конкретное оборудование, отвергая распространённые народные правила, которые могут давать погрешность в четыре или сорок раз. Сайт определяет вместимость, суммируя измеренные размеры весов GGUF, арифметику кэша контекста из файлов конфигурации и накладные расходы времени выполнения, учитывая гибридные механизмы внимания, такие как скользящие окна и многоголовое латентное внимание.
- Веса берутся из опубликованных размеров в байтах, а не из количества параметров, чтобы избежать ошибок разделения на шарды.
- Кэш контекста вычисляется с использованием типов слоёв (полные vs. скользящее окно) и измерений голов, явно указанных в config.json.
- Для стандартных GPU сохраняется запас прочности 12%, тогда как Apple Silicon использует 70% объединённой памяти из-за ограничений macOS.
- Для RTX 3060 12 ГБ анализ показывает, что при контексте 8K помещаются 14 моделей и 10 при контексте 32K; Qwen3 14B требует выгрузки даже при 8K.
Авторы отказываются публиковать оценки скорости или качества, фокусируясь исключительно на воспроизводимых данных о вместимости памяти, чтобы помочь пользователям определять совместимость оборудования без догадок.