В предложениях на форумах Hugging Face описан общий слой выполнения и управления памятью GPU, предназначенный для разделения кода приложений от конкретных аппаратных поставщиков, таких как NVIDIA, AMD и Intel. Цель состоит в том, чтобы позволить пользователям указывать бюджет памяти вместо ручной настройки специфичных для бэкенда флагов, карт устройств или стратегий выгрузки.
- Рантайм будет автоматически определять размещение слоёв, выбор точности (INT4, INT8, FP8) и управление KV-кэшем на основе доступной VRAM.
- Вводится иерархическая модель памяти с уровнями для локальной VRAM GPU, расширенной памяти, системной RAM и хранилища NVMe.
- Типы данных с низкой точностью предлагаются в качестве полноправных функций рантайма, чтобы буферы деквантования не сводили на нет преимущества квантования.
- Архитектура направлена на то, чтобы сделать вывод моделей класса 13B в INT4 практичным на потребительских GPU с 12 ГБ памяти за счёт контроля полного объёма используемой рантаймом памяти.
Этот подход стремится решить проблемы фрагментированной совместимости программного обеспечения и ограничений VRAM, позволяя ИИ-нагрузкам эффективно работать на рынке GPU от разных поставщиков без жёсткой привязки к CUDA или другим специфичным для вендоров бэкендам.