Hugging Face 포럼의 제안서는 NVIDIA, AMD, Intel과 같은 특정 하드웨어 벤더로부터 애플리케이션 코드를 분리하기 위해 설계된 공통 GPU 실행 및 메모리 관리 레이어를 개요로 제시합니다. 목표는 백엔드별 플래그, 디바이스 매핑 또는 오프로딩 전략을 수동으로 구성하는 대신 사용자가 메모리 예산을 지정할 수 있도록 하는 것입니다.
- 런타임은 사용 가능한 VRAM에 따라 레이어 배치, 정밀도 선택(INT4, INT8, FP8) 및 KV 캐시 관리를 자동으로 결정합니다.
- GPU 로컬 VRAM, 확장 메모리, 시스템 RAM, NVMe 저장소를 위한 티어로 구성된 계층적 메모리 모델을 도입합니다.
- 양자화 이점을 무효화하는 디쿼터라이제이션 버퍼를 방지하기 위해 저비트 데이터 타입을 1급 런타임 기능으로 제안합니다.
- 전체 런타임 메모리 발자국을 제어함으로써 12 GB 소비자용 GPU에서 13B 클래스 INT4 추론을 실용적으로 만드는 것을 목표로 합니다.
이 접근 방식은 단편화된 소프트웨어 호환성과 VRAM 제한 문제를 해결하여 CUDA 또는 기타 벤더별 백엔드에 긴밀하게 결합할 필요 없이 다중 벤더 GPU 시장에서 AI 워크로드가 효율적으로 실행되도록 합니다.