Sebuah proposal di forum Hugging Face menguraikan lapisan eksekusi GPU dan manajemen memori bersama yang dirancang untuk memisahkan kode aplikasi dari vendor perangkat keras tertentu seperti NVIDIA, AMD, dan Intel. Tujuannya adalah memungkinkan pengguna menentukan anggaran memori daripada secara manual mengonfigurasi flag khusus backend, peta perangkat, atau strategi offloading.

  • Runtime akan secara otomatis menentukan penempatan lapisan, pemilihan presisi (INT4, INT8, FP8), dan manajemen cache KV berdasarkan VRAM yang tersedia.
  • Ini memperkenalkan model memori hierarkis dengan tier untuk VRAM lokal GPU, memori ekspansi, RAM sistem, dan penyimpanan NVMe.
  • Tipe data bit rendah diusulkan sebagai fitur runtime kelas satu untuk mencegah buffer dequantisasi menggagalkan manfaat kuantisasi.
  • Arsitektur ini bertujuan membuat inferensi INT4 kelas 13B praktis pada GPU konsumen 12 GB dengan mengendalikan jejak memori runtime secara keseluruhan.

Pendekatan ini berupaya mengatasi kompatibilitas perangkat lunak yang terfragmentasi dan keterbatasan VRAM, memungkinkan beban kerja AI berjalan efisien di pasar GPU multi-vendor tanpa memerlukan kopling ketat ke CUDA atau backend khusus vendor lainnya.