Qwen telah merilis bobot terbuka untuk model Qwen 3.8 27B-nya. Checkpoint tersedia di Hugging Face.
Qwen merilis bobot terbuka untuk Qwen 3.8 27B
ISTA merilis GGUF GSQ-RCO untuk Qwen3.8-Flash-Next dan build Coder yang memangkas 50% ahli
Lab Algoritma dan Sistem Deep ISTA telah merilis versi GGUF terkuantisasi dari model sparse mixture-of-experts Qwen3.8-Flash-Next, bersama dengan build eksperimental yang ditargetkan pada kemampuan tertentu dengan separuh ahlinya dihilangkan.
Quantization-Aware Healing memulihkan LLM 4-bit lebih cepat daripada QAT
Para penulis memperkenalkan Quantization-Aware Healing (QAH), sebuah pipa yang mendistilasi siswa 4-bit langsung dari model tanpa kompresi untuk memulihkan kinerja yang hilang selama kompresi struktural dan kuantisasi. Diterapkan pada GPT-OSS 120B, metode ini menghasilkan Hypernova-60B, yang menyamai atau mengalahkan sumber bfloat16 pada 7 dari 9 benchmark sambil menggunakan sekitar 4 kali lebih sedikit memori bobot.
Quantization-Aware Healing memulihkan LLM 4-bit lebih cepat dari QAT
Para penulis memperkenalkan Quantization-Aware Healing (QAH), sebuah metode untuk memulihkan kemampuan penalaran dan pemrograman pada model bahasa besar 4-bit yang terkompresi secara struktural. Berbeda dengan pelatihan sadar kuantisasi standar yang menyesuaikan ulang model terkompresi, QAH mendistilasi siswa 4-bit langsung dari model asli yang tidak terkompresi.
PrismML merilis Bonsai 27B, mengompresi Qwen3.6-27B ke bobot 1-bit dan ternary
PrismML telah merilis Bonsai 27B, sebuah kuantisasi bit-rendah dari model Qwen3.6-27B yang memungkinkan menjalankan model multimodal besar di laptop dan ponsel tanpa pelatihan ulang.
Qwen3.5 122B A10B dengan UD-Q2_K_XL muat di RAM 64GB dan meningkatkan pengetahuan internal
Seorang pengguna mendemonstrasikan bahwa Qwen3.5 122B A10B yang dikuantisasi dengan UD-Q2_K_XL dapat muat ke dalam 64GB RAM sistem, menggantikan opsi terbaik sebelumnya untuk batasan tersebut.