이 기사는 완전 정밀 원본보다 우수한 성능을 달성하는 압축된 4비트 모델을 생성하기 위한 Quantization-Aware Healing 방법을 소개합니다.
이 접근 방식은 특정 양자화 기술이 기본 비양자화 버전의 한계를 넘어 모델 능력을 향상시킬 수 있음을 보여줍니다.
이 기사는 완전 정밀 원본보다 우수한 성능을 달성하는 압축된 4비트 모델을 생성하기 위한 Quantization-Aware Healing 방법을 소개합니다.
이 접근 방식은 특정 양자화 기술이 기본 비양자화 버전의 한계를 넘어 모델 능력을 향상시킬 수 있음을 보여줍니다.
Meta는 모바일 기기의 품질-효율성 트레이드오프를 최적화하도록 설계된 모바일 기기용 Mixture-of-Experts (MoE) 언어 모델 컬렉션인 MobileMoE를 출시했습니다. 이 패밀리는 서브-10억 활성 파라미터와 INT4 형식으로 3 GB 미만의 가중치 크기를 가진 세 가지 모델 스케일을 포함합니다.
저자들은 Quantization-Aware Healing (QAH)을 소개했습니다. 이는 구조적 압축 및 양자화 동안 손실된 성능을 회복하기 위해 비압축 모델에서 직접 4비트 학생 모델을 증류하는 파이프라인입니다. GPT-OSS 120B에 적용하면 이 방법은 Hypernova-60B를 생성하며, 9개 벤치마크 중 7개에서 bfloat16 소스와 동등하거나 더 나은 성능을 보이며 가중치 메모리를 약 4배 적게 사용합니다.
저자들은 구조적으로 압축된 4비트 대규모 언어 모델의 추론 및 코딩 능력을 복원하는 방법인 양화 인식 치유(Quantization-Aware Healing, QAH)를 소개합니다. 표준 양화 인식 훈련이 압축된 모델을 다시 적합시키는 것과 달리, QAH는 원래 비압축 모델에서 4비트 학생 모델을 직접 증류합니다.
Joakimpalm-Zen이 Xyntetik Runner를 업데이트하여, 추론에 사용되는 동일한 양자화된 GGUF 가중치를 사용하여 LoRA 어댑터를 직접 학습하도록 했으며, 별도의 FP16 학습 복사본이나 런타임의 필요성을 제거했습니다.
Liquid AI는 LFM2.5 계열의 세 가지 모델에 대한 DSpark 초안 모델 체크포인트를 출시했습니다: LFM2.5-1.2B-Instruct, LFM2.5-2.6B, 그리고 LFM2.5-8B-A1B입니다. 이러한 드래프터는 기존 타겟 모델에 추론 디코딩 경로를 추가하여, 약 3억 개의 파라미터를 가진 초안 모델이 단일 순전파로 타겟 모델이 검증할 수 있는 9개의 후보 토큰 블록을 제안할 수 있게 합니다.
트래픽 측정과 사이트 개선을 위해 쿠키를 사용합니다. 분석 쿠키를 허용하거나 거부할 수 있습니다. 개인정보처리방침