본 기사는 Bonsai 27B를 소개하며, 이는 모바일 폰에서 실행할 수 있는 동급 최초의 모델로 설명됩니다.
소스 텍스트에는 추가 세부 사항이나 특정 기능이 제공되지 않았습니다.
본 기사는 Bonsai 27B를 소개하며, 이는 모바일 폰에서 실행할 수 있는 동급 최초의 모델로 설명됩니다.
소스 텍스트에는 추가 세부 사항이나 특정 기능이 제공되지 않았습니다.
이 기사는 완전 정밀 원본보다 우수한 성능을 달성하는 압축된 4비트 모델을 생성하기 위한 Quantization-Aware Healing 방법을 소개합니다.
Meta는 모바일 기기의 품질-효율성 트레이드오프를 최적화하도록 설계된 모바일 기기용 Mixture-of-Experts (MoE) 언어 모델 컬렉션인 MobileMoE를 출시했습니다. 이 패밀리는 서브-10억 활성 파라미터와 INT4 형식으로 3 GB 미만의 가중치 크기를 가진 세 가지 모델 스케일을 포함합니다.
저자들은 Quantization-Aware Healing (QAH)을 소개했습니다. 이는 구조적 압축 및 양자화 동안 손실된 성능을 회복하기 위해 비압축 모델에서 직접 4비트 학생 모델을 증류하는 파이프라인입니다. GPT-OSS 120B에 적용하면 이 방법은 Hypernova-60B를 생성하며, 9개 벤치마크 중 7개에서 bfloat16 소스와 동등하거나 더 나은 성능을 보이며 가중치 메모리를 약 4배 적게 사용합니다.
저자들은 구조적으로 압축된 4비트 대규모 언어 모델의 추론 및 코딩 능력을 복원하는 방법인 양화 인식 치유(Quantization-Aware Healing, QAH)를 소개합니다. 표준 양화 인식 훈련이 압축된 모델을 다시 적합시키는 것과 달리, QAH는 원래 비압축 모델에서 4비트 학생 모델을 직접 증류합니다.
Joakimpalm-Zen이 Xyntetik Runner를 업데이트하여, 추론에 사용되는 동일한 양자화된 GGUF 가중치를 사용하여 LoRA 어댑터를 직접 학습하도록 했으며, 별도의 FP16 학습 복사본이나 런타임의 필요성을 제거했습니다.
트래픽 측정과 사이트 개선을 위해 쿠키를 사용합니다. 분석 쿠키를 허용하거나 거부할 수 있습니다. 개인정보처리방침