Hugging Face의 제안은 AI의 두 가지 상호 연결된 문제를 논의합니다: 개별 대형 모델을 훈련하는 의존성과 생태계의 범용 GPU에 대한 의존성.
- 저자는 "점진적 모델 성장"을 제안하며, 모델이 구조적으로 확장될 때(예: 4B에서 8B로) 각 크기마다 처음부터 시작하는 대신 학습된 표현을 보존합니다.
- 이 접근 방식은 고정 크기 지식 전달을 보완하여 구조적 확장이 필요하기 전에 모델이 더 많은 능력을 흡수할 수 있게 합니다.
- 하드웨어 제한을 해결하기 위해 저자는 트랜스포머를 위한 "AI 하드웨어 프로필"을 제안하며, 전용 ASIC 벤더를 위한 일반적인 작업(GEMM 및 어텐션 등)의 안정적인 세트를 정의합니다.
- 제안서는 모델 릴리스가 매개변수 수 alongside 토큰당 줄(Joule) 및 메모리 요구량과 같은 효율성 지표를 벤치마킹해야 한다고 주장합니다.
저자는 이러한 변경이 로컬 AI 사용자의 VRAM 제한을 극복하는 데 도움이 되고 하드웨어 제조업체에게 명확한 최적화 목표를 제공할 수 있다고 믿습니다.