AI Model Radar는 특정 하드웨어에서 추적 중인 46개 오픈 가중치 모델이 적합한지 계산하는 방법론을 게시하며, 4배 또는 40배까지 벗어날 수 있는 일반적인 속설 규칙들을 거부합니다. 이 사이트는 GGUF 가중치 크기의 측정값 합산, 구성 파일의 컨텍스트 캐시 산술, 런타임 오버헤드를 더하고 슬라이딩 윈도우 및 멀티 헤드 잠재적 어텐션과 같은 하이브리드 어텐션 메커니즘을 고려하여 적합성을 결정합니다.
- 샤드 분할 오류를 피하기 위해 가중치는 매개변수 수가 아닌 게시된 바이트 크기에서 가져옵니다.
- 컨텍스트 캐시는 config.json에 명시된 레이어 유형(전체 vs 슬라이딩 윈도우) 및 헤드 차원을 사용하여 계산됩니다.
- 표준 GPU에는 12%의 안전 마진이 유지되며, Apple Silicon은 macOS 제약으로 인해 통합 메모리의 70%를 사용합니다.
- RTX 3060 12GB의 경우 분석 결과 8K 컨텍스트에서 14개 모델이 적합하고 32K 컨텍스트에서 10개가 적합하며, Qwen3 14B는 8K에서도 오프로딩이 필요합니다.
저자들은 속도나 품질 점수를 게시하는 것을 거부하고, 사용자가 추측 없이 하드웨어 호환성을 결정할 수 있도록 재현 가능한 메모리 적합성 데이터에만 집중합니다.