AI Model Radar publie une méthodologie pour calculer si les 46 modèles à poids ouverts suivis tiennent sur du matériel spécifique, rejetant les règles folkloriques courantes qui peuvent être erronées par un facteur de quatre ou quarante. Le site détermine l'adéquation en additionnant les tailles de poids GGUF mesurées, l'arithmétique du cache de contexte issue des fichiers de configuration et la surcharge d'exécution, tout en tenant compte des mécanismes d'attention hybrides tels que les fenêtres glissantes et l'attention latente multi-têtes.
- Les poids sont extraits des tailles en octets publiées plutôt que des comptes de paramètres pour éviter les erreurs de fractionnement des shards.
- Le cache de contexte est calculé à l'aide des types de couches (pleines vs à fenêtre glissante) et des dimensions de têtes explicitement indiquées dans config.json.
- Une marge de sécurité de 12 % est conservée pour les GPU standards, tandis que la Silicon d'Apple utilise 70 % de la mémoire unifiée en raison des contraintes de macOS.
- Pour une RTX 3060 de 12 Go, l'analyse montre que 14 modèles tiennent à un contexte de 8K et 10 à un contexte de 32K ; Qwen3 14B nécessite un déchargement même à 8K.
Les auteurs refusent de publier des scores de vitesse ou de qualité, se concentrant uniquement sur les données d'adéquation mémoire reproductibles pour aider les utilisateurs à déterminer la compatibilité matérielle sans deviner.