L'article calcule quels grands modèles de langage ouverts tiennent dans les nouveaux Macs de la série Apple M5 (Mac mini, Mac Studio) en analysant les contraintes mémoire plutôt qu'en exécutant des benchmarks. Il détermine la capacité en fonction des tailles de fichiers GGUF Q4_K_M, des exigences du cache KV et de la surcharge d'exécution par rapport à la mémoire GPU utilisable.
- Le Mac mini M6 de 16 Go prend en charge 14 modèles avec un contexte de 8K et 10 avec un contexte de 32K, Gemma 4 12B étant le meilleur choix.
- Le Mac mini M5 Pro de 24 Go prend en charge 16 modèles avec un contexte de 8K et 14 avec un contexte de 32K, favorisant gpt-oss 20B.
- Le Mac Studio M5 Max de 36 Go prend en charge 25 modèles avec un contexte de 8K et 22 avec un contexte de 32K, Qwen3-Coder 30B-A3B étant l'option préférée.
- Le Mac Studio M5 Ultra de 96 Go prend en charge 31 modèles quelle que soit la longueur du contexte, Qwen3-Coder Next étant le plus grand modèle s'ajustant confortablement.
L'analyse met en évidence que le Mac mini de 16 Go est une machine de classe 12B limitée par la fenêtre de contexte plutôt que par la taille du modèle, tandis que le grand cache de l'Ultra rend la longueur du contexte sans importance pour l'ajustement. L'auteur note que ces chiffres n'indiquent pas la vitesse de génération, bien que les différences de bande passante entre les modèles soient significatives.