El artículo calcula qué modelos de lenguaje grande (LLM) de código abierto caben en los nuevos Macs de la serie Apple M5 (Mac mini, Mac Studio) analizando las restricciones de memoria en lugar de ejecutar benchmarks. Determina la capacidad basándose en los tamaños de archivos GGUF Q4_K_M, los requisitos de caché KV y la sobrecarga del tiempo de ejecución frente a la memoria GPU utilizable.
- El Mac mini M6 de 16 GB admite 14 modelos con un contexto de 8K y 10 con un contexto de 32K, siendo Gemma 4 12B la mejor opción.
- El Mac mini M5 Pro de 24 GB admite 16 modelos con un contexto de 8K y 14 con un contexto de 32K, favoreciendo a gpt-oss 20B.
- El Mac Studio M5 Max de 36 GB acomoda 25 modelos con un contexto de 8K y 22 con un contexto de 32K, siendo Qwen3-Coder 30B-A3B la opción preferida.
- El Mac Studio M5 Ultra de 96 GB admite 31 modelos independientemente de la longitud del contexto, siendo Qwen3-Coder Next el ajuste más grande cómodo.
El análisis destaca que el Mac mini de 16 GB es una máquina de clase 12B limitada por la ventana de contexto en lugar del tamaño del modelo, mientras que la gran caché del Ultra hace que la longitud del contexto sea irrelevante para el ajuste. El autor señala que estas cifras no indican la velocidad de generación, aunque las diferencias de ancho de banda entre modelos son significativas.