AI Model Radar publica una metodología para calcular si los 46 modelos de pesos abiertos rastreados caben en hardware específico, rechazando reglas folclóricas comunes que pueden estar equivocadas por factores de cuatro o cuarenta. El sitio determina la capacidad al sumar los tamaños medidos de los pesos GGUF, la aritmética de caché de contexto desde archivos de configuración y la sobrecarga en tiempo de ejecución, mientras se tienen en cuenta mecanismos de atención híbrida como ventanas deslizantes y atención latente multi-cabeza.

  • Los pesos se toman de los tamaños en bytes publicados en lugar de los recuentos de parámetros para evitar errores de división de fragmentos.
  • La caché de contexto se calcula utilizando tipos de capa (completa vs. ventana deslizante) y dimensiones de cabeza explícitamente declaradas en config.json.
  • Se mantiene un margen de seguridad del 12% para GPUs estándar, mientras que Apple Silicon utiliza el 70% de la memoria unificada debido a las restricciones de macOS.
  • Para una RTX 3060 de 12 GB, el análisis muestra que 14 modelos caben en contexto de 8K y 10 en contexto de 32K; Qwen3 14B requiere descargue incluso en 8K.

Los autores se niegan a publicar puntuaciones de velocidad o calidad, centrándose únicamente en datos reproducibles de capacidad de memoria para ayudar a los usuarios a determinar la compatibilidad del hardware sin adivinar.