O Radar de Modelos de IA publica uma metodologia para calcular se os 46 modelos de pesos abertos monitorados cabem em hardware específico, rejeitando regras comuns de folclore que podem estar erradas por fatores de quatro ou quarenta. O site determina o ajuste somando os tamanhos medidos dos pesos GGUF, a aritmética do cache de contexto dos arquivos de configuração e a sobrecarga de tempo de execução, enquanto leva em conta mecanismos de atenção híbrida como janelas deslizantes e atenção latente multi-cabeça.
- Os pesos são obtidos a partir dos tamanhos em bytes publicados, em vez de contagens de parâmetros, para evitar erros de divisão de fragmentos.
- O cache de contexto é calculado usando os tipos de camada (completa vs. janela deslizante) e as dimensões das cabeças explicitamente declaradas no config.json.
- Uma margem de segurança de 12% é mantida para GPUs padrão, enquanto o Apple Silicon usa 70% da memória unificada devido às restrições do macOS.
- Para uma RTX 3060 de 12 GB, a análise mostra que 14 modelos cabem com contexto de 8K e 10 com contexto de 32K; o Qwen3 14B requer descarregamento mesmo em 8K.
Os autores se recusam a publicar pontuações de velocidade ou qualidade, focando exclusivamente em dados reprodutíveis de ajuste de memória para ajudar os usuários a determinar a compatibilidade de hardware sem chutes.