consejos de optimización de memoria GPU para llama.cpp

Los usuarios de llama.cpp pueden liberar memoria GPU desactivando la descarga de mmproj, utilizando tipos de caché KV reducidos y ajustando spec-draft-n-max. Parámetros como --ctx-checkpoints y --fit-target tienen un impacto mínimo, mientras que --parallel ayuda en configuraciones multiusuario pero no para usuarios individuales.