Moonshot ha publicado los pesos de su modelo Kimi K3 en Hugging Face, con 2,8 billones de parámetros y una arquitectura mixture-of-experts con 16 expertos activos por token. El equipo planea implementar el modelo en GPUs A100, H200 y B300, con resultados de benchmarks esperados esta semana.
- Kimi K3 utiliza entrenamiento consciente de cuantización en MXFP4, resultando en aproximadamente 1,4 TB de pesos.
- La implementación en 8x A100 requiere tres nodos debido a limitaciones de memoria y carece de soporte nativo para FP4.
- Una configuración con 8x H200 también requiere al menos dos nodos, incurriendo en costos de interconexión.
- Solo la configuración 8x B300 permite alojar todo el modelo en un solo nodo con espacio para KV cache.
Los autores proporcionarán métricas de tokens por segundo, tiempo hasta el primer token y costo para las tres configuraciones de GPU a finales de esta semana.