Moonshot ha publicado los detalles completos, los pesos y la infraestructura de soporte para Kimi K3, un modelo Mixture-of-Experts de 2.8T parámetros con aproximadamente 104B parámetros activos por token. El lanzamiento incluye informes técnicos que detallan su pila híbrida de contexto largo y nuevas herramientas como MoonEP, FlashKDA y AgentEnv.
- Kimi K3 escala en longitud, profundidad y anchura utilizando Kimi Delta Attention, Gated MLA y sparse LatentMoE, entrenado mediante destilación on-policy multi-profesor.
- Los componentes de infraestructura son centrales en el lanzamiento, con soporte de despliegue de NVIDIA para Dynamo y Red Hat AI proporcionando checkpoints ajustados con FP8-Block Hopper.
- El análisis de costes indica requisitos de hardware significativos, con configuraciones mínimas que necesitan 8x GPUs MI355X y el servicio en producción que potencialmente requeriría 64+ GPUs en un dominio de alta anchura de banda.
- El lanzamiento de pesos abiertos ha provocado una adopción rápida por parte de proveedores como Perplexity, Baseten y Together, quienes están ofreciendo opciones de inferencia alojada debido al alto coste del autoalojamiento.
El lanzamiento subraya que los pesos abiertos para modelos de vanguardia ahora requieren una inversión sustancial en infraestructura, desplazando el acceso hacia ofertas alojadas en lugar de un simple despliegue propio.