Un pipeline híbrido ANN-SNN utiliza codificadores EfficientNet preentrenados y convierte sus activaciones en trenes de picos mediante codificación por tasa. El sistema entrena un clasificador spiking CoLaNET con reglas de plasticidad local, logrando una precisión del 99.09% en el benchmark de 64 clases de ImageNet, igualando a las redes profundas convencionales.
Pipeline híbrido ANN-SNN con plasticidad local
Reutilización de un clasificador de voz para generación basada en difusión
Un clasificador de voz preentrenado se reutiliza como columna vertebral para la generación de voz guiada por difusión. Al adjuntar una subred ligera y entrenarla bajo emparejamiento de puntuaciones de desvanecimiento, el enfoque logra alta calidad de voz con menor consumo de memoria y costo computacional, utilizando un único modelo en lugar de dos componentes entrenados por separado.
Fusión global aprendible para tokenización de longitud variable en Transformers de difusión
Un nuevo tokenizador de longitud variable utiliza fusión global aprendible para permitir la alineación de representaciones entre longitudes en modelos de difusión. Este enfoque independiente de los datos supera la semántica dependiente de la posición y mejora el equilibrio entre calidad y costo computacional en la generación de ImageNet 256×256 en comparación con métodos anteriores.
SLAI T-Rex permite el entrenamiento posterior de todos los parámetros de DeepSeek-V4 en Ascend SuperPOD
SLAI presenta T-Rex, un marco de optimización de extremo a extremo para el entrenamiento posterior de todos los parámetros de modelos MoE a escala de billones de parámetros en Ascend NPU SuperPOD. Utilizando la familia de modelos DeepSeek-V4 como carga de trabajo objetivo, el sistema aborda la presión de memoria y la sobrecarga de comunicación mediante paralelismo jerárquico y optimizaciones de ejecución de kernels.
SLAI T-Rex permite el postentrenamiento de parámetros completos de DeepSeek-V4 en Ascend SuperPOD
SLAI presenta T-Rex, un marco de optimización de extremo a extremo para el postentrenamiento de parámetros completos de modelos MoE a escala de billones de parámetros en Ascend NPU SuperPOD. Utilizando la familia de modelos DeepSeek-V4 como carga de trabajo objetivo, el sistema aborda la presión de memoria y la sobrecarga de comunicación mediante paralelismo jerárquico y optimizaciones de ejecución de kernels.
NVIDIA NeMo Automodel permite el ajuste fino distribuido de modelos de difusión con Hugging Face Diffusers
NVIDIA y Hugging Face han integrado NVIDIA NeMo Automodel con la biblioteca 🤗 Diffusers para proporcionar entrenamiento distribuido de nivel de producción para modelos de difusión de código abierto. Esta colaboración permite a los usuarios ajustar cualquier modelo en formato Diffusers en el Hub de Hugging Face sin requerir conversión de puntos de control ni reescritura del código del modelo.