Un pipeline híbrido ANN-SNN utiliza codificadores EfficientNet preentrenados y convierte sus activaciones en trenes de picos mediante codificación por tasa. El sistema entrena un clasificador spiking CoLaNET con reglas de plasticidad local, logrando una precisión del 99.09% en el benchmark de 64 clases de ImageNet, igualando a las redes profundas convencionales.
Pipeline híbrido ANN-SNN con plasticidad local
Reutilización de un clasificador de voz para generación basada en difusión
Un clasificador de voz preentrenado se reutiliza como columna vertebral para la generación de voz guiada por difusión. Al adjuntar una subred ligera y entrenarla bajo emparejamiento de puntuaciones de desvanecimiento, el enfoque logra alta calidad de voz con menor consumo de memoria y costo computacional, utilizando un único modelo en lugar de dos componentes entrenados por separado.
Fusión global aprendible para tokenización de longitud variable en Transformers de difusión
Un nuevo tokenizador de longitud variable utiliza fusión global aprendible para permitir la alineación de representaciones entre longitudes en modelos de difusión. Este enfoque independiente de los datos supera la semántica dependiente de la posición y mejora el equilibrio entre calidad y costo computacional en la generación de ImageNet 256×256 en comparación con métodos anteriores.
OpenEnv reproduce el modelo de acuarela de Surya Narreddi usando TRL
Un ingeniero ha liberado como código abierto una reproducción del proyecto viral de Surya Narreddi, que entrena un modelo de programación para pintar acuarelas utilizando JavaScript y aprendizaje por refuerzo. La implementación utiliza la biblioteca TRL y OpenEnv para crear un pipeline de extremo a extremo en Hugging Face para entrenamiento, puntuación e inferencia.
SLAI T-Rex permite el entrenamiento posterior de todos los parámetros de DeepSeek-V4 en Ascend SuperPOD
SLAI presenta T-Rex, un marco de optimización de extremo a extremo para el entrenamiento posterior de todos los parámetros de modelos MoE a escala de billones de parámetros en Ascend NPU SuperPOD. Utilizando la familia de modelos DeepSeek-V4 como carga de trabajo objetivo, el sistema aborda la presión de memoria y la sobrecarga de comunicación mediante paralelismo jerárquico y optimizaciones de ejecución de kernels.
SLAI T-Rex permite el postentrenamiento de parámetros completos de DeepSeek-V4 en Ascend SuperPOD
SLAI presenta T-Rex, un marco de optimización de extremo a extremo para el postentrenamiento de parámetros completos de modelos MoE a escala de billones de parámetros en Ascend NPU SuperPOD. Utilizando la familia de modelos DeepSeek-V4 como carga de trabajo objetivo, el sistema aborda la presión de memoria y la sobrecarga de comunicación mediante paralelismo jerárquico y optimizaciones de ejecución de kernels.