Tema · Open weights
lab Microsoft Research Blog · hace 2 d · 40 vistas

Microsoft lanza RetroChimera para la predicción de retrosíntesis

Microsoft Research ha publicado y liberado como código abierto RetroChimera, un nuevo marco de trabajo para la predicción de retrosíntesis que combina dos modelos complementarios para proponer rutas de síntesis de alta calidad. El sistema integra R-SMILES 2, un modelo de-novo basado en Transformer, con NeuralLoc, un modelo basado en redes neuronales gráficas (GNN), utilizando una estrategia de ensamble aprendida para clasificar las predicciones.

lab Tencent Hunyuan (HF) · hace 27 d · 70 vistas

Tencent lanza el modelo MoE Hy4-preview con 770B de parámetros

El equipo Tencent Hy ha liberado como código abierto Hy4-preview, un nuevo modelo insignia Mixture-of-Experts de nueva generación que comprende 770B de parámetros totales con 49B activados por token. La arquitectura cuenta con 78 capas donde la primera utiliza una FFN densa y las restantes 77 usan MoE con 256 expertos enrutados, junto a una capa nativa MTP para decodificación especulativa.

media MarkTechPost · hace 14 d · 52 vistas

DeepSeek lanza DeepSeek-V4.1-Flash con contexto de 1M y caché KV FP4

DeepSeek AI ha lanzado DeepSeek-V4.1-Flash, un modelo multimodal Mixture-of-Experts que cuenta con una ventana de contexto de 1 millón de tokens y una caché KV FP4 que reduce la huella global de la caché a 890 bytes por token. El modelo utiliza una arquitectura de codificador-decodificador causal y Compressed Sparse Attention 2 (CSA2) para reducir significativamente los requisitos de memoria mientras mantiene el rendimiento.

lab Tencent Hunyuan (HF) · hace 27 d · 67 vistas

Tencent lanza la versión preliminar del modelo MoE Hy4 con 770B parámetros

El equipo Tencent Hy ha liberado como código abierto Hy4 preview, un nuevo modelo insignia de Mezcla de Expertos (Mixture-of-Experts) de nueva generación que comprende 770B de parámetros totales con 49B activados por token. La arquitectura cuenta con 78 capas donde la primera utiliza una FFN densa y las restantes 77 usan MoE con 256 expertos enrutados, junto con una capa nativa MTP para descodificación especulativa.

media MarkTechPost · hace 28 d · 89 vistas

Z.ai lanza GLM-5.3-Flash, un MoE multimodal de 320B-A18B con contexto de 1M

Z.ai ha lanzado GLM-5.3-Flash, el primer modelo nativamente multimodal de la serie GLM-5, que presenta una arquitectura de mezcla de expertos con 320 mil millones de parámetros totales y 18 mil millones activos por token. El modelo admite entradas de imagen y video dentro de una ventana de contexto de 1,048,576 tokens y está disponible bajo una licencia MIT en Hugging Face.

media MarkTechPost · hace 29 d · 76 vistas

El equipo de Qwen de Alibaba lanza Qwen3.8-Flash-Next, una vista previa de 125B que antecede a Qwen4

El equipo de Qwen de Alibaba ha lanzado Qwen3.8-Flash-Next, un modelo Mixture-of-Experts multimodal de pesos abiertos diseñado para anticipar la arquitectura de la próxima serie Qwen4. El punto de control combina una columna vertebral de 125B con una tabla de incrustaciones N-gram de 51B y un módulo de predicción multi-token de 4B, activando solo 6B parámetros por token.