HauhauCS ha lanzado dos nuevas versiones equilibradas y sin censura de los modelos Gemma 4: Gemma4-26B-A4B y Gemma4-31B-QAT. Ambas variantes incorporan cabezales de borrador de predicción multi-tokeno (MTP) para habilitar la decodificación especulativa, lo que resulta en mejoras significativas de velocidad de inferencia. El modelo 26B-A4B logra un aumento de velocidad de aproximadamente el 35%, mientras que el modelo 31B experimenta un incremento del 53%, con una calidad de salida idéntica verificada por el mecanismo de borrado del modelo. Estos lanzamientos utilizan cuantización consciente de QAT, haciendo que Q4_K_M sea el formato óptimo ya que una mayor precisión no ofrece ganancias de calidad para estos modelos específicos. El 26B-A4B es una arquitectura de Mezcla de Expertos con aproximadamente 4 mil millones de parámetros activos por token, mientras que la variante 31B es un modelo denso que ofrece mayor capacidad para usuarios con suficiente VRAM. Ambos modelos incluyen soporte de visión a través de archivos mmproj y mantienen una ventana de contexto de 262K. El autor señala que las pruebas de GenRM resultaron en cero rechazos en 465 prompts, confirmando su naturaleza sin censura.
Gemma4-26B-A4B & 31B-QAT sin censura equilibrado lanzado con aceleraciones de velocidad MTP
Specific Labs dirige a Gemma-4-31B para rechazar premisas falsas sin impacto en benchmarks
Specific Labs ha lanzado Gemma-4-31B-AntiHal, una variante del modelo Gemma-4-31B que desafía las solicitudes basadas en premisas falsas en lugar de alucinar junto con ellas. El modelo logra esto mediante el direccionamiento de representación basado en interpretabilidad aplicado al flujo residual durante la generación.
Gemma 4 E2B se ejecuta a 255 tok/s en el navegador usando WebGPU
Gemma 4 E2B alcanza 255 tokens por segundo en el navegador en un M4 Max utilizando kernels de WebGPU. La demostración y los kernels ya están disponibles en Hugging Face para uso público.
Google lanza TimesFM-3, un modelo de 330M parámetros con pronóstico multivariado nativo
Google Research ha lanzado TimesFM-3, la tercera generación de su modelo base de series temporales zero-shot. La actualización principal respecto a la versión 2.5 es el soporte nativo para entradas multivariadas, lo que permite al modelo manejar múltiples objetivos y covariables simultáneos sin ajuste fino.
IFM lanza K2-Horizon-MoVA-36B-A4B, un modelo MoE disperso con 4B de parámetros activos
IFM ha lanzado el checkpoint final para K2-Horizon-MoVA-36B-A4B, un modelo Mixture-of-Experts que presenta atención Mixture-of-Values y almacena 36B de parámetros pero ejecuta solo 4B por token. El lanzamiento incluye formatos GGUF y enlaces a variantes más pequeñas de la familia K2-Horizon.
llama.cpp añade soporte para NVIDIA Nemotron-3-Puzzle-75B-A9B
llama.cpp introduce soporte para el modelo NVIDIA Nemotron-3-Puzzle-75B-A9B, habilitando la inferencia para esta arquitectura de Mezcla de Expertos. La actualización implementa infraestructura para tamaños de alimentación hacia adelante de expertos por capa variables y enrutamiento top-k, que son necesarios porque el modelo tiene 40 capas MoE con valores distintos de n_ff_exp y top-k.