El proyecto vLLM lanzó la versión 0.29.0, que incluye una corrección de error central respecto al caché de prefijos denso.
- La actualización aplica la configuración predeterminada del caché de prefijos denso específicamente a modelos híbridos.
El proyecto vLLM lanzó la versión 0.29.0, que incluye una corrección de error central respecto al caché de prefijos denso.
DeepSeek AI ha lanzado DeepSeek-V4.1-Flash, un modelo multimodal Mixture-of-Experts que cuenta con una ventana de contexto de 1 millón de tokens y una caché KV FP4 que reduce la huella global de la caché a 890 bytes por token. El modelo utiliza una arquitectura de codificador-decodificador causal y Compressed Sparse Attention 2 (CSA2) para reducir significativamente los requisitos de memoria mientras mantiene el rendimiento.
El proyecto llama.cpp ha lanzado la compilación b10889, que incluye una optimización de memoria para evitar asignar el caché V para el indexador ya que no se utiliza.
El proyecto llama.cpp ha lanzado la compilación b10888, que incluye una nueva función para agregar etiquetas de depuración de búfer de comandos para perfiles de GPU en el backend de Vulkan.
El proyecto llama.cpp lanzó la compilación b10886, que introduce el soporte de intrínsecos vectoriales Q1_0 para la arquitectura s390x. Esta actualización incluye la implementación de `ggml_vec_dot_q1_0_q8_0` y actualiza la documentación para reflejar la nueva capacidad.
El proyecto llama.cpp lanzó la compilación b10883, que incluye actualizaciones significativas en el backend de Vulkan. El cambio principal implica el uso de constantes de especificación para operaciones de multiplicación matriz-matriz tipo A para mejorar la compilación y el rendimiento de los shaders.
Usamos cookies para medir el tráfico y mejorar el sitio. Puedes aceptar o rechazar las cookies de analítica. Política de privacidad