El proyecto llama.cpp lanzó la compilación b10896, que aborda un problema crítico donde la memoria del redactor fallaba al asignar nuevos tokens al usar DFlash con modelos de visión. Este fallo ocurrió porque las imágenes reportaban un desplazamiento fijo, impidiendo la asignación adecuada de tokens.
- La corrección detiene la copia de los desplazamientos de imagen para permitir que el redactor continúe decodificando.
- El salto de M-RoPE se limita solo a imágenes, permitiendo que el audio pase sin cambios.
- Los comentarios fueron limpiados para alinearse con la lógica de implementación actualizada.
Esta actualización asegura que la decodificación especulativa con DFlash funcione correctamente para modelos multimodales resolviendo errores de asignación de memoria causados por el manejo de metadatos de imagen.