La versión b10144 de llama.cpp aborda problemas críticos en el servidor y la interfaz de usuario relacionados con las transmisiones reanudables, corrigiendo específicamente el manejo de nombres de modelo que contienen barras. También resuelve errores donde las solicitudes no se cancelaban o reanudaban correctamente durante la carga del modelo.
- Refactoriza las rutas de transmisión reanuble para usar la cadena de consulta `conv_id`, permitiendo que los nombres de modelo con barras sobrevivan a la codificación en el modo enrutador.
- Cancela las solicitudes pendientes cuando su transmisión se detiene durante la carga del modelo registrando la conversación antes de la espera de carga automática.
- Permite reanudar una transmisión después de recargar la página durante la carga del modelo desvinculando las solicitudes de sesión de los sockets del cliente y devolviendo 503 para los reintentos.
- Restaura la visibilidad del progreso de carga del modelo en la interfaz de usuario después de una actualización de página persistiendo el estado de la transmisión pendiente.
Estos cambios aseguran que las conversaciones permanezcan robustas frente a desconexiones del cliente y problemas de codificación URL, evitando solicitudes huérfanas y sesiones perdidas durante la fase de carga del modelo.