O lançamento do llama.cpp b10144 aborda problemas críticos no servidor e na interface de usuário relacionados a streams recuperáveis, corrigindo especificamente o tratamento de nomes de modelos que contêm barras. Também resolve bugs onde as solicitações não eram canceladas ou retomadas corretamente durante o carregamento do modelo.
- Refatora as rotas de stream recuperável para usar a string de consulta `conv_id`, permitindo que nomes de modelos com barras sobrevivam à codificação no modo roteador.
- Cancela solicitações pendentes quando seu stream é interrompido durante o carregamento do modelo, registrando a conversa antes da espera de autoload.
- Permite retomar um stream após uma recarga de página durante o carregamento do modelo, desanexando as solicitações da sessão dos soquetes do cliente e retornando 503 para novas tentativas.
- Restaura a visibilidade do progresso do carregamento do modelo na interface do usuário após uma atualização de página, persistindo o estado do stream pendente.
Essas alterações garantem que as conversas permaneçam robustas contra desconexões do cliente e problemas de codificação de URL, impedindo solicitações órfãs e sessões perdidas durante a fase de carregamento do modelo.