Выпуск llama.cpp b10144 устраняет критические проблемы в сервере и интерфейсе, связанные с возобновляемыми потоками, конкретно исправляя обработку имён моделей, содержащих слэши. Он также решает ошибки, при которых запросы не отменялись и не возобновлялись должным образом во время загрузки модели.

  • Рефакторинг маршрутов возобновляемых потоков для использования строки запроса `conv_id`, позволяющий именам моделей со слэшами корректно обрабатываться при кодировании в режиме роутера.
  • Отмена ожидающих запросов, когда их поток останавливается во время загрузки модели, путём регистрации разговора до ожидания автозагрузки.
  • Возможность возобновления потока после перезагрузки страницы во время загрузки модели за счёт отсоединения запросов сессии от сокетов клиента и возврата кода 503 для повторных попыток.
  • Восстановление видимости прогресса загрузки модели в интерфейсе после обновления страницы путём сохранения состояния ожидающего потока.

Эти изменения гарантируют, что разговоры остаются устойчивыми к разрывам соединений с клиентом и проблемам кодирования URL, предотвращая появление «висячих» запросов и потерю сессий во время фазы загрузки модели.