Inference efficiency
media Hugging Face Forums · 1 ч назад Live

vLLM Launcher предоставляет рабочий стол для локального вывода LLM в Windows

Новый проект vLLM Launcher выпущен как приложение для рабочего стола Windows, предназначенное для управления локальным выводом больших языковых моделей через WSL2. Этот инструмент позволяет пользователям управлять несколькими бэкендами движков, включая vLLM, SGLang и llama.cpp, из единого графического интерфейса.

github llama.cpp · 8 ч назад · 4 просмотра

llama.cpp b10331 исправляет get_info сервера для корректного отчёта об изолированном рабочем каталоге

Проект llama.cpp выпустил сборку b10331, которая включает исправление для эндпоинта `get_info` сервера. Ранее, когда явный текущий рабочий каталог не был указан, функция ошибочно возвращалась к рабочему каталогу процесса сервера, даже если был настроен tools runtime.

github llama.cpp · 14 ч назад

llama.cpp b10330 объединяет rms_norm, mul и rope на CUDA

Проект llama.cpp выпустил версию b10330, внедряющую оптимизацию CUDA, которая объединяет операции rms_norm, умножения и RoPE в одно ядро. Это изменение сопровождается проверкой диапазонов памяти для объединённых операций и новыми тестовыми случаями для весов широковещательной передачи.

github llama.cpp · 15 ч назад · 5 просмотров

llama.cpp b10328 добавляет начальную изоляцию инструментов сервера через Docker

Проект llama.cpp выпустил сборку b10328, которая вводит первоначальную поддержку изоляции инструментов внутри компонента сервера с использованием Docker. Это обновление включает документацию и адаптацию кода для разделения песочниц ввода-вывода инструментов и переименование соответствующих флагов конфигурации.

github llama.cpp · 1 д назад · 2 просмотра

llama.cpp b10327 исправляет количество потоков/блоков в ядре копирования с квантованием

Проект llama.cpp выпустил версию b10327, которая включает исправление количества потоков и блоков при запуске ядра копирования с квантованием на CUDA. Это обновление устраняет проблему, выявленную в pull request #26731.

github llama.cpp · 1 д назад

llama.cpp b10321 исправляет NORM/RMS_NORM для частичных длин строк simdgroup

Проект llama.cpp выпустил версию b10321, которая включает критическое исправление операций GGML_OP_NORM и GGML_OP_RMS_NORM в Metal. Обновление устраняет проблему, при которой размер threadgroups, оставляющий частичную SIMD-группу, приводил к некорректным вычислениям среднего значения и дисперсии из-за потери частичных сумм.

github llama.cpp · 2 д назад · 2 просмотра

llama.cpp b10313 добавляет LRU-планировщик в сервер

Проект llama.cpp выпустил версию b10313, которая внедряет планировщик LRU (Least Recently Used) для его серверного компонента. Это обновление включает обработку слияния запросов и исправления для случаев потоковой передачи.

github llama.cpp · 2 д назад

Выпуск llama.cpp b10312 с исправлением сервера для загруженных моделей

Проект llama.cpp выпустил версию b10312, которая включает конкретное обновление компонента сервера. Ключевое изменение устраняет проблему, при которой загруженные модели вытеснялись из маршрутизатора.

github llama.cpp · 2 д назад · 1 просмотр

llama.cpp b10306 добавляет плоский путь GLU для SYCL и объединяет ядра

Релиз llama.cpp b10306 вносит оптимизации производительности для бэкенда SYCL, конкретно направленные на операции Gated Linear Unit (GLU). Обновление добавляет непрерывный быстрый путь для объединённых операций GLU и объединяет ранее различные ядра для использования общего загрузчика.

github llama.cpp · 3 д назад · 3 просмотра

llama.cpp b10293 добавляет CI для ROCm с gfx1151 и исправляет вывод на RDNA3.5

Проект llama.cpp выпустил сборку b10293, которая включает интеграцию непрерывной интеграции AMD ROCm для архитектуры gfx1151 и устраняет проблемы корректности на интегрированных GPU с архитектурой RDNA3.5.

github llama.cpp · 3 д назад · 1 просмотр

llama.cpp b10291 исправляет пакетную обработку отправки Vulkan и добавляет инструменты отладки DeviceLost

Проект llama.cpp выпустил версию b10291, которая включает критические исправления для бэкенда Vulkan наряду со стандартными обновлениями платформы. Основные технические изменения касаются проблем с размером пакетов отправки и внедряют новые диагностические возможности для ошибок драйвера.

github llama.cpp · 3 д назад

llama.cpp b10290 добавляет ggml_build_forward_order для исправления выполнения графа аудио

Проект llama.cpp выпустил сборку b10290, внедрив новую функцию `ggml_build_forward_order` в библиотеку ggml. Это изменение устраняет ошибку в графе аудио mtmd, где использование `ggml_build_forward_expand` в качестве чистого указания порядка приводило к выполнению неселектированных ветвей со старыми данными.

github llama.cpp · 3 д назад · 2 просмотра

llama.cpp b10289 укрепляет file_glob_search и исправляет обработку путей в Windows

Выпуск llama.cpp b10289 укрепляет обход директорий file_glob_search сервера для предотвращения бесконечных циклов на точках соединения Windows и улучшает отчеты об ошибках для недоступных директорий.

media Hugging Face Forums · 3 д назад · 1 просмотр

QuantCheck предупреждает против предположения, что финальный чекпоинт лучше всего подходит для 4-битного квантования

Новый инструмент QuantCheck подчеркивает, что финальный чекпоинт предварительного обучения может не быть оптимальным выбором для 4-битного квантования, поскольку бенчмарки могут оставаться плоскими, в то время как хрупкость увеличивается. Автор наблюдал эту закономерность на Pythia-160m, где финальный чекпоинт suffered примерно в четыре раза больше повреждений качества, чем более ранний чекпоинт того же качества.