Local inference
media Hugging Face Forums · 1 ч назад Live

vLLM Launcher предоставляет рабочий стол для локального вывода LLM в Windows

Новый проект vLLM Launcher выпущен как приложение для рабочего стола Windows, предназначенное для управления локальным выводом больших языковых моделей через WSL2. Этот инструмент позволяет пользователям управлять несколькими бэкендами движков, включая vLLM, SGLang и llama.cpp, из единого графического интерфейса.

github llama.cpp · 14 ч назад

llama.cpp b10330 объединяет rms_norm, mul и rope на CUDA

Проект llama.cpp выпустил версию b10330, внедряющую оптимизацию CUDA, которая объединяет операции rms_norm, умножения и RoPE в одно ядро. Это изменение сопровождается проверкой диапазонов памяти для объединённых операций и новыми тестовыми случаями для весов широковещательной передачи.

github llama.cpp · 15 ч назад · 5 просмотров

llama.cpp b10328 добавляет начальную изоляцию инструментов сервера через Docker

Проект llama.cpp выпустил сборку b10328, которая вводит первоначальную поддержку изоляции инструментов внутри компонента сервера с использованием Docker. Это обновление включает документацию и адаптацию кода для разделения песочниц ввода-вывода инструментов и переименование соответствующих флагов конфигурации.

github llama.cpp · 15 ч назад

llama.cpp b10329 показывает рабочий каталог только когда инструмент его читает

Сервер и UI llama.cpp были обновлены для условного отображения элемента управления рабочим каталогом. Ранее этот элемент появлялся при любом экспорте встроенного инструмента, даже если ни один инструмент на самом деле не использовал его.

github llama.cpp · 1 д назад · 2 просмотра

llama.cpp b10327 исправляет количество потоков/блоков в ядре копирования с квантованием

Проект llama.cpp выпустил версию b10327, которая включает исправление количества потоков и блоков при запуске ядра копирования с квантованием на CUDA. Это обновление устраняет проблему, выявленную в pull request #26731.

github llama.cpp · 2 д назад · 2 просмотра

llama.cpp b10313 добавляет LRU-планировщик в сервер

Проект llama.cpp выпустил версию b10313, которая внедряет планировщик LRU (Least Recently Used) для его серверного компонента. Это обновление включает обработку слияния запросов и исправления для случаев потоковой передачи.

github llama.cpp · 2 д назад

Выпуск llama.cpp b10312 с исправлением сервера для загруженных моделей

Проект llama.cpp выпустил версию b10312, которая включает конкретное обновление компонента сервера. Ключевое изменение устраняет проблему, при которой загруженные модели вытеснялись из маршрутизатора.

github llama.cpp · 4 д назад · 1 просмотр

llama.cpp b10282 добавляет счетчики spec-decode в конечную точку /metrics

Проект llama.cpp выпустил версию b10282, которая внедряет новые возможности мониторинга для спекулятивного декодирования. Сервер теперь включает счетчики spec-decode в своей конечной точке /metrics, позволяя пользователям отслеживать метрики производительности, связанные с этой функцией.

github llama.cpp · 4 д назад · 3 просмотра

llama.cpp b10271 добавляет рабочую директорию для каждой беседы и поддержку путей Windows

Выпуск llama.cpp b10271 внедряет функцию рабочей директории для каждой беседы в UI, позволяя пользователям устанавливать и перемещаться по директориям независимо для каждого сеанса чата.

github llama.cpp · 5 д назад · 5 просмотров

llama.cpp b10270 добавляет поддержку Qwen3-TTS с ломающими изменениями в llama-tts

Проект llama.cpp выпустил версию b10270, добавляющую поддержку модели Qwen3-TTS. Это обновление включает критическое изменение для бинарного файла llama-tts и реализует значительные архитектурные модификации для обработки нового рабочего процесса преобразования текста в речь.

github llama.cpp · 6 д назад · 2 просмотра

llama.cpp b10238 добавляет поддержку MTP для Qwen3-Next

Проект llama.cpp выпустил сборку b10238, которая внедряет поддержку Multi-Token Prediction (MTP) для семейства моделей Qwen3-Next. Это обновление включает специфические изменения в реализации для обработки слоев MTP и исправления, связанные с проверкой типов Python в кодовой базе.

github llama.cpp · 8 д назад · 10 просмотров

llama.cpp b10219 сохраняет reasoning_content в истории чата

Проект llama.cpp выпустил версию b10219, которая включает исправление для CLI, позволяющее сохранять содержимое рассуждений в истории чата. Ранее, хотя `llama-cli` собирал рассуждения из потока для отображения, он сохранял только контент ассистента в сообщениях, что не позволяло флагу `--reasoning-preserve` повторно внедрять предыдущие мысли в последующих ходах.

github llama.cpp · 8 д назад · 9 просмотров

llama.cpp b10213 добавляет поддержку квантования вращённого kv-кэша

Проект llama.cpp выпустил версию b10213, добавляющую поддержку квантования вращённого ключ-значения кэша. Это обновление доступно на широком спектре платформ и аппаратных ускорителей.