Источник · llama.cpp
github llama.cpp · 1 ч назад · 10 просмотров Live

llama.cpp b11120 скрывает внутренние символы Vulkan для исправления разрушения состояния

Проект llama.cpp выпустил версию b11120, которая устраняет критическую ошибку во внутреннем интерфейсе Vulkan путём скрытия внутренних символов. Это изменение предотвращает проблемы с разрушением состояния из-за дублирующего dlopen, возникавшие при экспорте внутренних символов.

github llama.cpp · 17 ч назад · 9 просмотров

llama.cpp добавляет поддержку DFlash для HunyuanOCR и исправляет конвертацию черновиков

Проект llama.cpp добавил поддержку спекулятивного декодирования DFlash с моделью HunyuanOCR, открывая тензоры входных данных слоёв в целевом графе. Это изменение позволяет модели-черновику считывать остаточные потоки, что обеспечивает успешное выполнение запросов на распознавание текста с уровнем принятия черновика около 0.5 и байтово идентичным выводом OCR по сравнению с неспекулятивными запусками.

github llama.cpp · 1 д назад · 11 просмотров

llama.cpp b11100 исправляет ошибку парсера вызовов инструментов Muse Glimmer

Проект llama.cpp выпустил сборку b11100, которая устраняет конкретную проблему с парсингом модели Muse Glimmer. Основное изменение заключается в исправлении первой ошибки парсера, возникающей при выполнении вызова инструмента для этой модели.

github llama.cpp · 1 д назад · 14 просмотров

llama.cpp b11090 исправляет ошибку компиляции тайлов sm_70

Проект llama.cpp выпустил версию b11090, которая включает исправление ошибки компиляции тайлов sm_70. Обновление обобщает форму тайла функции load_ldmatrix с 5 аргументами для устранения несоответствий с архитектурами Volta.

github llama.cpp · 2 д назад · 12 просмотров

Выпуск llama.cpp b11081 с настраиваемым стандартным отклонением данных тензоров и улучшенными инструментами тестирования

Проект llama.cpp выпустил сборку b11081, которая включает несколько обновлений инфраструктуры тестирования `test-llama-archs`. Ключевые изменения включают возможность настройки стандартного отклонения данных тензоров, расширение примеров использования и добавление поддержки регулярных выражений для архитектур.

github llama.cpp · 2 д назад · 12 просмотров

llama.cpp b11078 добавляет управление параметрами генерации через переменные окружения

Проект llama.cpp выпустил сборку b11078, которая внедряет поддержку переменных окружения для настройки ключевых параметров генерации в компоненте `llama-server`. Это обновление позволяет пользователям устанавливать температуру, top-p, min-p и различные штрафы через переменные `LLAMA_ARG_*`.

github llama.cpp · 2 д назад · 12 просмотров

llama.cpp b11080 позволяет использовать regex в фильтре -o и прекращает логирование срезов векторов FA

Выпуск llama.cpp b11080 обновляет операции тестового бэкенда для поддержки регулярных выражений в фильтре `-o`, позволяя сопоставлять шаблоны с именами операций, сохраняя точное совпадение для обычных имён. Он также изменяет инструмент `cont`, чтобы прекратить вывод журналов срезов векторов Fast Attention, когда они не нужны.

github llama.cpp · 2 д назад · 10 просмотров

llama.cpp b11077 исправляет передачу API-ключа роутера дочерним экземплярам

Выпуск llama.cpp b11077 устраняет ошибку в режиме роутера, при которой аргумент `--api-key-file` неверно передавался дочерним экземплярам, порожденным роутером. Это приводило к тому, что клиенты, использующие `--api-key`, получали ошибки 401 при завершении чата и предотвращало работу внутренних потоковых вызовов роутера.

github llama.cpp · 2 д назад · 11 просмотров

llama.cpp b11074 исправляет обработку JSON enum

Проект llama.cpp выпустил сборку b11074, которая включает исправление обработки JSON enum. Обновление добавляет поддержку common_json_value для значений enum и упрощает код, делегируя конструктор enum конструктору базового типа.

github llama.cpp · 2 д назад · 11 просмотров

llama.cpp b11070 полностью перерабатывает обработку буферов Hexagon и DMA для 64-битных отображений

Проект llama.cpp выпустил версию b11070, в которой значительным образом переработан бэкенд Hexagon для поддержки 64-битных отображений памяти и расширенной обработки буферов. Это обновление обеспечивает корректную поддержку DMA (прямого доступа к памяти) для больших моделей и сложных операций на DSP Qualcomm Hexagon.

github llama.cpp · 3 д назад · 16 просмотров

llama.cpp b11064 поддерживает произвольное количество голов в dsv4_hc_pre

Проект llama.cpp выпустил сборку b11064, которая изменяет бэкенд metal для поддержки произвольного количества голов (hc) в ядре dsv4_hc_pre. Ранее эти ядра жестко задавали hc = 4, что приводило к выполнению операций с другим количеством голов на CPU.