Local inference
github llama.cpp · 1 ч назад · 10 просмотров Live

llama.cpp b11120 скрывает внутренние символы Vulkan для исправления разрушения состояния

Проект llama.cpp выпустил версию b11120, которая устраняет критическую ошибку во внутреннем интерфейсе Vulkan путём скрытия внутренних символов. Это изменение предотвращает проблемы с разрушением состояния из-за дублирующего dlopen, возникавшие при экспорте внутренних символов.

github llama.cpp · 17 ч назад · 9 просмотров

llama.cpp добавляет поддержку DFlash для HunyuanOCR и исправляет конвертацию черновиков

Проект llama.cpp добавил поддержку спекулятивного декодирования DFlash с моделью HunyuanOCR, открывая тензоры входных данных слоёв в целевом графе. Это изменение позволяет модели-черновику считывать остаточные потоки, что обеспечивает успешное выполнение запросов на распознавание текста с уровнем принятия черновика около 0.5 и байтово идентичным выводом OCR по сравнению с неспекулятивными запусками.

lab Hugging Face Blog · 20 ч назад · 10 просмотров

Transformers добавляет поддержку GGUF через ядра ggml для локального вывода

Библиотека Transformers от Hugging Face теперь поддерживает загрузку квантованных моделей в формате GGUF, используя базовые ядра ggml для достижения производительности, близкой к llama.cpp. Эта интеграция позволяет разработчикам запускать квантованные контрольные точки непосредственно через стандартный API на основе PyTorch на поддерживаемом оборудовании.

lab Hugging Face Blog · 1 д назад · 11 просмотров

Создатель oMLX Джун Ким присоединился к Hugging Face для поддержки сообщества MLX

Джун Ким, создатель и сопровождающий проекта oMLX, присоединился к Hugging Face для поддержки сообщества MLX. Этот шаг направлен на обеспечение стабильности и ускорение разработки открытого проекта путем перевода его из побочного занятия в полностью поддерживаемую и финансируемую инициативу.

media Hugging Face Forums · 1 д назад · 11 просмотров

Пользователь ищет рабочий процесс для абляции модели Llama-Krikri-8B-Instruct для локального использования на греческом языке

Пользователь планирует создать нецензурную, нативную греческую большую языковую модель для локального развертывания с использованием чекпоинта ilsp/Llama-Krikri-8B-Instruct. Предложенный план включает абляцию модели с помощью Heretic (heretic-llm), конвертацию в формат GGUF Q4_K_M и выполнение инференса на устройстве GMKtec EVO-X3, оснащенном процессором AMD Ryzen AI MAX+ 395, через Vulkan.

github llama.cpp · 1 д назад · 14 просмотров

llama.cpp b11090 исправляет ошибку компиляции тайлов sm_70

Проект llama.cpp выпустил версию b11090, которая включает исправление ошибки компиляции тайлов sm_70. Обновление обобщает форму тайла функции load_ldmatrix с 5 аргументами для устранения несоответствий с архитектурами Volta.

github llama.cpp · 1 д назад · 12 просмотров

Выпуск llama.cpp b11081 с настраиваемым стандартным отклонением данных тензоров и улучшенными инструментами тестирования

Проект llama.cpp выпустил сборку b11081, которая включает несколько обновлений инфраструктуры тестирования `test-llama-archs`. Ключевые изменения включают возможность настройки стандартного отклонения данных тензоров, расширение примеров использования и добавление поддержки регулярных выражений для архитектур.

github llama.cpp · 2 д назад · 11 просмотров

llama.cpp b11074 исправляет обработку JSON enum

Проект llama.cpp выпустил сборку b11074, которая включает исправление обработки JSON enum. Обновление добавляет поддержку common_json_value для значений enum и упрощает код, делегируя конструктор enum конструктору базового типа.

github llama.cpp · 3 д назад · 16 просмотров

llama.cpp b11060 исправляет проекцию временного шага Mamba и пропускает непрерывную копию

Проект llama.cpp выпустил сборку b11060, которая включает исправление для модели Mamba, чтобы обеспечить непрерывность входных данных проекции временного шага. Это изменение устраняет проблемы с расположением памяти в реализации Mamba.

github llama.cpp · 4 д назад · 29 просмотров

llama.cpp b11053 улучшает логи запуска сервера, показывая источник модели

Проект llama.cpp выпустил версию b11053, которая включает конкретное улучшение сообщений журнала запуска сервера. Это изменение повышает прозрачность процесса загрузки моделей, заменяя непонятные маркеры явными тегами источника.

github llama.cpp · 4 д назад · 19 просмотров

llama.cpp b11048 добавляет операции HC для qwen4exp и новые бинарные файлы

Проект llama.cpp выпустил сборку b11048, которая добавляет поддержку новых вариантов операций HC DSV4, используемых в qwen4exp. Это обновление включает конкретные реализации hc_pre с поразрядной сигмоидной активацией и hc_post с тождественным смешиванием.

media Hugging Face Forums · 4 д назад · 9 просмотров

Выпущена версия Celestium CARE для NVIDIA под видеокарты GTX/RTX

Версия Celestium CARE для NVIDIA завершена и доступна как профессиональный инструмент для видеокарт GTX и RTX. Она использует NVML для предоставления таких функций, как очистка VRAM, расписание автоматической очистки и полное мониторинг телеметрии.

github llama.cpp · 4 д назад · 21 просмотр

llama.cpp b11046 добавляет поддержку OpenCL для ядра flash_attn_f32_f16_bin

Проект llama.cpp выпустил версию b11046, которая добавляет поддержку OpenCL для ядра `flash_attn_f32_f16_bin`. Это обновление также включает функциональность защищённого префиллинга для Flash Attention на устройствах OpenCL.