Тема · Local inference
github llama.cpp · 3 ч назад · 1 просмотр

llama.cpp b10751 объединяет взвешенное снижение экспертов MoE для CUDA

Проект llama.cpp выпустил сборку b10751, которая вводит объединённое ядро для взвешенного снижения экспертов MoE (Mixture of Experts) на CUDA. Эта оптимизация заменяет предыдущую базовую реализацию, выполнявшую два физических ядра, одним ядром взвешенного снижения, чтобы уменьшить промежуточный трафик в глобальной памяти.

github llama.cpp · 4 ч назад · 1 просмотр

llama.cpp b10750 оптимизирует поиск n-грамм в KV-кэше для увеличения пропускной способности на 4,9%

Проект llama.cpp выпустил сборку b10750, которая рефакторит управление ячейками ключа и значения для улучшения индексации позиций последовательности и поиска истории n-грамм.

github llama.cpp · 8 ч назад · 1 просмотр

llama.cpp b10739 добавляет настройку fa-vec для M2 Max

Проект llama.cpp выпустил версию b10739, которая включает специфическую оптимизацию производительности для аппаратного обеспечения Apple M2 Max. Это обновление вводит быструю настройку векторов внимания (fa-vec), адаптированную под 30 GPU-ядер M2 Max.

lab Hugging Face Blog · 8 ч назад · 3 просмотра

Hugging Face выпустила 207 ядер WebGPU и инструмент для браузерного бенчмаркинга

Компания Hugging Face выпустила библиотеку @huggingface/kernels для загрузки и запуска оптимизированных ядер WebGPU из Hugging Face Hub, а также начальную коллекцию из 207 ядер. В релиз также вошёл Fleet — набор для браузерного бенчмаркинга GPU, который собирает данные о производительности и корректности с устройств пользователей.

media r/LocalLLaMA · 17 ч назад · 1 просмотр

ExLlamaV3 добавляет выгрузку на CPU для экспертов MoE и новые модели GLM-5.3-Flash, Qwen3.8-Flash

Turboderp выпустил значительные обновления ExLlamaV3, внедрив возможности выгрузки на CPU для экспертов Mixture of Experts (MoE). Обновление также включает поддержку недавно выпущенных моделей GLM-5.3-Flash и Qwen3.8-Flash.

github llama.cpp · 1 д назад · 3 просмотра

llama.cpp b10724 оптимизирует восстановление состояния kv-cache, сокращая количество копирований с 1.3M до 224

Проект llama.cpp выпустил сборку b10724, которая значительно улучшает производительность восстановления неконтекстных ячеек KV кэша путем группировки операций scatter-чтения для каждого непрерывного участка.

github llama.cpp · 1 д назад · 9 просмотров

llama.cpp b10718 расширяет слияние MOE на specdec и многотокенный режим

Проект llama.cpp выпустил версию b10718, которая включает значительное обновление бэкенда CUDA. Наиболее заметным изменением является расширение слияния Mixture of Experts (MOE) для поддержки спекулятивного декодирования (specdec), что устраняет предыдущие ограничения, при которых слияние MOE glu и topk-router было ограничено обработкой только одного токена за раз.

github llama.cpp · 2 д назад · 4 просмотра

llama.cpp b10714 настраивает строки mat-vec Vulkan для Strix Halo

Проект llama.cpp выпустил сборку b10714, включающую специфические оптимизации для бэкенда Vulkan, ориентированные на оборудование AMD Strix Halo. Обновление корректирует количество строк умножения матрицы на вектор для улучшения производительности при пакетном выводе.

github llama.cpp · 2 д назад · 11 просмотров

llama.cpp b10707 оптимизирует сканирование ячеек KV-кэша для ускорения генерации

Проект llama.cpp выпустил версию b10707, включающую оптимизацию производительности обработки ключ-значительного (KV) кэша. Обновление изменяет функцию `for_each_token_in`, чтобы прекратить сканирование после того, как все последовательности в конкретной ячейке были просмотрены, вместо итерации по всем возможным максимальным последовательностям.

github llama.cpp · 3 д назад · 8 просмотров

llama.cpp включает xmem GEMM и обходит tiled f32 на GPU Adreno

Проект llama.cpp обновил свой бэкенд OpenCL для улучшения производительности умножения матриц на двух поколениях GPU Adreno. Изменения в первую очередь ориентированы на поколение X2E, по умолчанию активируя путь GEMM xmem F16xF32 и оптимизируя обработку для поколения A7X.

github llama.cpp · 4 д назад · 10 просмотров

llama.cpp b10670 направляет декодирование квантованного KV на TILE для Xe2 (BMG)

Проект llama.cpp выпустил версию b10670, которая включает специфическую оптимизацию для архитектуры Intel Xe2. Обновление перенаправляет операцию декодирования квантованных ключей и значений (KV) исключительно на бэкенд TILE для оборудования BMG, сохраняя бэкенд VEC для других архитектур до их валидации.

github llama.cpp · 5 д назад · 7 просмотров

llama.cpp b10666 исправляет тесты сохранения/загрузки состояния и копирование последовательностей на устройстве

Релиз llama.cpp b10666 расширяет набор тестов save-load-state для запуска на всех архитектурах и устраняет несколько критических ошибок в управлении состоянием и обработке графа. Ключевые изменения включают исправление висячих ссылок в minimax-01, согласование копирования чанков для последовательностей на устройстве и исправление количества голов индексатора для deepseek4.