Реализация CUDA была обновлена, чтобы приоритизировать стратегии планирования целых тайлов для FlashAttention. Это изменение направлено на оптимизацию потока выполнения механизмов внимания в рамках фреймворка.
CUDA отдаёт предпочтение планированию целых тайлов в FlashAttention
Eqx-zoo предоставляет проверенные порты моделей Equinox для Hugging Face
Автор создал eqx-zoo — библиотеку, которая загружает чекпоинты с Hugging Face Hub непосредственно в виде обычных модулей Equinox и проверяет каждую модель против библиотеки transformers. В настоящее время проект поддерживает Llama, Qwen2, Qwen3, Qwen3-MoE для генерации, а также BERT, RoBERTa, XLM-RoBERTa для эмбеддингов.
Выпуск llama.cpp b11401 исправляет логирование и включает ANSI-цвета в Windows
Выпуск llama.cpp b11401 устраняет проблемы с логированием в режиме роутера сервера и добавляет поддержку ANSI-цветов в консоли Windows. Это обновление гарантирует, что логи дочерних процессов правильно отделены от команд состояния и цветной вывод корректно отображается в терминалах Windows.
Aleph Alpha выпустила Kolibri — 78,1B англо-немецкую MoE-модель с 3,46B активных параметров
Aleph Alpha выпустила Kolibri-1, модель языка Mixture-of-Experts с открытыми весами, предназначенную для двуязычных задач на английском и немецком языках. Модель имеет 78,1 миллиарда общих параметров, но активирует только 3,46 миллиарда на токен, что позволяет запускать её на одном GPU B200, B300 или H200.
llama.cpp b11390 исправляет ошибку памяти CUDA MMQ
Проект llama.cpp выпустил версию b11390, которая содержит исправление ошибки памяти CUDA MMQ, возникавшей при значительном превышении количества экспертов над размером микро-батча.
llama.cpp b11382 добавляет поддержку f16 для WebGPU fill/set_rows
Проект llama.cpp выпустил сборку b11382, которая включает важное обновление бэкенда WebGPU. Этот релиз добавляет поддержку 16-битной плавающей точки (f16) специально для операций `fill` и `set_rows` в реализации WebGPU.