Компонент webgpu добавил поддержку форматов MMVQ (Multi-Mode Vector Quantization), в частности Q1_0, Q5_0, Q5_1, Q3_K, Q5_K, Q6_K и MXFP4.
Это обновление решает проблему #29 в репозитории llama.cpp, расширяя возможности квантования в среде webgpu.
Компонент webgpu добавил поддержку форматов MMVQ (Multi-Mode Vector Quantization), в частности Q1_0, Q5_0, Q5_1, Q3_K, Q5_K, Q6_K и MXFP4.
Это обновление решает проблему #29 в репозитории llama.cpp, расширяя возможности квантования в среде webgpu.
Автор создал eqx-zoo — библиотеку, которая загружает чекпоинты с Hugging Face Hub непосредственно в виде обычных модулей Equinox и проверяет каждую модель против библиотеки transformers. В настоящее время проект поддерживает Llama, Qwen2, Qwen3, Qwen3-MoE для генерации, а также BERT, RoBERTa, XLM-RoBERTa для эмбеддингов.
Автор выпустил AiiStream Q3.6, технологию с открытым исходным кодом, которая позволяет модели Qwen3.6-35B-A3B работать на устройствах Apple Silicon с объёмом оперативной памяти всего от 8 до 16 ГБ. За счёт хранения маршрутизируемых экспертов на SSD и использования предсказаний ранней загрузки метод снижает потребление памяти MLX примерно до 1,7 ГБ, сохраняя при этом полностью идентичные результаты по байтам по сравнению со стандартной реализацией mlx_lm.
Проект llama.cpp выпустил сборку b11307, которая исправляет порядок входных данных слоёв, чтобы сохранить исходную последовательность батча во время спекулятивного декодирования. Это изменение гарантирует правильную поддержку порядка токенов для немаскированных вложений NextN и совместимость с разделением тензоров.
Проект llama.cpp выпустил сборку b11301, которая включает исправление проблемы с переполнением целочисленного типа в компонентах ggml и gguf. Это обновление корректирует логику проверки для предотвращения потенциальных ошибок при работе с тензорами нулевого размера.
Проект llama.cpp выпустил сборку b111302, которая устраняет критическую проблему конкурентности, выявленную ThreadSanitizer в конвейере CI. Обновление решает гонку данных внутри механизма разреженного внимания, где несколько потоков CPU некорректно записывали данные в одни и те же элементы памяти.
Мы используем cookie для аналитики и улучшения сайта. Вы можете принять или отклонить аналитические cookie. Политика конфиденциальности