Проект vLLM выпустил версию 0.29.0, которая включает исправление основной ошибки, связанной с плотным кэшем префиксов.
- Обновление устанавливает значение по умолчанию для плотного кэша префиксов специально для гибридных моделей.
Проект vLLM выпустил версию 0.29.0, которая включает исправление основной ошибки, связанной с плотным кэшем префиксов.
Компания DeepSeek AI выпустила модель DeepSeek-V4.1-Flash, мультимодальную Mixture-of-Experts модель с контекстным окном на 1 миллион токенов и FP4 KV-кэшем, который сокращает глобальный размер кэша до 890 байт на токен. Модель использует причинно-следующую архитектуру кодировщика-декодировщика и Compressed Sparse Attention 2 (CSA2) для значительного снижения требований к памяти при сохранении производительности.
Проект llama.cpp выпустил сборку b10889, которая включает оптимизацию памяти для избежания выделения V кэша для индексатора, поскольку он не используется.
Проект llama.cpp выпустил сборку b10888, которая включает новую функцию добавления меток отладки командных буферов для профилировщиков GPU во бэкенде Vulkan.
Проект llama.cpp выпустил сборку b10886, которая внедряет поддержку векторных встроенных функций Q1_0 для архитектуры s390x. Это обновление включает реализацию `ggml_vec_dot_q1_0_q8_0` и обновляет документацию, чтобы отразить новую возможность.
Проект llama.cpp выпустил сборку b10883, включающую значительные обновления бэкенда Vulkan. Основное изменение заключается в использовании спецификационных констант для операций умножения матрица-на-матрицу типа A с целью улучшения компиляции шейдеров и производительности.
Мы используем cookie для аналитики и улучшения сайта. Вы можете принять или отклонить аналитические cookie. Политика конфиденциальности