Inference efficiency
github llama.cpp · 1 ч назад · 10 просмотров Live

llama.cpp b11120 скрывает внутренние символы Vulkan для исправления разрушения состояния

Проект llama.cpp выпустил версию b11120, которая устраняет критическую ошибку во внутреннем интерфейсе Vulkan путём скрытия внутренних символов. Это изменение предотвращает проблемы с разрушением состояния из-за дублирующего dlopen, возникавшие при экспорте внутренних символов.

arxiv arXiv cs.AI · 3 ч назад · 9 просмотров

CliffCompaction снижает затраты на кодирование агентов на 50% при сохранении производительности

Исследователи представляют CliffCompaction, технику автокомпактизации, предназначенную для снижения затрат на долгосрочных кодовых агентах до 50% в рамках ограниченного контекста. Метод сохраняет или улучшает производительность на Terminal-Bench и достигает лучших результатов на KernelBench за счёт сохранения точности сжатой информации через усечение, а не перефразирование.

arxiv arXiv cs.LG · 5 ч назад · 9 просмотров

CliffCompaction снижает затраты на долгосрочных задачах программирования для агентов до 50%, сохраняя производительность

Исследователи представляют CliffCompaction, метод автокомпактизации, разработанный для агентов, обрабатывающих миллионы токенов, который сокращает затраты до 50% в условиях ограниченного контекста. Метод сохраняет или улучшает производительность на Terminal-Bench и достигает лучших результатов на KernelBench за счёт сохранения точности информации при усечении, а не перефразировании.

lab OpenAI News · 10 ч назад · 16 просмотров

Сокращение времени и стоимости исследований вдвое с помощью GPT-6 Astra

Parallel интегрировала GPT-6 Astra от OpenAI в свою инфраструктуру AI-агентов, что позволило сократить время исследований и затраты на код на 50% по сравнению с предыдущими моделями. Компания сообщает, что новая модель позволяет агентам выполнять сложную интеллектуальную работу значительно быстрее, сохраняя при этом высокое качество результатов.

github llama.cpp · 17 ч назад · 9 просмотров

llama.cpp добавляет поддержку DFlash для HunyuanOCR и исправляет конвертацию черновиков

Проект llama.cpp добавил поддержку спекулятивного декодирования DFlash с моделью HunyuanOCR, открывая тензоры входных данных слоёв в целевом графе. Это изменение позволяет модели-черновику считывать остаточные потоки, что обеспечивает успешное выполнение запросов на распознавание текста с уровнем принятия черновика около 0.5 и байтово идентичным выводом OCR по сравнению с неспекулятивными запусками.

lab Hugging Face Blog · 20 ч назад · 10 просмотров

Transformers добавляет поддержку GGUF через ядра ggml для локального вывода

Библиотека Transformers от Hugging Face теперь поддерживает загрузку квантованных моделей в формате GGUF, используя базовые ядра ggml для достижения производительности, близкой к llama.cpp. Эта интеграция позволяет разработчикам запускать квантованные контрольные точки непосредственно через стандартный API на основе PyTorch на поддерживаемом оборудовании.

github llama.cpp · 23 ч назад · 11 просмотров

llama.cpp b11100 исправляет ошибку парсера вызовов инструментов Muse Glimmer

Проект llama.cpp выпустил сборку b11100, которая устраняет конкретную проблему с парсингом модели Muse Glimmer. Основное изменение заключается в исправлении первой ошибки парсера, возникающей при выполнении вызова инструмента для этой модели.

media Hugging Face Forums · 1 д назад · 11 просмотров

Пользователь ищет рабочий процесс для абляции модели Llama-Krikri-8B-Instruct для локального использования на греческом языке

Пользователь планирует создать нецензурную, нативную греческую большую языковую модель для локального развертывания с использованием чекпоинта ilsp/Llama-Krikri-8B-Instruct. Предложенный план включает абляцию модели с помощью Heretic (heretic-llm), конвертацию в формат GGUF Q4_K_M и выполнение инференса на устройстве GMKtec EVO-X3, оснащенном процессором AMD Ryzen AI MAX+ 395, через Vulkan.

media Together AI Blog · 1 д назад · 11 просмотров

Together AI представляет канареечные развертывания для обновления моделей в продакшене без простоев

Together AI представила функцию канареечных развертываний (Canary rollouts), которая поэтапно переносит живой трафик с текущей модели на новый чекпоинт. Эта система автоматизирует механизм безопасности при замене моделей, выполняя проверки работоспособности и опциональные контрольные точки по метрикам перед переключением трафика, что позволяет автоматически приостанавливать процесс или откатывать изменения при ухудшении производительности.

arxiv arXiv cs.AI · 1 д назад · 9 просмотров

AgentRouter снижает стоимость агентных рабочих процессов на 72% за счёт маршрутизации моделей на уровне шагов

Исследователи предлагают AgentRouter, лёгкий классификатор, который оптимизирует многошаговые агентные рабочие процессы, направляя отдельные шаги траектории в соответствующие уровни моделей вместо использования передовых моделей для каждой задачи. Система решает проблему неэффективности существующих решений, которые игнорируют различную сложность подзадач внутри одной сессии агента.

arxiv arXiv cs.CL · 1 д назад · 11 просмотров

AgentRouter снижает стоимость агентных рабочих процессов на 72 % за счёт маршрутизации моделей на уровне шагов

Исследователи предлагают AgentRouter — лёгкий классификатор, оптимизирующий многошаговые агентные рабочие процессы путём маршрутизации отдельных шагов траектории к соответствующим уровням моделей вместо использования одной передовой модели для всех задач. Система устраняет неэффективность корпоративных систем, которые тратят 60–80 % своего бюджета на вывод на подзадачи, с которыми меньшие модели справляются столь же хорошо.

github llama.cpp · 1 д назад · 14 просмотров

llama.cpp b11090 исправляет ошибку компиляции тайлов sm_70

Проект llama.cpp выпустил версию b11090, которая включает исправление ошибки компиляции тайлов sm_70. Обновление обобщает форму тайла функции load_ldmatrix с 5 аргументами для устранения несоответствий с архитектурами Volta.