Тема · Inference efficiency
lab OpenAI News · 29 д назад · 51 просмотр

OpenAI сообщает: чип Jalapeño обеспечивает снижение задержки до 3,6 раза и повышение эффективности в 1,9 раза

OpenAI опубликовала предварительные результаты производительности Jalapeño, своего первого собственного чипа для вывода моделей, демонстрирующие значительное улучшение скорости и энергоэффективности по сравнению с существующими коммерческими системами. Компания заявляет, что новая архитектура позволяет одновременно достигать более высокой пропускной способности и меньшей задержки, решая типичный компромисс в современном аппаратном обеспечении.

lab Microsoft Research Blog · 22 д назад · 42 просмотра

Microsoft выпустила GigaPath-Flash и GigaTIME-Flash для эффективных патологических фундаментальных моделей

Microsoft Research выпустила GigaPath-Flash и GigaTIME-Flash, эффективные варианты своих патологических фундаментальных моделей, предназначенные для масштабных исследований на уровне популяции за счёт резкого снижения вычислительных требований.

lab OpenAI News · 10 ч назад · 16 просмотров

Сокращение времени и стоимости исследований вдвое с помощью GPT-6 Astra

Parallel интегрировала GPT-6 Astra от OpenAI в свою инфраструктуру AI-агентов, что позволило сократить время исследований и затраты на код на 50% по сравнению с предыдущими моделями. Компания сообщает, что новая модель позволяет агентам выполнять сложную интеллектуальную работу значительно быстрее, сохраняя при этом высокое качество результатов.

lab NVIDIA Research · 8 д назад · 15 просмотров

FastGen-PDD представляет параллельную дистилляцию декодирования для быстрого генерирования видео и изображений

Исследователи представляют Параллельную Дистилляцию Декодирования (PDD), упрощённый метод на основе траекторий для ускорения вывода в моделях диффузии и согласования потоков. В отличие от современных подходов, полагающихся на сложную оптимизацию вариационной дистилляции оценок и состязательных потерь, PDD предсказывает несколько шагов денормализации за одну оценку сети.

lab NVIDIA Research · 11 д назад · 20 просмотров

Onyx обеспечивает снижение стоимости в 1,7–9,9 раза и задержки в 2,3–12,3 раза для disk-oblivious ANN-поиска

Исследователи предлагают Onyx — энергоэффективный подход к disk-oblivious приближенному поиску ближайших соседей (ANN), который балансирует пропускную способность и количество обращений путем инвертирования архитектуры современных систем ORAM-ANN.

lab NVIDIA Research · 11 д назад · 20 просмотров

NVIDIA выпускает GPIR для ускорения на GPU конфиденциального поиска информации

Исследователи из NVIDIA представили GPIR, систему, которая ускоряет выполнение Private Information Retrieval (PIR) на графических процессорах за счёт решения проблем с высокой вычислительной нагрузкой и трафиком памяти на стороне сервера, присущих протоколам на основе решёток. Система использует гибридную модель выполнения, учитывающую стадию обработки, которая динамически переключается между ядрами уровня операций и уровня стадий для максимизации повторного использования данных внутри чипа.

lab NVIDIA Research · 11 д назад · 21 просмотр

NVIDIA характеризует производительность и стоимость MPC и FHE для PPML

Новое исследование представляет унифицированную системную характеристику безопасных многосторонних вычислений (MPC) и полностью гомоморфного шифрования (FHE) для машинного обучения с сохранением конфиденциальности. Работа оценивает два варианта MPC — преобразование арифметического/бинарного разделения и секретное разделение функций — наряду с FHE в нескольких моделях CNN и Transformer.

lab OpenAI News · 12 д назад · 35 просмотров

OpenAI масштабирует сервис хранения Habitat до 70 млн запросов в секунду

OpenAI масштабировала свою внутреннюю платформу онлайн-хранения данных Habitat для обработки более 70 миллионов запросов в секунду для более чем миллиарда еженедельных пользователей ChatGPT почти в 40 географических регионах. Система теперь обслуживает более 500 петабайт данных, эволюционировав из простой клиентской библиотеки на Python в сложный распределённый сервис.

lab NVIDIA Research · 25 д назад · 29 просмотров

Twill автоматически выводит оптимальные расписания программного пайплайнинга и специализации варпов для GPU с тензорными ядрами

Исследователи представили Twill — систему, которая формулирует программный пайплайнинг (SWP) и специализацию варпов (WS) как совместную задачу оптимизации, решаемую с помощью стандартных решателей ограничений. Этот подход автоматизирует вывод оптимальных расписаний выполнения для итеративных программ на архитектурах GPU.

media AI News (smol.ai) · 10 д назад · 38 просмотров

DeepSeek выпустила V4.1-Flash — модель с открытыми весами, ориентированную на экстремальную эффективность вывода

DeepSeek выпустила V4.1-Flash, новую флагманскую модель с открытыми весами, предназначенную для экстремальной эффективности вывода и низкой стоимости. Модель использует причинную архитектуру энкодер-декодер для значительного снижения активных вычислений и затрат на KV/кэш.

media Latent Space · 11 д назад · 27 просмотров

DeepSeek выпустила v4.1-Flash с архитектурой 763B-P8B-D16B для эффективного вывода

DeepSeek запустила DeepSeek v4.1-Flash, новую флагманскую модель с открытыми весами, использующую новую причинную архитектуру кодировщика-декодатора, разработанную для максимизации эффективности вывода и снижения затрат.

media MarkTechPost · 13 д назад · 51 просмотр

DeepSeek выпустила DeepSeek-V4.1-Flash с контекстом 1M и FP4 KV-кэшем

Компания DeepSeek AI выпустила модель DeepSeek-V4.1-Flash, мультимодальную Mixture-of-Experts модель с контекстным окном на 1 миллион токенов и FP4 KV-кэшем, который сокращает глобальный размер кэша до 890 байт на токен. Модель использует причинно-следующую архитектуру кодировщика-декодировщика и Compressed Sparse Attention 2 (CSA2) для значительного снижения требований к памяти при сохранении производительности.

lab Hugging Face Blog · 29 д назад GPQA Diamond · 67.4% · 39 просмотров

QAH от Multiverse Computing позволяет 4-битной модели GPT-OSS превзойти её полнопрецизионный оригинал

Multiverse Computing представляет Quantization-Aware Healing (QAH), метод, который дистиллирует сжатые, квантованные большие языковые модели непосредственно из их исходных учителей до сжатия. Применённый к модели GPT-OSS 120B, сжатой до 60B параметров и квантованной до MXFP4, подход даёт модель, которая превосходит свою собственную полнопрецизионную версию bfloat16 в 7 из 9 бенчмарков.

github llama.cpp · 1 ч назад · 10 просмотров Live

llama.cpp b11120 скрывает внутренние символы Vulkan для исправления разрушения состояния

Проект llama.cpp выпустил версию b11120, которая устраняет критическую ошибку во внутреннем интерфейсе Vulkan путём скрытия внутренних символов. Это изменение предотвращает проблемы с разрушением состояния из-за дублирующего dlopen, возникавшие при экспорте внутренних символов.

arxiv arXiv cs.AI · 3 ч назад · 9 просмотров

CliffCompaction снижает затраты на кодирование агентов на 50% при сохранении производительности

Исследователи представляют CliffCompaction, технику автокомпактизации, предназначенную для снижения затрат на долгосрочных кодовых агентах до 50% в рамках ограниченного контекста. Метод сохраняет или улучшает производительность на Terminal-Bench и достигает лучших результатов на KernelBench за счёт сохранения точности сжатой информации через усечение, а не перефразирование.

arxiv arXiv cs.LG · 5 ч назад · 9 просмотров

CliffCompaction снижает затраты на долгосрочных задачах программирования для агентов до 50%, сохраняя производительность

Исследователи представляют CliffCompaction, метод автокомпактизации, разработанный для агентов, обрабатывающих миллионы токенов, который сокращает затраты до 50% в условиях ограниченного контекста. Метод сохраняет или улучшает производительность на Terminal-Bench и достигает лучших результатов на KernelBench за счёт сохранения точности информации при усечении, а не перефразировании.