Тема · Hardware & chips
lab OpenAI News · 29 д назад · 51 просмотр

OpenAI сообщает: чип Jalapeño обеспечивает снижение задержки до 3,6 раза и повышение эффективности в 1,9 раза

OpenAI опубликовала предварительные результаты производительности Jalapeño, своего первого собственного чипа для вывода моделей, демонстрирующие значительное улучшение скорости и энергоэффективности по сравнению с существующими коммерческими системами. Компания заявляет, что новая архитектура позволяет одновременно достигать более высокой пропускной способности и меньшей задержки, решая типичный компромисс в современном аппаратном обеспечении.

lab Anthropic News · 27 д назад · 83 просмотра

Anthropic открывает исследовательский предпросмотр стандарта аппаратного обеспечения моделей для управления устройствами ИИ-агентов

Компании Anthropic и HHMI Janelia Research Campus представили исследовательский предпросмотр стандарта аппаратного обеспечения моделей (MHS), общего специфицированного документа, предназначенного для безопасного управления физическими устройствами в лабораториях и на производственных предприятиях с помощью ИИ-агентов. Стандарт сокращает время интеграции оборудования с недель или месяцев до часов благодаря предоставлению единого драйвера, обеспечивающего взаимодействие между операционными системами и разнообразными аппаратными интерфейсами.

lab OpenAI News · 29 д назад · 57 просмотров

OpenAI делится результатами производительности чипа Jalapeño и стратегией вычислений полного стека

OpenAI опубликовала первые измеренные результаты производительности Jalapeño, своего собственного чипа для вывода моделей, а также подробный обзор своей интегрированной стратегии вычислений «избыточный интеллект». Компания описывает, как она объединяет центры обработки данных, чипы, модели и программное обеспечение для повышения эффективности и экономической целесообразности во всей своей системе.

lab NVIDIA Research · 7 д назад · 16 просмотров

ShareMMU обеспечивает безопасное разделение трансляции адресов между недоверенными ускорителями с малыми накладными расходами

Исследователи представляют ShareMMU, дизайн IOMMU, который позволяет нескольким недоверенным ускорителям безопасно повторно использовать предварительно транслированные адреса в общем виртуальном адресном пространстве. Этот подход снижает риски побочных каналов, связанные с большими общими таблицами трансляции (TLB), сохраняя при этом высокую производительность.

lab NVIDIA Research · 11 д назад · 20 просмотров

Onyx обеспечивает снижение стоимости в 1,7–9,9 раза и задержки в 2,3–12,3 раза для disk-oblivious ANN-поиска

Исследователи предлагают Onyx — энергоэффективный подход к disk-oblivious приближенному поиску ближайших соседей (ANN), который балансирует пропускную способность и количество обращений путем инвертирования архитектуры современных систем ORAM-ANN.

lab NVIDIA Research · 11 д назад · 20 просмотров

NVIDIA выпускает GPIR для ускорения на GPU конфиденциального поиска информации

Исследователи из NVIDIA представили GPIR, систему, которая ускоряет выполнение Private Information Retrieval (PIR) на графических процессорах за счёт решения проблем с высокой вычислительной нагрузкой и трафиком памяти на стороне сервера, присущих протоколам на основе решёток. Система использует гибридную модель выполнения, учитывающую стадию обработки, которая динамически переключается между ядрами уровня операций и уровня стадий для максимизации повторного использования данных внутри чипа.

lab NVIDIA Research · 11 д назад · 21 просмотр

NVIDIA характеризует производительность и стоимость MPC и FHE для PPML

Новое исследование представляет унифицированную системную характеристику безопасных многосторонних вычислений (MPC) и полностью гомоморфного шифрования (FHE) для машинного обучения с сохранением конфиденциальности. Работа оценивает два варианта MPC — преобразование арифметического/бинарного разделения и секретное разделение функций — наряду с FHE в нескольких моделях CNN и Transformer.

lab OpenAI News · 15 д назад · 39 просмотров

GPT-5.6 Sol от MIT автоматизирует калибровку квантовых чипов через Codex

Беатрис Янкелевич из группы инженерии квантовых систем Массачусетского технологического института использовала GPT‑5.6 Sol, интегрированную с Codex, для автономного выполнения и уточнения рутинных измерений на сверхпроводящих кубитах. Эта интеграция позволяет агенту ИИ управлять лабораторным программным обеспечением, анализировать результаты и принимать решения о последующих шагах без постоянного контроля со стороны человека.

lab NVIDIA Research · 25 д назад · 29 просмотров

Twill автоматически выводит оптимальные расписания программного пайплайнинга и специализации варпов для GPU с тензорными ядрами

Исследователи представили Twill — систему, которая формулирует программный пайплайнинг (SWP) и специализацию варпов (WS) как совместную задачу оптимизации, решаемую с помощью стандартных решателей ограничений. Этот подход автоматизирует вывод оптимальных расписаний выполнения для итеративных программ на архитектурах GPU.

media Latent Space · 27 д назад · 70 просмотров

OpenAI сообщает: чип Jalapeño превосходит NVIDIA GB200/GB300 по эффективности и задержкам

На 37-й конференции Hot Chips компания OpenAI представила данные бенчмарков для своего собственного чипа вывода Jalapeño, заявив о превосходной производительности на ватт по сравнению с системами NVIDIA GB200 и GB300. Чип обеспечивает выполнение на 1.5–1.9× больше работы на ватт при пиковой пропускной способности и снижает сквозную задержку на 1.7–3.6×; его внедрение в инфраструктуру OpenAI запланировано до конца года.

media r/LocalLLaMA · 1 д назад · 11 просмотров

Alibaba планирует ИИ-модель с 5–10 триллионами параметров и представляет новый чип

Alibaba объявила о планах разработки модели искусственного интеллекта, содержащей от 5 до 10 триллионов параметров. В рамках этого плана компания также представила новый собственный чип, разработанный для поддержки её инфраструктурных потребностей.

media r/LocalLLaMA · 2 д назад · 11 просмотров

Huawei откладывает глобальный запуск ИИ-чипов, так как внутренний спрос в Китае превышает предложение

Huawei приостановила международное расширение рынка чипов для искусственного интеллекта, поскольку внутренний спрос в Китае превышает доступное предложение. Эта стратегическая сдвиг означает, что конкуренты AMD и Nvidia больше не сталкиваются с немедленным давлением со стороны глобального выхода Huawei на рынок.

media Hugging Face Forums · 3 д назад · 16 просмотров

Предложение о прогрессивном росте моделей и открытом профиле оборудования для Трансформеров

Предложение на Hugging Face обсуждает две взаимосвязанные проблемы в ИИ: зависимость от обучения отдельных больших моделей и зависимость экосистемы от универсальных GPU.

github llama.cpp · 3 д назад · 20 просмотров

llama.cpp b11059 добавляет поддержку F16 в ядро FWHT для Metal

Проект llama.cpp выпустил сборку b11059, которая вносит значительные обновления в бэкенд Metal для оборудования Apple Silicon. Основное изменение — добавление поддержки входных данных F16 в ядро быстрого преобразования Уолша-Адамара (FWHT), что позволяет ему напрямую считывать источники F16 без необходимости создания конвертированной копии.

github llama.cpp · 5 д назад · 21 просмотр

llama.cpp повышает лимит экспертов для mul_mat_id в Vulkan до 1024

Проект llama.cpp увеличил вынесенный предел row-id для операции Vulkan mul_mat_id с 256 до 1024 экспертов. Это изменение устраняет узкие места производительности в моделях с большим количеством экспертов, таких как Qwen3.8-Flash-Next, которые ранее работали по более медленному пути кода из-за ограничений размера разделяемого массива.

github llama.cpp · 7 д назад · 20 просмотров

llama.cpp b10994 исправляет Metal NaN в mul_mm_id для больших активаций

Релиз llama.cpp b10994 включает исправление для бэкенда Metal, устраняющее выходные значения NaN в операции `mul_mm_id` при превышении значениями активации диапазона f16. Этот дефект ранее приводил к тому, что модели, такие как Mistral Small 4, генерировали полностью NaN словари на этапах префиллинга длиной 32 токена и более на устройствах Apple Silicon.

media Hugging Face Forums · 9 д назад · 18 просмотров

MOLT обеспечивает ускорение QLoRA-дообучения Qwen 1.5B на 23% по сравнению с Unsloth на RTX 4060 Laptop

Автор создал MOLT, среду выполнения с приоритетом для Windows, учитывающую тепловыделение при QLoRA-дообучении на потребительских видеокартах NVIDIA, и провёл её бенчмаркирование по сравнению с Unsloth на основе одного миллиона обучающих целей модели Qwen 1.5B на GPU RTX 4060 Laptop.

media r/LocalLLaMA · 11 д назад · 22 просмотра

Пользовательский код ускоряет работу DeepSeek V4.1 на GPU A100 быстрее официального API

Пользователь разработал собственную реализацию, позволяющую запускать модель DeepSeek V4.1 на графических процессорах NVIDIA A100 с производительностью, превышающей показатели официального API.

media Hugging Face Forums · 11 д назад · 13 просмотров

Предложение по созданию независимого от поставщиков ИИ-рантайма с учётом бюджета памяти

В предложениях на форумах Hugging Face описан общий слой выполнения и управления памятью GPU, предназначенный для разделения кода приложений от конкретных аппаратных поставщиков, таких как NVIDIA, AMD и Intel. Цель состоит в том, чтобы позволить пользователям указывать бюджет памяти вместо ручной настройки специфичных для бэкенда флагов, карт устройств или стратегий выгрузки.