Hardware & chips
media r/LocalLLaMA · 1 д назад · 11 просмотров

Alibaba планирует ИИ-модель с 5–10 триллионами параметров и представляет новый чип

Alibaba объявила о планах разработки модели искусственного интеллекта, содержащей от 5 до 10 триллионов параметров. В рамках этого плана компания также представила новый собственный чип, разработанный для поддержки её инфраструктурных потребностей.

media r/LocalLLaMA · 2 д назад · 11 просмотров

Huawei откладывает глобальный запуск ИИ-чипов, так как внутренний спрос в Китае превышает предложение

Huawei приостановила международное расширение рынка чипов для искусственного интеллекта, поскольку внутренний спрос в Китае превышает доступное предложение. Эта стратегическая сдвиг означает, что конкуренты AMD и Nvidia больше не сталкиваются с немедленным давлением со стороны глобального выхода Huawei на рынок.

media Hugging Face Forums · 3 д назад · 16 просмотров

Предложение о прогрессивном росте моделей и открытом профиле оборудования для Трансформеров

Предложение на Hugging Face обсуждает две взаимосвязанные проблемы в ИИ: зависимость от обучения отдельных больших моделей и зависимость экосистемы от универсальных GPU.

github llama.cpp · 3 д назад · 20 просмотров

llama.cpp b11059 добавляет поддержку F16 в ядро FWHT для Metal

Проект llama.cpp выпустил сборку b11059, которая вносит значительные обновления в бэкенд Metal для оборудования Apple Silicon. Основное изменение — добавление поддержки входных данных F16 в ядро быстрого преобразования Уолша-Адамара (FWHT), что позволяет ему напрямую считывать источники F16 без необходимости создания конвертированной копии.

github llama.cpp · 5 д назад · 21 просмотр

llama.cpp повышает лимит экспертов для mul_mat_id в Vulkan до 1024

Проект llama.cpp увеличил вынесенный предел row-id для операции Vulkan mul_mat_id с 256 до 1024 экспертов. Это изменение устраняет узкие места производительности в моделях с большим количеством экспертов, таких как Qwen3.8-Flash-Next, которые ранее работали по более медленному пути кода из-за ограничений размера разделяемого массива.

github llama.cpp · 7 д назад · 20 просмотров

llama.cpp b10994 исправляет Metal NaN в mul_mm_id для больших активаций

Релиз llama.cpp b10994 включает исправление для бэкенда Metal, устраняющее выходные значения NaN в операции `mul_mm_id` при превышении значениями активации диапазона f16. Этот дефект ранее приводил к тому, что модели, такие как Mistral Small 4, генерировали полностью NaN словари на этапах префиллинга длиной 32 токена и более на устройствах Apple Silicon.

lab NVIDIA Research · 7 д назад · 16 просмотров

ShareMMU обеспечивает безопасное разделение трансляции адресов между недоверенными ускорителями с малыми накладными расходами

Исследователи представляют ShareMMU, дизайн IOMMU, который позволяет нескольким недоверенным ускорителям безопасно повторно использовать предварительно транслированные адреса в общем виртуальном адресном пространстве. Этот подход снижает риски побочных каналов, связанные с большими общими таблицами трансляции (TLB), сохраняя при этом высокую производительность.

media Hugging Face Forums · 9 д назад · 18 просмотров

MOLT обеспечивает ускорение QLoRA-дообучения Qwen 1.5B на 23% по сравнению с Unsloth на RTX 4060 Laptop

Автор создал MOLT, среду выполнения с приоритетом для Windows, учитывающую тепловыделение при QLoRA-дообучении на потребительских видеокартах NVIDIA, и провёл её бенчмаркирование по сравнению с Unsloth на основе одного миллиона обучающих целей модели Qwen 1.5B на GPU RTX 4060 Laptop.

media r/LocalLLaMA · 11 д назад · 22 просмотра

Пользовательский код ускоряет работу DeepSeek V4.1 на GPU A100 быстрее официального API

Пользователь разработал собственную реализацию, позволяющую запускать модель DeepSeek V4.1 на графических процессорах NVIDIA A100 с производительностью, превышающей показатели официального API.

media Hugging Face Forums · 11 д назад · 13 просмотров

Предложение по созданию независимого от поставщиков ИИ-рантайма с учётом бюджета памяти

В предложениях на форумах Hugging Face описан общий слой выполнения и управления памятью GPU, предназначенный для разделения кода приложений от конкретных аппаратных поставщиков, таких как NVIDIA, AMD и Intel. Цель состоит в том, чтобы позволить пользователям указывать бюджет памяти вместо ручной настройки специфичных для бэкенда флагов, карт устройств или стратегий выгрузки.

lab NVIDIA Research · 11 д назад · 20 просмотров

Onyx обеспечивает снижение стоимости в 1,7–9,9 раза и задержки в 2,3–12,3 раза для disk-oblivious ANN-поиска

Исследователи предлагают Onyx — энергоэффективный подход к disk-oblivious приближенному поиску ближайших соседей (ANN), который балансирует пропускную способность и количество обращений путем инвертирования архитектуры современных систем ORAM-ANN.

lab NVIDIA Research · 11 д назад · 20 просмотров

NVIDIA выпускает GPIR для ускорения на GPU конфиденциального поиска информации

Исследователи из NVIDIA представили GPIR, систему, которая ускоряет выполнение Private Information Retrieval (PIR) на графических процессорах за счёт решения проблем с высокой вычислительной нагрузкой и трафиком памяти на стороне сервера, присущих протоколам на основе решёток. Система использует гибридную модель выполнения, учитывающую стадию обработки, которая динамически переключается между ядрами уровня операций и уровня стадий для максимизации повторного использования данных внутри чипа.

lab NVIDIA Research · 11 д назад · 21 просмотр

NVIDIA характеризует производительность и стоимость MPC и FHE для PPML

Новое исследование представляет унифицированную системную характеристику безопасных многосторонних вычислений (MPC) и полностью гомоморфного шифрования (FHE) для машинного обучения с сохранением конфиденциальности. Работа оценивает два варианта MPC — преобразование арифметического/бинарного разделения и секретное разделение функций — наряду с FHE в нескольких моделях CNN и Transformer.

media Together AI Blog · 13 д назад · 59 просмотров

Together AI оптимизирует GEMM ThunderKittens для NVIDIA Vera Rubin NVL72

Команда разработчиков ядер Together AI оптимизировала библиотеку ThunderKittens для использования новых функций платформы NVIDIA Vera Rubin NVL72, с особым акцентом на повышение производительности матричных умножений в форматах NVFP4 и FP8.

media Together AI Blog · 13 д назад · 16 просмотров

В кластерах GPU Together добавлены прерываемые узлы со скидкой 50%

Together AI анонсировала публичную предварительную версию прерываемых вычислений для Together GPU Clusters на Kubernetes, предлагая более дешёвый вариант для нагрузок, устойчивых к прерываниям. Прерываемые узлы используют неиспользуемые мощности NVIDIA accelerated и тарифицируются по фиксированной ставке 50% от цены on-demand.

github llama.cpp · 13 д назад · 19 просмотров

llama.cpp b10891 устраняет сбой Vulkan на PowerVR за счёт перехода к редукции через общую память

Проект llama.cpp выпустил версию b10891, которая решает критическую проблему стабильности на графических процессорах PowerVR. Обновление изменяет бэкенд Vulkan для перехода к редукции через общую память при операциях умножения деquantized матрицы на вектор (dmmv).

lab OpenAI News · 15 д назад · 39 просмотров

GPT-5.6 Sol от MIT автоматизирует калибровку квантовых чипов через Codex

Беатрис Янкелевич из группы инженерии квантовых систем Массачусетского технологического института использовала GPT‑5.6 Sol, интегрированную с Codex, для автономного выполнения и уточнения рутинных измерений на сверхпроводящих кубитах. Эта интеграция позволяет агенту ИИ управлять лабораторным программным обеспечением, анализировать результаты и принимать решения о последующих шагах без постоянного контроля со стороны человека.

media TLDR AI · 15 д назад · 26 просмотров

Anthropic обеспечила вычислительные мощности на $517 млрд; OpenAI готовит управляемые агенты

Anthropic заключила договоры на аренду вычислительных мощностей на сумму $517 миллиардов за последние 11 месяцев, что составляет 14,8 ГВт, в основном с Google и AWS. Это расширение включает крупные сделки с облачными провайдерами, такими как Akamai и Fluidstack, а также соглашение на $45 млрд с Nscale.

github llama.cpp · 16 д назад · 44 просмотра

llama.cpp b10839 исправляет сбои из-за несовпадения смещений GET_ROWS в Vulkan

Проект llama.cpp выпустил версию b10839, устраняющую критические сбои в бэкенде Vulkan, вызванные несовпадением смещений при операциях извлечения строк тензора. Ранее модели Qwen3-TTS и Qwen3-VL давали сбой при использовании `ggml_view` со смещениями вида, отличными от нуля, поскольку шейдер выдавал ошибку при нарушении выравнивания относительно `minStorageBufferOffsetAlignment`. Данное обновление реализует нативную поддержку выровненных смещений как в квантованных, так и в неквантованных путях, устраняя необходимость возврата к CPU.