Hardware & chips
github llama.cpp · 2 д назад · 1 просмотр

llama.cpp b10306 добавляет плоский путь GLU для SYCL и объединяет ядра

Релиз llama.cpp b10306 вносит оптимизации производительности для бэкенда SYCL, конкретно направленные на операции Gated Linear Unit (GLU). Обновление добавляет непрерывный быстрый путь для объединённых операций GLU и объединяет ранее различные ядра для использования общего загрузчика.

github llama.cpp · 5 д назад · 2 просмотра

llama.cpp b10255 расширяет oneDNN SDPA для не-FP16 KV-кэшей

Релиз llama.cpp b10255 расширяет путь oneDNN SDPA для поддержки не-FP16 ключ-значения (KV) кэшей, включая форматы квантования Q4_0–Q8_0 и FP32. Это обновление позволяет слитому систолическому ядру выполняться идентично нативному пути FP16 за счёт деквантования или преобразования тензоров K/V в плотный FP16 на устройстве перед обработкой.

media r/LocalLLaMA · 10 д назад · 1 просмотр

Lucebox и AMD обогнали Nvidia DGX Spark в 3,63 раза на DeepSeek V4 Flash

Lucebox объединила усилия с AMD для демонстрации гетерогенной конфигурации потребительского оборудования, которая превосходит Nvidia DGX Spark по скорости вывода. Система сочетает GPU AMD Radeon AI PRO R9700 и процессор Strix Halo для запуска полной модели DeepSeek V4 Flash на 284B.

lab Hugging Face Blog · 10 д назад · 2 просмотра

Управление GPU: почему простаивающие GPU — это новые стоящие на земле самолёты

В статье утверждается, что утилизация GPU, а не интеллект моделей, стала основным ограничением в корпоративном ИИ, проводя параллели с утилизацией авиалайнеров, где расходы накапливаются почасово независимо от использования.

media Hugging Face Forums · 11 д назад · 1 просмотр

Пейшенс Стронг предлагает строить нейросети как полупроводниковые устройства

Пейшенс Стронг утверждает, что современные нейросети потребляют чрезмерную вычислительную мощность, эмулируя схемы в программном обеспечении, а не реализуя их в виде физического оборудования. В статье предлагается заменить эту эмуляцию полупроводниковым устройством, где веса и смещения хранятся в энергонезависимой памяти.

lab Hugging Face Blog · 12 д назад

Ai2 выпускает платформу OlmoEarth для геопространственного вывода планетарного масштаба

Ai2 запустила платформу OlmoEarth — инфраструктурную систему, предназначенную для перевода моделей-основателей наблюдения за Землёй от тонкой настройки к выводу крупного масштаба. Платформа решает инженерные задачи обработки терабайтов мультимодальных спутниковых данных от нескольких поставщиков и с различным разрешением.

media r/LocalLLaMA · 13 д назад · 1 просмотр

Выкладка весов Kimi K3; запланировано развертывание на A100, H200, B300

Moonshot выложила веса своей модели Kimi K3 на Hugging Face. Модель имеет 2,8 триллиона параметров и архитектуру mixture-of-experts с 16 активными экспертами на токен. Команда планирует развернуть модель на GPU A100, H200 и B300, результаты бенчмарков ожидаются на этой неделе.

lab IBM Research (Granite) · 16 д назад

IBM приобретает HRL Laboratories ради экспертизы в области спиновых кубитов на кремнии

IBM подписала окончательное соглашение о приобретении HRL Laboratories, исторического исследовательского института с почти 80-летним вкладом в науку. Целью приобретения является ускорение реализации видения IBM в области квантовых вычислений за счет интеграции передовой экспертизы HRL в инженерии спиновых кубитов на кремнии.

media TLDR AI · 17 д назад · 1 просмотр

Сделка AMD и Anthropic: AMD будет поставлять чипы MI450 и инвестирует $5 млрд

Компании AMD и Anthropic подписали крупное соглашение, касающееся десятков миллиардов долларов на серверы для ИИ, при этом Anthropic закупит до 2 гигаватт чипов AMD Instinct MI450 начиная с первой половины следующего года. Параллельно AMD инвестирует до $5 млрд в Anthropic по мере выполнения конкретных этапов развертывания, а обе компании совместно работают над определением подходящих центров обработки данных для оборудования.

arxiv arXiv cs.AI · 17 д назад · 4 просмотра

SLAI T-Rex позволяет проводить полное параметрическое постобучение модели DeepSeek-V4 на платформе Ascend SuperPOD

SLAI представляет T-Rex — сквозную оптимизационную платформу для полного параметрического постобучения моделей MoE триллионного масштаба на суперкластере NPU Ascend. Используя семейство моделей DeepSeek-V4 в качестве целевой нагрузки, система решает проблемы с памятью и накладными расходами на коммуникацию за счёт иерархического параллелизма и оптимизации выполнения ядер.

arxiv arXiv cs.CL · 17 д назад · 1 просмотр

SLAI T-Rex позволяет проводить полное параметрическое постобучение DeepSeek-V4 на Ascend SuperPOD

SLAI представляет T-Rex, сквозную оптимизационную рамку для полного параметрического постобучения MoE-моделей триллионного масштаба на Ascend NPU SuperPOD. Используя семейство моделей DeepSeek-V4 в качестве целевой рабочей нагрузки, система решает проблемы с давлением памяти и накладными расходами на коммуникацию за счёт иерархического параллелизма и оптимизаций выполнения ядер.

lab IBM Research (Granite) · 17 д назад

IBM выделяет $50 млн на доступ к квантовым вычислениям для миссии DoE Genesis

Министерство энергетики США (DoE) выбрало IBM для руководства проектом в рамках запроса заявок миссии Genesis, обязавшись предоставить доступ к квантовым вычислениям на сумму до $50 млн для поддержки этой инициативы.

lab OpenAI News · 18 д назад · 2 просмотра

OpenAI излагает обязательства по центру обработки данных Project Camellia в округе Эффингем

OpenAI объявила подробности о проекте Project Camellia, долгосрочном проекте центра обработки данных в округе Эффингем, штат Джорджия, outlining свои первоначальные обязательства перед сообществом в отношении электроэнергии, воды и локальных выгод. Компания заключила контракт с Georgia Power Company на 3.2 гигаватта мощности, которые будут поставляться в период с 2028 по 2032 год.

media Together AI Blog · 19 д назад · 2 просмотра

Together AI и Y Combinator запускают выделенный GPU-кластер для стартапов YC

Компании Together AI и Y Combinator объявили о партнёрстве, направленном на предоставление первого выделенного GPU-кластера исключительно для портфеля AI-native стартапов Y Combinator. Эта инициатива призвана решить критическую проблему доступа к вычислительным ресурсам за счёт предоставления гибкой и экономически эффективной инфраструктуры для обучения и вывода моделей без необходимости долгосрочных обязательств.

media r/LocalLLaMA · 21 д назад · 2 просмотра

Moonshot AI приостанавливает новые подписки и бесплатный доступ из-за нехватки GPU

Китайская компания искусственного интеллекта Moonshot AI стала первой в Китае, исчерпавшей мощности GPU. В связи с этим компания приняла решение приостановить оформление новых подписок и отменить бесплатный доступ для пользователей.

media Together AI Blog · 23 д назад

Together AI объясняет, что означают 99%, 99.9% и 99.99% времени безотказной работы для GPU-инференса

Together AI подробно описывает специфические архитектурные требования, необходимые для достижения различных уровней надежности при GPU-инференсе, утверждая, что стандартные показатели SLA часто скрывают реальные домены отказов.

lab NVIDIA Technical Blog · 24 д назад · 2 просмотра

NVIDIA предлагает со-проектирование BlueField для масштабирования фабрик Agentic AI

NVIDIA описывает, как экстремальное со-проектирование с её процессорами BlueField может решить инфраструктурные проблемы, вызванные рабочими нагрузками Agentic AI. Компания утверждает, что по мере того как агентные системы запускают сложные цепочки вызовов моделей, взаимодействий с инструментами и поиска данных, традиционные инфраструктурные паттерны становятся недостаточными для поддержания производительности.

lab NVIDIA Technical Blog · 24 д назад

NVIDIA CUDA 13.3 добавляет нативную поддержку умножения без переноса

NVIDIA ввела новую инструкцию PTX для умножения без переноса в CUDA 13.3, устраняя давний пробел: несмотря на наличие этой операции на процессорах x86 уже более пятнадцати лет, графические процессоры не имели нативной поддержки.