Тема · Open weights
lab Microsoft Research Blog · 2 д назад · 28 просмотров

Microsoft выпустила RetroChimera для предсказания ретросинтеза

Microsoft Research опубликовала и открыла исходный код RetroChimera, новой системы для предсказания ретросинтеза, которая объединяет две взаимодополняющие модели для предложения высококачественных путей синтеза. Система интегрирует R-SMILES 2, модель на основе Transformer для de-novo генерации, с NeuralLoc, моделью на основе графовых нейронных сетей (GNN), используя обученную стратегию ансамблирования для ранжирования предсказаний.

lab Google DeepMind Blog · 15 д назад · 35 просмотров

Google DeepMind выпустила AlphaGenome Atlas для каждого варианта человеческой ДНК

Google DeepMind выпустила AlphaGenome Atlas — платформу, содержащую прогнозы эффектов 9 миллиардов однонуклеотидных вариантов по всему геному человека. Этот ресурс призван ускорить биологическое понимание, предоставляя всеобъемлющую карту того, как генетические мутации влияют на молекулярную биологию.

lab Microsoft Research Blog · 22 д назад · 42 просмотра

Microsoft выпустила GigaPath-Flash и GigaTIME-Flash для эффективных патологических фундаментальных моделей

Microsoft Research выпустила GigaPath-Flash и GigaTIME-Flash, эффективные варианты своих патологических фундаментальных моделей, предназначенные для масштабных исследований на уровне популяции за счёт резкого снижения вычислительных требований.

lab Zhipu / Z.ai (GLM, HF) · 26 д назад · 53 просмотра

Zhihui AI выпускает GLM-5.3 с улучшенными возможностями программирования и кибербезопасности

Компания Zhihui AI выпустила GLM-5.3, модель с открытыми весами, которая построена на базовой архитектуре GLM-5.2 за счёт улучшений после обучения. Обновление значительно повышает производительность в сложных задачах программирования и долгосрочных сценариях, устанавливая новые рекорды на нескольких публичных бенчмарках.

lab Zhipu / Z.ai (GLM, HF) · 26 д назад · 54 просмотра

Zai выпустила GLM-5.3 с улучшенными возможностями программирования и кибербезопасности

Zai выпустила GLM-5.3, модель с открытыми весами, которая построена на базовой архитектуре GLM-5.2 благодаря обширной постобучению. Обновление обеспечивает значительный прогресс в сложных задачах программирования и долгосрочных сценариях, устанавливая новые рекорды на нескольких публичных бенчмарках.

lab Zhipu / Z.ai (GLM, HF) · 28 д назад · 76 просмотров

ZhiPu выпустила GLM-5.3-Flash, мультимодальную модель с 320B параметров

ZhiPu представляет GLM-5.3-Flash, первую нативно мультимодальную модель в серии GLM-5, использующую гибридную архитектуру, сочетающую разреженное и линейное внимание для снижения затрат на обслуживание длинного контекста при сохранении точности.

lab Google — The Keyword (AI) · 8 д назад · 23 просмотра

Google расширяет возможности многоязычного ИИ с помощью Gemini 3.5, открытых наборов данных и офлайн-перевода

Google сообщает, что его технологии теперь поддерживают более 300 языков для более чем 7 миллиардов человек, представляя новые инструменты для улучшения понимания речи, сбора данных для недостаточно представленных языков и обеспечения доступности.

lab Tencent Hunyuan (HF) · 26 д назад · 63 просмотра

Tencent выпустила модель MoE Hy4-preview с 770B параметров

Команда Tencent Hy открыла исходный код Hy4-preview, флагманской модели нового поколения Mixture-of-Experts, включающей 770B общих параметров и активирующей 49B на токен. Архитектура состоит из 78 слоев: первый использует плотную FFN, а остальные 77 — MoE с 256 маршрутизируемыми экспертами, а также нативный слой MTP для спекулятивного декодирования.

media AI News (smol.ai) · 10 д назад · 38 просмотров

DeepSeek выпустила V4.1-Flash — модель с открытыми весами, ориентированную на экстремальную эффективность вывода

DeepSeek выпустила V4.1-Flash, новую флагманскую модель с открытыми весами, предназначенную для экстремальной эффективности вывода и низкой стоимости. Модель использует причинную архитектуру энкодер-декодер для значительного снижения активных вычислений и затрат на KV/кэш.

media Latent Space · 11 д назад · 27 просмотров

DeepSeek выпустила v4.1-Flash с архитектурой 763B-P8B-D16B для эффективного вывода

DeepSeek запустила DeepSeek v4.1-Flash, новую флагманскую модель с открытыми весами, использующую новую причинную архитектуру кодировщика-декодатора, разработанную для максимизации эффективности вывода и снижения затрат.

media MarkTechPost · 13 д назад · 51 просмотр

DeepSeek выпустила DeepSeek-V4.1-Flash с контекстом 1M и FP4 KV-кэшем

Компания DeepSeek AI выпустила модель DeepSeek-V4.1-Flash, мультимодальную Mixture-of-Experts модель с контекстным окном на 1 миллион токенов и FP4 KV-кэшем, который сокращает глобальный размер кэша до 890 байт на токен. Модель использует причинно-следующую архитектуру кодировщика-декодировщика и Compressed Sparse Attention 2 (CSA2) для значительного снижения требований к памяти при сохранении производительности.

lab Tencent Hunyuan (HF) · 26 д назад · 62 просмотра

Tencent выпустила предварительную версию MoE-модели Hy4 с 770B параметров

Команда Tencent Hy открыла исходный код Hy4 preview — флагманской модели нового поколения Mixture-of-Experts, состоящей из 770B общих параметров, из которых на каждый токен активируется 49B. Архитектура включает 78 слоёв: первый использует плотную FFN, а остальные 77 применяют MoE с 256 маршрутизируемыми экспертами, а также нативный слой MTP для спекулятивного декодирования.

media AI News (smol.ai) · 27 д назад GDPval-AA (Elo) · 1770.0Elo · 57 просмотров

Z.ai выпускает GLM-5.3-Flash: мультимодельную модель с 320 млрд параметров и контекстом на 1 млн токенов

Z.ai официально выпустила GLM-5.3-Flash, раскрыв, что ранее представленная модель "Ox Alpha" является её публичным именем. Модель имеет 320 миллиардов общих параметров, из которых 18 миллиардов активны, контекстное окно на 1 миллион токенов и нативные мультимодальные возможности.

media MarkTechPost · 27 д назад · 73 просмотра

Z.ai выпускает GLM-5.3-Flash: мультимодальную MoE-модель с 320B параметров и контекстом в 1 млн токенов

Z.ai выпустила GLM-5.3-Flash, первую нативно мультимодальную модель в серии GLM-5, использующую архитектуру mixture-of-experts с общим количеством параметров 320 миллиардов и 18 миллиардами активных на токен. Модель поддерживает ввод изображений и видео в окне контекста длиной 1 048 576 токенов и доступна по лицензии MIT на Hugging Face.

media MarkTechPost · 28 д назад · 68 просмотров

Команда Qwen от Alibaba выпустила Qwen3.8-Flash-Next — 125B MoE с предпросмотром архитектуры Qwen4

Команда Qwen от Alibaba выпустила Qwen3.8-Flash-Next, мультимодельную модель Mixture-of-Experts с открытыми весами, предназначенную для демонстрации архитектуры будущей серии Qwen4. Чекпоинт сочетает в себе базовую модель на 125B параметров, таблицу N-граммных эмбеддингов на 51B и модуль многозадачного предсказания токенов на 4B, активируя лишь 6B параметров на каждый токен.

media r/LocalLLaMA · 28 д назад · 87 просмотров

Zhipu AI выпустила GLM-5.3-Flash, мультимодальную модель с открытыми весами

Zhipu AI выпустила GLM-5.3-Flash, первую нативно мультимодальную модель в серии GLM-5 и первый релиз архитектуры glm5_next с открытыми весами. Модель с 320B параметров обучена на 30T-токенном мультимодальном корпусе и использует гибридный механизм внимания, сочетающий разреженность и линейность, для снижения затрат на обслуживание длинного контекста.

lab IBM Research (Granite) · 29 д назад · 46 просмотров

IBM выпустила Granite 4.2 с нативным рассуждением и Granite Speech 5.0 Turbo

IBM выпустила обновлённые языковые модели Granite 4.2 в размерах 3B, 8B и 30B параметров, специально созданные для корпоративных агентных рабочих процессов с встроенными возможностями пошагового рассуждения. Наряду с языковыми моделями IBM представила Granite Speech 5.0 Turbo CTC — лёгкую модель распознавания речи, оптимизированную для высокопроизводительной транскрипции на периферийных устройствах.

media TLDR AI · 2 ч назад · 10 просмотров

Xiaomi открыла исходный код моделей MiMo-V2.6 Pro и Flash

Xiaomi открыла исходный код омнимодальных моделей MiMo-V2.6 Pro и Flash, предназначенных для координации агентов при создании и визуальном тестировании интерактивных 3D-сцен. Эти модели могут генерировать ассеты Blender, управлять роботизированными манипуляторами по данным с камер, создавать фронтенды и презентации, собирать видео и сочинять музыку в виде партитур и MIDI.