Open weights
media MarkTechPost · 1 д назад · 1 просмотр

Mistral AI выпустила Shieldstral 1.0 3B, многомодальный классификатор безопасности с адаптацией к политике

Mistral AI выпустила Shieldstral 1.0 3B, модель с открытыми весами, которая рассматривает модерацию контента как единый вопрос «да/нет», а не опирается на фиксированные категории вреда. Построена на базе Ministral-3-3B-Base-2512 с визуальным энкодером Pixtral, она позволяет операторам определять политики через текстовые подсказки во время вывода без переобучения.

media r/LocalLLaMA · 1 д назад · 5 просмотров

Министерство энергетики США запускает инициативу Genesis Open Models и представляет Genesis-Science-1

Министерство энергетики США запустило инициативу Genesis Open Models и в партнерстве с Arcee представило свою первую модель с открытым весом для научных исследований под названием Genesis-Science-1.

media MarkTechPost · 1 д назад

NVIDIA выпустила NOOA, объектно-ориентированную Python-фреймворк для создания ИИ-агентов

Лаборатории NVIDIA открыли исходный код NOOA (NVIDIA Object-Oriented Agents), фреймворка на Python, не зависящего от моделей, который объединяет разработку агентов в один класс Python. Этот подход заменяет фрагментированные рабочие процессы, включающие шаблоны запросов и графы рабочих процессов, сопоставляя методы действиям, поля — состоянию, docstrings — запросам, а аннотации типов — обязательным контрактам.

media TLDR AI · 2 д назад · 2 просмотра

Google открыл исходные коды моделей WeatherNext; Meta исследует кросс-модальную синергию

Компания Google открыла исходный код своих ИИ-моделей WeatherNext 2 и WeatherNext Cyclones для повышения точности прогнозирования циклонов. Модели демонстрируют результаты уровня state-of-the-art в прогнозировании траектории, интенсивности и структуры ветра, предоставляя синоптикам в среднем на один день больше прогнозной точности по сравнению с текущими методами.

media The Batch · 2 д назад Code Arena (Elo) · 1577.0Elo · 1 просмотр

DeepSeek выпустила V4-Flash-0731, превосходящую V4-Pro при меньшей стоимости

DeepSeek выпустила DeepSeek-V4-Flash-0731, обновленную версию своей более легкой модели "Flash", которая превосходит более крупную DeepSeek-V4-Pro в независимых бенчмарках. Выпуск использует новый процесс тонкой настройки, сохраняя оригинальную архитектуру Mixture-of-Experts с 284 миллиардами общих параметров.

media MarkTechPost · 2 д назад · 1 просмотр

Liquid AI выпустила LFM2.5-2.6B, модель с открытыми весами для агентов на устройстве

Liquid AI выпустила LFM2.5-2.6B — модель с 2,69 миллиарда параметров, предназначенную для работы исключительно на локальных устройствах, таких как смартфоны, ноутбуки и роботы. Модель имеет контекстное окно на 131 072 токена и была предварительно обучена примерно на 34 триллионах токенов.

lab Google DeepMind Blog · 3 д назад · 16 просмотров

Google DeepMind открыла исходный код модели WeatherNext AI для прогнозирования циклонов

Компании Google DeepMind и Google Research опубликовали исходные коды моделей WeatherNext 2 и WeatherNext Cyclones, которые продемонстрировали наивысшую точность в прогнозировании траекторий тропических циклонов, их интенсивности и структуры ветра. Опубликованная в журнале Nature работа показывает, что эти модели обеспечивают метеорологам дополнительный день предсказательной точности по сравнению с предыдущими системами.

media Hugging Face Forums · 3 д назад · 1 просмотр

QuantCheck предупреждает против предположения, что финальный чекпоинт лучше всего подходит для 4-битного квантования

Новый инструмент QuantCheck подчеркивает, что финальный чекпоинт предварительного обучения может не быть оптимальным выбором для 4-битного квантования, поскольку бенчмарки могут оставаться плоскими, в то время как хрупкость увеличивается. Автор наблюдал эту закономерность на Pythia-160m, где финальный чекпоинт suffered примерно в четыре раза больше повреждений качества, чем более ранний чекпоинт того же качества.

media MarkTechPost · 4 д назад · 1 просмотр

NVIDIA выпустила Alpamayo 2 Super, 34B открытую VLA-модель для автономного вождения

NVIDIA выпустила Alpamayo 2 Super, 34-миллиардную модель vision-language-action (VLA), предназначенную для роботакси и автономного вождения под лицензией OpenMDW-1.1. Модель ориентирована на обработку редких событий за счёт объединения бэкбона Cosmos 3 Super Reasoner на 32B с диффузионным декодером действий на 2.3B, который генерирует траектории, каузальные объяснения и мета-действия из видео с нескольких камер.

media r/LocalLLaMA · 4 д назад

США освобождают китайские модели с открытым весом от тестов на безопасность

Соединенные Штаты решили освободить китайские модели искусственного интеллекта с открытым весом от обязательных требований к тестированию безопасности. Этот сдвиг в политике означает, что компании, разрабатывающие эти конкретные модели, больше не будут подпадать под обычные оценки безопасности США.

media AI News (smol.ai) · 4 д назад Terminal-Bench 2 · 67.4% · 8 просмотров

Alibaba анонсировала Qwen3.8-Max с 2,4 трлн параметров и скорым открытием весов

Alibaba объявила о выпуске Qwen3.8-Max в качестве новой флагманской модели, описав её как разреженную архитектуру на 2,4 трлн параметров, ориентированную на долгосрочные агентные задачи, программирование и мультимодальное рассуждение. Компания подтвердила, что открытые веса для Qwen3.8-Max будут опубликованы на следующей неделе вместе с вариантом Qwen3.8-27B с открытыми весами.

media r/LocalLLaMA · 4 д назад · 1 просмотр

Mistral AI представляет Shieldstral

Mistral AI объявила о выпуске новой модели под названием Shieldstral. Исходный контент содержит только заголовок и метаданные публикации без каких-либо дополнительных сведений о функциях, возможностях или назначении модели.

lab Liquid AI · 5 д назад · 5 просмотров

Выход LFM2.5-2.6B: агентная модель для локального вывода на устройстве

Авторы выпускают LFM2.5-2.6B, агентную модель с 2,6 млрд параметров, предназначенную для полного выполнения задач планирования, вызова инструментов и многошаговых операций непосредственно на устройстве. Она достаточно компактна для работы на смартфонах и быстра для поддержания отзывчивости на процессорах, обеспечивая бесплатный вывод, низкую задержку и конфиденциальность без зависимости от облачных API.

lab Hugging Face Blog · 5 д назад · 2 просмотра

Liquid AI выпустила LFM2.5-2.6B для локального агентного развертывания

Компания Liquid AI выпустила модель LFM2.5-2.6B, агента с 2,6 миллиарда параметров, предназначенный для работы на устройствах периферийных вычислений с высокой эффективностью и совместимостью.

lab Mistral AI News · 5 д назад · 3 просмотра

Shieldstral представляет адаптивный к политике 3B мультимодальный классификатор безопасности

Shieldstral — это 3B модель с открытыми весами, являющаяся мультимодальным классификатором безопасности, которая рассматривает модерацию контента как задачу ответа на вопросы, адаптируемую к политике, что позволяет ей принимать политики на естественном языке во время вывода без переобучения. Она объединяет оценку безопасности текста и изображений и предоставляет калиброванные оценки безопасности по различным бенчмаркам, эффективно работая на одном GPU NVIDIA с 16 ГБ памяти.

media Latent Space · 5 д назад · 2 просмотра

Alibaba анонсировала Qwen 3.8 Max — модель с 2,4 трлн параметров и открытыми весами, которая выйдет на следующей неделе

Команда Qwen от Alibaba объявила о выпуске Qwen 3.8 Max, новой флагманской модели с 2,4 трлн параметров, ориентированной на программирование, долгосрочную автономную работу агентов и мультимодальное рассуждение. Компания подтвердила, что на следующей неделе будут выпущены версии с открытыми весами как для Qwen 3.8 Max, так и для более компактной модели Qwen 3.8-27B.