Тема · Multimodal
lab Google — The Keyword (AI) · 26 д назад · 2 просмотра

Google Images представляет новую галерею и генерацию изображений Nano Banana

К своему 25-летнему юбилею Google запускает переработанную, удобную для навигации главную страницу Google Images наряду с новыми возможностями генерации изображений в AI Overviews.

lab NVIDIA Research · 12 д назад · 8 просмотров

NVIDIA представляет Spatial-IQ: иерархическую диагностическую систему для пространственного мышления мультимодальных моделей

Исследователи NVIDIA представили Spatial-IQ — диагностическую систему, предназначенную для деконструкции пространственного интеллекта мультимодальных больших языковых моделей (MLLMs). В отличие от существующих бенчмарков, которые рассматривают модели как чёрные ящики, этот подход разбивает подсчёт объектов в стопках 3D-структур на девять перцептивных и когнитивных подзадач, согласованных с этапами человеческого развития.

lab NVIDIA Research · 12 д назад · 3 просмотра

Мультимодальный ИИ-анализ невербальной коммуникации в Delta Force

Исследователи анализируют видео игрового процесса соревновательного шутера Delta Force, чтобы извлечь и понять возникающую невербальную коммуникацию, такую как жесты и паттерны перемещения. Эта работа восполняет пробел в предыдущих исследованиях, которые в значительной степени фокусировались на MOBA-играх или вербальной координации в других шутерах.

lab Google — The Keyword (AI) · 18 д назад

Google расширяет возможности автоматизации задач Gemini Intelligence и приносит Notebook на устройства Galaxy

На Galaxy Unpacked 2026 Google объявил о трех обновлениях для новых Samsung Galaxy Z Fold8 Ultra, Fold8 и Flip8, сосредоточившись на внедрении Gemini Intelligence. Компания расширяет свои возможности автоматизации задач для поддержки более чем 40 популярных приложений и представляет приложение Gemini Notebook непосредственно на этих устройствах.

lab NVIDIA Research · 25 д назад

Исследование VR показывает, что пациенты с ЦВИ имеют более медленное обнаружение столкновений и большие зоны безопасности

Исследователи разработали иммерсивную задачу виртуальной реальности для оценки обнаружения и избегания пешеходных столкновений у лиц с церебральной визуальной impairment (CVI) по сравнению с контрольной группой. В ходе исследования отслеживались движения глаз, локомоторные реакции и поведенческие ответы, когда субъекты проходили через смоделированный торговый центр с толпами разной плотности.

lab Mistral AI News · 5 д назад · 3 просмотра

Shieldstral представляет адаптивный к политике 3B мультимодальный классификатор безопасности

Shieldstral — это 3B модель с открытыми весами, являющаяся мультимодальным классификатором безопасности, которая рассматривает модерацию контента как задачу ответа на вопросы, адаптируемую к политике, что позволяет ей принимать политики на естественном языке во время вывода без переобучения. Она объединяет оценку безопасности текста и изображений и предоставляет калиброванные оценки безопасности по различным бенчмаркам, эффективно работая на одном GPU NVIDIA с 16 ГБ памяти.

media MarkTechPost · 20 д назад · 7 просмотров

Alibaba показала Qwen3.8-Max — мультимодальную модель с 2,4 трлн параметров

19 июля команда Qwen из Alibaba представила предварительную версию Qwen3.8-Max-Preview, новую флагманскую мультимодальную модель с 2,4 триллиона параметров. Объявление было сделано во время Всемирной конференции по искусственному интеллекту в Шанхае, спустя два дня после того, как Moonshot AI выпустила свою модель Kimi K3.

lab Hugging Face Blog · 24 д назад · 1 просмотр

Thinking Machines выпустила Inkling, мультимодальную LLM на 1 трлн параметров

Компания Thinking Machines выпустила Inkling, большую модель с открытым исходным кодом для обработки мультимодальных данных, доступную на Hugging Face, которая нативно обрабатывает текстовые, визуальные и аудиовходы. Модель имеет около 1 триллиона общих параметров и 41 миллиард активных параметров, обучена на 45 триллионах токенов для поддержки рассуждений между модальностями.

media Together AI Blog · 25 д назад · 4 просмотра

Together AI запускает мультимодальную модель рассуждений Inkling от Thinking Machines Lab

Thinking Machines Lab выпустила Inkling, новую мультимодельную смесь экспертов (MoE), предназначенную для токено-эффективного рассуждения и нативного понимания текстовых, изображенийных и аудио входных данных. Together AI делает модель доступной на своей платформе инференса с нулевым днем доступа.

lab Tencent Hunyuan (HF) · 25 д назад · 50 просмотров

Tencent выпустила унифицированную мультимодальную базовую модель Hy-Embodied-RxBrain-1.0

Компании Tencent Robotics X, Futian Laboratory и Tencent Hunyuan опубликовали технический отчет, код для вывода (inference) и веса модели Hy-Embodied-RxBrain-1.0 — унифицированной мультимодальной базовой модели с ~6.2B параметров для воплощенного познания.

lab Tencent Hunyuan (HF) · 25 д назад · 2 просмотра

Tencent выпустила эффективную базовую модель Hy-Embodied-VLM-1.0 для воплощённых агентов

Tencent выпустила Hy-Embodied-VLM-1.0, эффективную базовую зрительно-языковую модель на основе Mixture-of-Experts, предназначенную для воплощённых агентов, работающих в физическом мире. Модель активирует лишь около 3 миллиардов параметров на токен из общего числа в 30 миллиардов, стремясь сбалансировать высокую эффективность вывода с сильным пониманием физического мира.

media MarkTechPost · 4 д назад · 1 просмотр

NVIDIA выпустила Alpamayo 2 Super, 34B открытую VLA-модель для автономного вождения

NVIDIA выпустила Alpamayo 2 Super, 34-миллиардную модель vision-language-action (VLA), предназначенную для роботакси и автономного вождения под лицензией OpenMDW-1.1. Модель ориентирована на обработку редких событий за счёт объединения бэкбона Cosmos 3 Super Reasoner на 32B с диффузионным декодером действий на 2.3B, который генерирует траектории, каузальные объяснения и мета-действия из видео с нескольких камер.

arxiv arXiv cs.AI · 4 д назад

Video-DeepResearch представляет мультимодального агента для непрерывных видеопотоков

Исследователи представляют Video-DeepResearch (Video-DR), фреймворк, расширяющий возможности мультимодальных агентов со статических изображений на непрерывные видеопотоки, решая проблемы модальности и утечки параметрических знаний. Система использует разделенный конвейер восприятия и исследования с поэтапным разблокированием инструментов для обеспечения перекрестного визуального обоснования между кадрами перед поиском в веб-сети.

arxiv arXiv cs.CL · 5 д назад · 1 просмотр

Douyin выпустила мультимодельную модель встраивания DME с передовыми характеристиками

Douyin опубликовала технический отчет о своей модели мультимодального встраивания (DME), которая сочетает крупномасштабное контрастное предобучение с латентным рассуждением для достижения высокой дискриминации и эффективности.

media r/LocalLLaMA · 6 д назад · 1 просмотр

MiniMax выпустила омнимодальную генеративную систему H3 на Hugging Face

MiniMax сделала свою модель MiniMax-H3 доступной на Hugging Face. Эта универсальная омнимодальная генеративная система поддерживает единое понимание мультимодальных контекстов, состоящих из текста, изображений, видео и аудио.

media MarkTechPost · 6 д назад GPQA Diamond · 89.5% · 1 просмотр

Thinking Machines Lab выпустила Inkling-Small: открытую мультимодальную MoE-модель с 276B весов

Thinking Machines Lab выпустила Inkling-Small, модель Mixture-of-Experts с открытыми весами, имеющую 276 миллиардов общих параметров и 12 миллиардов активных параметров. Модель обучена нативному рассуждению над текстом, изображениями и аудио, обладает контекстным окном на 1M токенов и регулируемым усилием размышления.