Multimodal
media MarkTechPost · 4 д назад · 1 просмотр

NVIDIA выпустила Alpamayo 2 Super, 34B открытую VLA-модель для автономного вождения

NVIDIA выпустила Alpamayo 2 Super, 34-миллиардную модель vision-language-action (VLA), предназначенную для роботакси и автономного вождения под лицензией OpenMDW-1.1. Модель ориентирована на обработку редких событий за счёт объединения бэкбона Cosmos 3 Super Reasoner на 32B с диффузионным декодером действий на 2.3B, который генерирует траектории, каузальные объяснения и мета-действия из видео с нескольких камер.

arxiv arXiv cs.AI · 4 д назад

Video-DeepResearch представляет мультимодального агента для непрерывных видеопотоков

Исследователи представляют Video-DeepResearch (Video-DR), фреймворк, расширяющий возможности мультимодальных агентов со статических изображений на непрерывные видеопотоки, решая проблемы модальности и утечки параметрических знаний. Система использует разделенный конвейер восприятия и исследования с поэтапным разблокированием инструментов для обеспечения перекрестного визуального обоснования между кадрами перед поиском в веб-сети.

lab Mistral AI News · 5 д назад · 3 просмотра

Shieldstral представляет адаптивный к политике 3B мультимодальный классификатор безопасности

Shieldstral — это 3B модель с открытыми весами, являющаяся мультимодальным классификатором безопасности, которая рассматривает модерацию контента как задачу ответа на вопросы, адаптируемую к политике, что позволяет ей принимать политики на естественном языке во время вывода без переобучения. Она объединяет оценку безопасности текста и изображений и предоставляет калиброванные оценки безопасности по различным бенчмаркам, эффективно работая на одном GPU NVIDIA с 16 ГБ памяти.

arxiv arXiv cs.CL · 5 д назад · 1 просмотр

Douyin выпустила мультимодельную модель встраивания DME с передовыми характеристиками

Douyin опубликовала технический отчет о своей модели мультимодального встраивания (DME), которая сочетает крупномасштабное контрастное предобучение с латентным рассуждением для достижения высокой дискриминации и эффективности.

media r/LocalLLaMA · 6 д назад · 1 просмотр

MiniMax выпустила омнимодальную генеративную систему H3 на Hugging Face

MiniMax сделала свою модель MiniMax-H3 доступной на Hugging Face. Эта универсальная омнимодальная генеративная система поддерживает единое понимание мультимодальных контекстов, состоящих из текста, изображений, видео и аудио.

media MarkTechPost · 6 д назад GPQA Diamond · 89.5% · 1 просмотр

Thinking Machines Lab выпустила Inkling-Small: открытую мультимодальную MoE-модель с 276B весов

Thinking Machines Lab выпустила Inkling-Small, модель Mixture-of-Experts с открытыми весами, имеющую 276 миллиардов общих параметров и 12 миллиардов активных параметров. Модель обучена нативному рассуждению над текстом, изображениями и аудио, обладает контекстным окном на 1M токенов и регулируемым усилием размышления.

media AI News (smol.ai) · 9 д назад · 2 просмотра

OpenAI снижает цены на GPT-5.6, Thinking Machines выпускает Inkling-Small, Google запускает Gemini Robotics 2

Эта сводка новостей об ИИ охватывает значительные изменения в ценообразовании, моделях с открытым весом и робототехнической инфраструктуре. OpenAI агрессивно снизила стоимость GPT-5.6, Thinking Machines выпустила компактную мультимодальную модель, а Google DeepMind расширила свои возможности в области робототехники.

media r/LocalLLaMA · 12 д назад · 5 просмотров

Microsoft выпустила Mage-VL — потоковую мультимодельную модель с нативным кодеком

Microsoft выпустила Mage-VL, эффективную мультимодельную базовую модель на 4 млрд параметров для понимания изображений и видео, использующую подход с нативным кодеком для оптимизации визуальной обработки. Система разделяет видеопотоки на опорные (I) кадры и предсказанные (P) кадры, сохраняя только те патчи, которым кодек выделяет биты, что снижает потребление визуальных токенов более чем на 75%.

lab NVIDIA Research · 12 д назад · 8 просмотров

NVIDIA представляет Spatial-IQ: иерархическую диагностическую систему для пространственного мышления мультимодальных моделей

Исследователи NVIDIA представили Spatial-IQ — диагностическую систему, предназначенную для деконструкции пространственного интеллекта мультимодальных больших языковых моделей (MLLMs). В отличие от существующих бенчмарков, которые рассматривают модели как чёрные ящики, этот подход разбивает подсчёт объектов в стопках 3D-структур на девять перцептивных и когнитивных подзадач, согласованных с этапами человеческого развития.

arxiv arXiv cs.AI · 12 д назад · 1 просмотр

ClinFusion представляет собой MLLM с акцентом на зрение для комплексного медицинского понимания

Исследователи представляют ClinFusion, мультимодальную большую языковую модель с акцентом на зрение, разработанную для решения проблем внедрения ИИ в клиническую практику путем объединения понимания 2D и 3D медицинских изображений. Система включает композиционный каскадный визуальный энкодер с оператором каскадного пространственно-ориентированного локального слияния и новый фреймворк оценки, включающий MedIF-Bench и метрики, основанные на области интереса.

arxiv arXiv cs.CL · 12 д назад · 1 просмотр

ClinFusion: ориентированная на зрение MLLM устанавливает новый рекорд в медицинских бенчмарках

Исследователи представляют ClinFusion, мультимодальную большую языковую модель, ориентированную на зрение и предназначенную для комплексного медицинского понимания, которая объединяет анализ 2D и нативных 3D изображений. Система использует композиционный каскадный визуальный энкодер с оператором Cascade Spatial-Aware Locality Fusion для решения проблем гетерогенной медицинской визуализации.

lab NVIDIA Research · 12 д назад · 3 просмотра

Мультимодальный ИИ-анализ невербальной коммуникации в Delta Force

Исследователи анализируют видео игрового процесса соревновательного шутера Delta Force, чтобы извлечь и понять возникающую невербальную коммуникацию, такую как жесты и паттерны перемещения. Эта работа восполняет пробел в предыдущих исследованиях, которые в значительной степени фокусировались на MOBA-играх или вербальной координации в других шутерах.

github llama.cpp · 13 д назад · 3 просмотра

llama.cpp b10142 добавляет предварительную поддержку зрения MiniMax-M3

Проект llama.cpp выпустил сборку b10142, которая вводит предварительную поддержку зрения для модели MiniMax-M3. Это обновление реализует текстовый порт, который повторно использует существующие компоненты из MiniMax-M2, включая GQA с нормализацией QK на голову и частичным поворотом, экспертами в стиле DeepSeek-V3 и активацией swigluoai.

media MarkTechPost · 13 д назад · 1 просмотр

Black Forest Labs выпустила FLUX 3: мультимодельную модель потока для предсказания изображений, видео, аудио и действий роботов

Black Forest Labs выпустила FLUX 3 — мультимодельную базовую модель, обучающуюся на изображениях, видео и аудио в рамках единой архитектуры. Это первая модель FLUX, которая обеспечивает генерацию видео, аудио и предсказание действий с использованием одного набора весов.

media MarkTechPost · 14 д назад · 2 просмотра

Induction Labs выпустила Photon-1, модель воображения, обученную на 18 годах видео

Induction Labs выпустила Photon-1, разреженную смесь экспертов (mixture-of-experts) трансформера с 106B-A5B параметрами, которая учится симулировать рабочие среды и играть в игры, предсказывая будущие кадры из необработанных видео без меток действий. Модель использует конечную скалярную квантование для сжатия каждого кадра до 960 дискретных токенов, достигая более чем в 100 раз лучшего сжатия по сравнению с существующими представлениями, сохраняя при этом детали текста и макета.

media r/LocalLLaMA · 16 д назад · 1 просмотр

FLUX 3 представляет мультимодельную модель потока для предсказания изображений, видео, аудио и действий

FLUX 3 представлена как единая мультимодельная модель, предназначенная для обработки задач с изображениями, видео, аудио и предсказанием действий. Система стремится создавать произведения, более близкие к реальности в различных стилях.