Multimodal
arxiv arXiv cs.CL · 7 ч назад · 11 просмотров

Qwen выпустила Qwen3.8-Omni-Flash, нативную мультимодальную агентную модель с контекстом в 1 млн токенов

Alibaba Cloud представила Qwen3.8-Omni-Flash, нативную мультимодальную агентную модель, предназначенную для решения практических задач продуктивности, которая существенно улучшает мультимодальное понимание и рассуждение по сравнению с предыдущими омни-моделями.

media MarkTechPost · 3 д назад · 18 просмотров

Команда Alibaba Qwen выпустила Qwen3.8-LiveTranslate с архитектурой Interleave

Команда Alibaba Qwen выпустила Qwen3.8-LiveTranslate, модель синхронного перевода в реальном времени нового поколения, которая слушает живую речь и возвращает переведённый текст и аудио, пока говорящий ещё не закончил. В релизе представлена новая архитектура Interleave, предназначенная для снижения задержки и повышения качества перевода.

media r/LocalLLaMA · 5 д назад · 35 просмотров

inclusionAI выпускает модель взаимодействия Realtime-Venus на 9B параметров

inclusionAI выпустила систему Realtime-Venus на платформе Hugging Face, включающую два контрольных файла: Realtime-Venus-Omni и Realtime-Venus-Audio. Контрольный файл Omni представляет собой модель аудио-визуального взаимодействия на 9B параметров, адаптированную из MiniCPM-o 4.5, которая непрерывно наблюдает и слушает, чтобы решить, когда отвечать.

media MarkTechPost · 5 д назад · 24 просмотра

Alibaba Qwen выпускает Qwen3.8-Omni-Flash: агентную омнимодель с контекстом в 1M токенов

Команда Qwen от Alibaba выпустила Qwen3.8-Omni-Flash, свою первую омнимодель, разработанную вокруг агентных возможностей для понимания аудио-видео и использования инструментов. Модель принимает текстовые, изображенные, аудиовходные и видео данные для возврата текстовых выходов, обладая контекстным окном в 1M токенов и нативным вызовом функций.

lab Tencent Hunyuan (HF) · 6 д назад · 23 просмотра

Tencent выпустила документальные парсеры WeVisDoc-2B и WeVisDoc-4B

Tencent выпустила WeVisDoc, сквозной документальный парсер для изображений страниц, дообученный на моделях Qwen3-VL. Система преобразует изображения страниц в структурированный Markdown, включая формулы LaTeX и HTML-таблицы.

lab Tencent Hunyuan (HF) · 6 д назад · 64 просмотра

Tencent выпустила WeVisDoc-4B, сквозной парсер документов

Tencent выпустила WeVisDoc-4B, сквозной парсер документов для изображений страниц, который преобразует страницы в структурированный Markdown с формулами LaTeX и HTML-таблицами. Модель, дообученная на базе Qwen3-VL-4B-Instruct, достигает общего балла 95.38 на OmniDocBench v1.6 и занимает первое место среди сравниваемых парсеров во всех четырех указанных настройках.

media r/LocalLLaMA · 10 д назад · 20 просмотров

InternLM выпустила мультимодельную модель Intern-S2-397B для научного интеллекта

InternLM представила Intern-S2-397B, 397-миллиардную мультимодельную базовую модель, предназначенную для научного интеллекта и агентов с длительным горизонтом планирования. Модель масштабируется по этапам предварительного обучения, охвату задач reinforcement-learning и интерактивным средам агентов, чтобы улучшить общие способности к рассуждению и агентные возможности.

lab IBM Research (Granite) · 13 д назад · 24 просмотра

IBM и NASA открыли исходный код базовой модели NASA-IBM Lunar Foundation Model

Компании IBM и NASA открыли исходный код базовой модели NASA-IBM Lunar Foundation Model, системы искусственного интеллекта, которая объединяет десятилетия мультимодальных данных о Луне от американских и японских миссий в единое представление. Модель построена на архитектуре TerraMind от IBM и интегрирует наблюдения с различных масштабов и углов обзора для решения таких проблем, как сложное освещение и разрешение данных.

lab DeepSeek API Docs · 13 д назад Codeforces (Elo) · 3471.0Elo · 51 просмотр

DeepSeek выпустила модель V4.1-Flash с нативной мультимодальной поддержкой

DeepSeek официально выпустила модель DeepSeek-V4.1-Flash, которая является самым маленьким представителем нового семейства архитектур и обладает нативным мультимодальным визуальным пониманием. Эта новая архитектура предназначена для обеспечения более высокого предела возможностей, более быстрых скоростей вывода, большей пропускной способности и лучшего потенциала масштабирования для больших моделей.

media r/LocalLLaMA · 15 д назад · 35 просмотров

inclusionAI выпускает мультимодельную модель Ling-3.0-flash-VL

inclusionAI выпустила модель с открытым исходным кодом Ling-3.0-flash-VL, которая расширяет языковые и рассуждающие способности своего предшественника за счёт нативного понимания изображений и видео.

media MarkTechPost · 18 д назад · 33 просмотра

Google запускает агентное понимание видео для моделей Gemini Flash

Google запустила агентное понимание видео во всех моделях Gemini Flash, заменив предыдущий метод статической обработки на систему, которая по запросу перемещается по временной шкале видео. Это изменение позволяет модели решать, что именно смотреть, с какой частотой кадров и через какой модальности, вместо того чтобы загружать всю временную шкалу с фиксированной скоростью один кадр в секунду.

arxiv arXiv cs.CL · 19 д назад · 36 просмотров

VisCAD выпускает набор фундаментальных моделей с мультимодальным интеллектом для промышленного САПР

Исследователи представляют VisCAD, набор фундаментальных моделей, предназначенный для обеспечения широкой обобщающей способности и сильных возможностей в области реалистичного проектирования промышленных изделий. Набор решает задачи генерации на уровне деталей из разнообразных входных данных, таких как рендеры и текст, а также генерации на уровне сборки с участием взаимодействующих деталей.

lab Hugging Face Blog · 20 д назад · 34 просмотра

NeoMME выпускает эффективные мультимодальные энкодеры с плотным и поздним взаимодействием при поиске

Исследователи представляют NeoMME, семейство из 260M и 800M многоязычных мультимодальных энкодеров, которые обрабатывают текст и сырые изображения с помощью одного двунаправленного Transformer. В отличие от генеративных визуальных языковых моделей, NeoMME не полагается на отдельные предварительно обученные визуальные башни или каузальные декодеры, обучая всю модель с нуля с использованием маскированного дискретного диффузионного объекта.