Тема · Multimodal
lab DeepSeek API Docs · 13 д назад Codeforces (Elo) · 3471.0Elo · 51 просмотр

DeepSeek выпустила модель V4.1-Flash с нативной мультимодальной поддержкой

DeepSeek официально выпустила модель DeepSeek-V4.1-Flash, которая является самым маленьким представителем нового семейства архитектур и обладает нативным мультимодальным визуальным пониманием. Эта новая архитектура предназначена для обеспечения более высокого предела возможностей, более быстрых скоростей вывода, большей пропускной способности и лучшего потенциала масштабирования для больших моделей.

lab Zhipu / Z.ai (GLM, HF) · 28 д назад · 68 просмотров

Zai выпустила GLM-5.3-Flash: мультимодальную модель на 320B с разреженно-линейным вниманием

Zai представила GLM-5.3-Flash, первую нативно мультимодальную модель в серии GLM-5. Она сочетает гибридную архитектуру с разреженным и линейным вниманием для снижения стоимости обслуживания длинных контекстов при сохранении высокой точности.

lab Zhipu / Z.ai (GLM, HF) · 28 д назад · 76 просмотров

ZhiPu выпустила GLM-5.3-Flash, мультимодальную модель с 320B параметров

ZhiPu представляет GLM-5.3-Flash, первую нативно мультимодальную модель в серии GLM-5, использующую гибридную архитектуру, сочетающую разреженное и линейное внимание для снижения затрат на обслуживание длинного контекста при сохранении точности.

media MarkTechPost · 5 д назад · 24 просмотра

Alibaba Qwen выпускает Qwen3.8-Omni-Flash: агентную омнимодель с контекстом в 1M токенов

Команда Qwen от Alibaba выпустила Qwen3.8-Omni-Flash, свою первую омнимодель, разработанную вокруг агентных возможностей для понимания аудио-видео и использования инструментов. Модель принимает текстовые, изображенные, аудиовходные и видео данные для возврата текстовых выходов, обладая контекстным окном в 1M токенов и нативным вызовом функций.

media MarkTechPost · 28 д назад · 68 просмотров

Команда Qwen от Alibaba выпустила Qwen3.8-Flash-Next — 125B MoE с предпросмотром архитектуры Qwen4

Команда Qwen от Alibaba выпустила Qwen3.8-Flash-Next, мультимодельную модель Mixture-of-Experts с открытыми весами, предназначенную для демонстрации архитектуры будущей серии Qwen4. Чекпоинт сочетает в себе базовую модель на 125B параметров, таблицу N-граммных эмбеддингов на 51B и модуль многозадачного предсказания токенов на 4B, активируя лишь 6B параметров на каждый токен.

media r/LocalLLaMA · 28 д назад · 87 просмотров

Zhipu AI выпустила GLM-5.3-Flash, мультимодальную модель с открытыми весами

Zhipu AI выпустила GLM-5.3-Flash, первую нативно мультимодальную модель в серии GLM-5 и первый релиз архитектуры glm5_next с открытыми весами. Модель с 320B параметров обучена на 30T-токенном мультимодальном корпусе и использует гибридный механизм внимания, сочетающий разреженность и линейность, для снижения затрат на обслуживание длинного контекста.

arxiv arXiv cs.CL · 7 ч назад · 11 просмотров

Qwen выпустила Qwen3.8-Omni-Flash, нативную мультимодальную агентную модель с контекстом в 1 млн токенов

Alibaba Cloud представила Qwen3.8-Omni-Flash, нативную мультимодальную агентную модель, предназначенную для решения практических задач продуктивности, которая существенно улучшает мультимодальное понимание и рассуждение по сравнению с предыдущими омни-моделями.

media MarkTechPost · 3 д назад · 18 просмотров

Команда Alibaba Qwen выпустила Qwen3.8-LiveTranslate с архитектурой Interleave

Команда Alibaba Qwen выпустила Qwen3.8-LiveTranslate, модель синхронного перевода в реальном времени нового поколения, которая слушает живую речь и возвращает переведённый текст и аудио, пока говорящий ещё не закончил. В релизе представлена новая архитектура Interleave, предназначенная для снижения задержки и повышения качества перевода.

media r/LocalLLaMA · 5 д назад · 35 просмотров

inclusionAI выпускает модель взаимодействия Realtime-Venus на 9B параметров

inclusionAI выпустила систему Realtime-Venus на платформе Hugging Face, включающую два контрольных файла: Realtime-Venus-Omni и Realtime-Venus-Audio. Контрольный файл Omni представляет собой модель аудио-визуального взаимодействия на 9B параметров, адаптированную из MiniCPM-o 4.5, которая непрерывно наблюдает и слушает, чтобы решить, когда отвечать.

lab Tencent Hunyuan (HF) · 6 д назад · 23 просмотра

Tencent выпустила документальные парсеры WeVisDoc-2B и WeVisDoc-4B

Tencent выпустила WeVisDoc, сквозной документальный парсер для изображений страниц, дообученный на моделях Qwen3-VL. Система преобразует изображения страниц в структурированный Markdown, включая формулы LaTeX и HTML-таблицы.

lab Tencent Hunyuan (HF) · 6 д назад · 64 просмотра

Tencent выпустила WeVisDoc-4B, сквозной парсер документов

Tencent выпустила WeVisDoc-4B, сквозной парсер документов для изображений страниц, который преобразует страницы в структурированный Markdown с формулами LaTeX и HTML-таблицами. Модель, дообученная на базе Qwen3-VL-4B-Instruct, достигает общего балла 95.38 на OmniDocBench v1.6 и занимает первое место среди сравниваемых парсеров во всех четырех указанных настройках.

media r/LocalLLaMA · 10 д назад · 20 просмотров

InternLM выпустила мультимодельную модель Intern-S2-397B для научного интеллекта

InternLM представила Intern-S2-397B, 397-миллиардную мультимодельную базовую модель, предназначенную для научного интеллекта и агентов с длительным горизонтом планирования. Модель масштабируется по этапам предварительного обучения, охвату задач reinforcement-learning и интерактивным средам агентов, чтобы улучшить общие способности к рассуждению и агентные возможности.

lab IBM Research (Granite) · 13 д назад · 24 просмотра

IBM и NASA открыли исходный код базовой модели NASA-IBM Lunar Foundation Model

Компании IBM и NASA открыли исходный код базовой модели NASA-IBM Lunar Foundation Model, системы искусственного интеллекта, которая объединяет десятилетия мультимодальных данных о Луне от американских и японских миссий в единое представление. Модель построена на архитектуре TerraMind от IBM и интегрирует наблюдения с различных масштабов и углов обзора для решения таких проблем, как сложное освещение и разрешение данных.

media r/LocalLLaMA · 15 д назад · 35 просмотров

inclusionAI выпускает мультимодельную модель Ling-3.0-flash-VL

inclusionAI выпустила модель с открытым исходным кодом Ling-3.0-flash-VL, которая расширяет языковые и рассуждающие способности своего предшественника за счёт нативного понимания изображений и видео.

media MarkTechPost · 18 д назад · 33 просмотра

Google запускает агентное понимание видео для моделей Gemini Flash

Google запустила агентное понимание видео во всех моделях Gemini Flash, заменив предыдущий метод статической обработки на систему, которая по запросу перемещается по временной шкале видео. Это изменение позволяет модели решать, что именно смотреть, с какой частотой кадров и через какой модальности, вместо того чтобы загружать всю временную шкалу с фиксированной скоростью один кадр в секунду.