Qwen发布Qwen3.8-Omni-Flash,一款原生多模态智能体模型,支持100万token上下文
阿里云推出了Qwen3.8-Omni-Flash,这是一款原生的多模态智能体模型,专为现实世界的生产力任务设计,与之前的全模态模型相比,大幅提升了多模态理解和推理能力。
阿里云推出了Qwen3.8-Omni-Flash,这是一款原生的多模态智能体模型,专为现实世界的生产力任务设计,与之前的全模态模型相比,大幅提升了多模态理解和推理能力。
阿里巴巴Qwen团队发布了Qwen3.8-LiveTranslate,这是一款下一代实时同步翻译模型,能够在说话者仍在讲话时监听实时语音并返回翻译后的文本和音频。此次发布引入了新的Interleave架构,旨在降低延迟并提升翻译质量。
inclusionAI 已在 Hugging Face 上发布了 Realtime-Venus 系统,包含两个检查点:Realtime-Venus-Omni 和 Realtime-Venus-Audio。Omni 检查点是一个 9B 的音视频交互模型,基于 MiniCPM-o 4.5 适配而成,能够持续观察并聆听以决定何时回应。
阿里巴巴 Qwen 团队发布了 Qwen3.8-Omni-Flash,这是其首款围绕音频-视频理解和工具使用的智能体能力设计的多模态模型。该模型接受文本、图像、音频和视频输入,返回文本输出,具备 1M token 上下文窗口和原生函数调用功能。
DeepSeek发布了DeepSeek-V4.1-Flash,这是一种多模态混合专家(MoE)模型,旨在解决智能体工作负载中长上下文计算和高KV缓存带来的高昂成本。
腾讯发布了 WeVisDoc,这是一种针对页面图像端到端的文档解析器,基于 Qwen3-VL 模型微调而成。该系统将页面图像转换为结构化的 Markdown,包括 LaTeX 公式和 HTML 表格。
腾讯发布了 WeVisDoc-4B,这是一款用于页面图像的端到端文档解析器,可将页面转换为包含 LaTeX 公式和 HTML 表格的结构化 Markdown。该模型基于 Qwen3-VL-4B-Instruct 进行微调,在 OmniDocBench v1.6 上取得了 95.38 的总体得分,并在所有四项报告的设置中位居被比较的解析器之首。
Intern Large Models 发布了 Intern-S2-397B 模型,该模型已在 Hugging Face 上提供。此次发布包括 vLLM 的 Day-0 支持,用于运行该模型。
InternLM推出了Intern-S2-397B,这是一个拥有3970亿参数的多模态基础模型,专为科学智能和长周期代理而设计。该模型在预训练、强化学习任务覆盖范围以及交互式代理环境方面进行了扩展,以增强通用推理能力和代理能力。
IBM和NASA已开源NASA-IBM月球基础模型,这是一个AI系统,将美国和日本任务数十年的多模态月球数据整合为单一表示。该模型基于IBM的TerraMind架构构建,整合了不同尺度和视角的观察结果,以解决复杂光照和数据分辨率等挑战。
DeepSeek发布了其新模型DeepSeek V4-1 Flash。这是一个多模态Mixture-of-Experts (MoE)模型,具有5520亿参数的骨干。
DeepSeek已正式发布DeepSeek-V4.1-Flash模型,该模型是其新架构家族中最小的成员,并具有原生的多模态视觉理解能力。这种新架构旨在为更大的模型提供更高的能力上限、更快的推理速度、更高的吞吐量以及更好的扩展潜力。
inclusionAI 发布了开源模型 Ling-3.0-flash-VL,该模型通过原生图像和视频理解能力,扩展了其前身的语言和理解推理能力。
DeepSeek 已为其 DeepSeek V4.1 Flash 模型的中间版本开放内部测试,该模型现已通过 API 提供。
Google 已在所有 Gemini Flash 模型中推出了代理式视频理解功能,取代了之前的静态处理方式,该系统能够按需浏览视频时间线。这一变化使模型能够自主决定观看内容、帧率以及通过哪种模态进行处理,而非以每秒一帧的固定速率摄入整个时间线。
llama.cpp 版本 0.4.0 引入了对 Qwen3.8-Flash-Next 和 NVIDIA Nemotron-3-Puzzle-75B-A9B 模型的初始架构支持,同时将底层 ggml 库升级至 0.23.0 版本。
Ling-3.0-flash-VL 是一款基于 Ling-3.0-flash 架构构建的新模型,引入了视觉理解和视觉智能体能力。
研究人员展示了 VisCAD,这是一个基础模型套件,旨在为逼真的工业设计提供广泛的泛化能力和强大的能力。该套件解决了从渲染图和文本等多样化输入进行零件级生成,以及涉及交互零件的装配级生成所面临的挑战。
研究人员推出了NeoMME,这是一系列包含260M和800M参数的多语言多模态编码器,使用单个双向Transformer处理文本和原始图像块。与生成式视觉语言模型不同,NeoMME不依赖独立的预训练视觉塔或因果解码器,而是通过掩码离散扩散目标从头开始训练整个模型。
v0.29.0rc2 版本包含对 SHM 工作进程缓存的错误修复,以正确处理前缀覆盖项。