DeepSeek发布具有原生多模态支持的V4.1-Flash模型
DeepSeek已正式发布DeepSeek-V4.1-Flash模型,该模型是其新架构家族中最小的成员,并具有原生的多模态视觉理解能力。这种新架构旨在为更大的模型提供更高的能力上限、更快的推理速度、更高的吞吐量以及更好的扩展潜力。
DeepSeek已正式发布DeepSeek-V4.1-Flash模型,该模型是其新架构家族中最小的成员,并具有原生的多模态视觉理解能力。这种新架构旨在为更大的模型提供更高的能力上限、更快的推理速度、更高的吞吐量以及更好的扩展潜力。
微软研究院推出了Quine,这是一项新的研究计划,旨在构建一个生物学的多模态世界模型,并提供一个连接模型、科学工具、文献和研究人员的交互式框架。该系统通过允许科学家生成在湿实验室环境中进行测试的提案,并将结果反馈以优化后续问题,从而弥合计算建模与现实实验之间的差距。
Google推出了Gemini 3.8 Live与Live Avatar,该功能将近实时视频生成与语音结合,为原生实时对话模型创建动态视觉人格。
阿里巴巴 Qwen 团队发布了 Qwen3.8-Omni-Flash,这是其首款围绕音频-视频理解和工具使用的智能体能力设计的多模态模型。该模型接受文本、图像、音频和视频输入,返回文本输出,具备 1M token 上下文窗口和原生函数调用功能。
v0.29.0rc2 版本包含对 SHM 工作进程缓存的错误修复,以正确处理前缀覆盖项。
llama.cpp 服务器现在支持 /v1/embeddings 端点的类型化内容(视觉、音频、视频)输入。此更新通过接受 OpenAI 风格的包装内容数组,使多模态嵌入请求成为可能,允许文本和 image_url 部分一起处理。
一位在 Hugging Face 论坛上的本科生讨论将 VAPO 论文中的概念应用于 Qwen 2.5 Omni 3B 模型,以解决在带有幻灯片上下文的音频转录过程中出现的幻觉问题。
Liquid AI 发布了 LFM2.5-VL-3B-DSpark,这是为其 LFM2.5-VL-3B 视觉语言模型设计的实验性推测解码草稿模型。该草稿模型增加了约 280M 参数,在不改变模型输出分布的情况下加速了 token 生成。
Liquid AI 发布了 LFM2.5-VL-DSpark 草稿模型,这是一种推测解码的草稿生成器,旨在加速 LFM2.5-VL-3B 视觉语言模型的推理。该草稿生成器从目标模型的固定层捕获隐藏状态以生成候选 token,仅增加 280M 参数(开销为 8.9%),同时保持跨模态的维度一致。
Liquid AI 发布了其视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,能够在不改变输出质量的情况下加速边缘设备和 GPU 上的解码。
苹果发布了 LensVLM-9B,这是一个拥有 90 亿参数的视觉语言模型,旨在更高效地处理文本的压缩图像。该模型扫描这些压缩输入,并利用学习到的工具选择性地将相关页面扩展为其未压缩形式。
阿里云推出了Qwen3.8-Omni-Flash,这是一款原生的多模态智能体模型,专为现实世界的生产力任务设计,与之前的全模态模型相比,大幅提升了多模态理解和推理能力。
阿里巴巴Qwen团队发布了Qwen3.8-LiveTranslate,这是一款下一代实时同步翻译模型,能够在说话者仍在讲话时监听实时语音并返回翻译后的文本和音频。此次发布引入了新的Interleave架构,旨在降低延迟并提升翻译质量。
inclusionAI 已在 Hugging Face 上发布了 Realtime-Venus 系统,包含两个检查点:Realtime-Venus-Omni 和 Realtime-Venus-Audio。Omni 检查点是一个 9B 的音视频交互模型,基于 MiniCPM-o 4.5 适配而成,能够持续观察并聆听以决定何时回应。
DeepSeek发布了DeepSeek-V4.1-Flash,这是一种多模态混合专家(MoE)模型,旨在解决智能体工作负载中长上下文计算和高KV缓存带来的高昂成本。
腾讯发布了 WeVisDoc,这是一种针对页面图像端到端的文档解析器,基于 Qwen3-VL 模型微调而成。该系统将页面图像转换为结构化的 Markdown,包括 LaTeX 公式和 HTML 表格。
腾讯发布了 WeVisDoc-4B,这是一款用于页面图像的端到端文档解析器,可将页面转换为包含 LaTeX 公式和 HTML 表格的结构化 Markdown。该模型基于 Qwen3-VL-4B-Instruct 进行微调,在 OmniDocBench v1.6 上取得了 95.38 的总体得分,并在所有四项报告的设置中位居被比较的解析器之首。
Intern Large Models 发布了 Intern-S2-397B 模型,该模型已在 Hugging Face 上提供。此次发布包括 vLLM 的 Day-0 支持,用于运行该模型。
InternLM推出了Intern-S2-397B,这是一个拥有3970亿参数的多模态基础模型,专为科学智能和长周期代理而设计。该模型在预训练、强化学习任务覆盖范围以及交互式代理环境方面进行了扩展,以增强通用推理能力和代理能力。
IBM和NASA已开源NASA-IBM月球基础模型,这是一个AI系统,将美国和日本任务数十年的多模态月球数据整合为单一表示。该模型基于IBM的TerraMind架构构建,整合了不同尺度和视角的观察结果,以解决复杂光照和数据分辨率等挑战。