← 返回 media r/LocalLLaMA · 53 天前 · open_models FLUX 3 推出多模态流模型,用于图像、视频、音频和动作预测 译自 English → 中文 FLUX 3 被介绍为一个单一的多模态模型,旨在处理图像、视频、音频和动作预测任务。该系统旨在在各种风格中产生更贴近现实的作品。 FLUX 3 作为一个统一的多模态流模型运行。它支持图像、视频、音频生成和动作预测。作品被描述为在任何风格中都更加逼真。 重要性 2/3 r/LocalLLaMA Black Forest Labs API & product launches Multimodal 阅读原文 相关文章 lab DeepSeek API Docs · 5 天前 · 31 次浏览 DeepSeek发布具有原生多模态支持的V4.1-Flash模型 DeepSeek已正式发布DeepSeek-V4.1-Flash模型,该模型是其新架构家族中最小的成员,并具有原生的多模态视觉理解能力。这种新架构旨在为更大的模型提供更高的能力上限、更快的推理速度、更高的吞吐量以及更好的扩展潜力。 media r/LocalLLaMA · 7 天前 · 20 次浏览 DeepSeek 开放 DeepSeek V4.1 Flash 内部测试版,原生支持多模态 DeepSeek 已为其 DeepSeek V4.1 Flash 模型的中间版本开放内部测试,该模型现已通过 API 提供。 media MarkTechPost · 10 天前 · 18 次浏览 Google 为 Gemini Flash 模型推出代理式视频理解功能 Google 已在所有 Gemini Flash 模型中推出了代理式视频理解功能,取代了之前的静态处理方式,该系统能够按需浏览视频时间线。这一变化使模型能够自主决定观看内容、帧率以及通过哪种模态进行处理,而非以每秒一帧的固定速率摄入整个时间线。 lab Zhipu / Z.ai (GLM, HF) · 20 天前 · 44 次浏览 Zai发布GLM-5.3-Flash:一款具有稀疏线性注意力的320B多模态模型 Zai推出了GLM-5.3-Flash,这是GLM-5系列中首个原生多模态模型。它采用混合架构,结合稀疏和线性注意力机制,在保持精确能力的同时降低长上下文的服务成本。 media r/LocalLLaMA · 20 天前 · 10 次浏览 Ox Alpha 即 GLM-5.3-Flash 文章确认,被称为 Ox Alpha 的模型是 GLM-5.3-Flash。
lab DeepSeek API Docs · 5 天前 · 31 次浏览 DeepSeek发布具有原生多模态支持的V4.1-Flash模型 DeepSeek已正式发布DeepSeek-V4.1-Flash模型,该模型是其新架构家族中最小的成员,并具有原生的多模态视觉理解能力。这种新架构旨在为更大的模型提供更高的能力上限、更快的推理速度、更高的吞吐量以及更好的扩展潜力。
media r/LocalLLaMA · 7 天前 · 20 次浏览 DeepSeek 开放 DeepSeek V4.1 Flash 内部测试版,原生支持多模态 DeepSeek 已为其 DeepSeek V4.1 Flash 模型的中间版本开放内部测试,该模型现已通过 API 提供。
media MarkTechPost · 10 天前 · 18 次浏览 Google 为 Gemini Flash 模型推出代理式视频理解功能 Google 已在所有 Gemini Flash 模型中推出了代理式视频理解功能,取代了之前的静态处理方式,该系统能够按需浏览视频时间线。这一变化使模型能够自主决定观看内容、帧率以及通过哪种模态进行处理,而非以每秒一帧的固定速率摄入整个时间线。
lab Zhipu / Z.ai (GLM, HF) · 20 天前 · 44 次浏览 Zai发布GLM-5.3-Flash:一款具有稀疏线性注意力的320B多模态模型 Zai推出了GLM-5.3-Flash,这是GLM-5系列中首个原生多模态模型。它采用混合架构,结合稀疏和线性注意力机制,在保持精确能力的同时降低长上下文的服务成本。