← 返回 media r/LocalLLaMA · 5 小时前 · open_models DeepSeek发布V4-1 Flash,拥有100万token上下文的552B MoE模型 译自 English → 中文 DeepSeek发布了其新模型DeepSeek V4-1 Flash。这是一个多模态Mixture-of-Experts (MoE)模型,具有5520亿参数的骨干。 该模型支持长达一百万个token的上下文。它采用具有552B参数的多模态Mixture-of-Experts架构。 重要性 2/3 r/LocalLLaMA DeepSeek Multimodal Open weights 阅读原文 相关文章 media r/LocalLLaMA · 10 天前 · 6 次浏览 DeepSeek 在 Hugging Face 上发布 DeepSeek-V4-Flash-Vision-Exp DeepSeek 已在 Hugging Face 上发布了 DeepSeek-V4-Flash-Vision-Exp 模型检查点。 该仓库现已公开可用。 media Interconnects · 39 天前 · 29 次浏览 Thinking Machines发布Inkling,腾讯以Apache 2.0许可证更新Hy3 最新的开源模型成果汇总突出了Thinking Machines和腾讯的重大发布,以及Poolside和DeepSeek的更新。 media AI News (smol.ai) · 55 天前 · 24 次浏览 Thinking Machines Lab 发布开源权重的 Inkling 基础模型 Thinking Machines Lab 推出了 Inkling,这是其首个完全发布的开源权重基础模型系列。Inkling 定位为可定制的 multimodal 基础模型,而非以基准测试为最高目标的旗舰产品,支持文本、图像和音频输入,具备原生多模态能力。 media MarkTechPost · 刚刚 实时 DeepSeek 发布 DeepSeek-V4.1-Flash,支持 1M 上下文与 FP4 KV 缓存 DeepSeek AI 发布了 DeepSeek-V4.1-Flash,这是一款多模态混合专家模型,具备 100 万 token 的上下文窗口和 FP4 KV 缓存,将全局缓存占用降低至每 token 890 字节。该模型采用因果编码器-解码器架构以及压缩稀疏注意力 2(CSA2),在保持性能的同时显著降低了内存需求。 media r/LocalLLaMA · 5 小时前 · 3 次浏览 DeepSeek发布V4.1 Flash:一款成本更低、速度更快的552B MoE模型 DeepSeek已正式发布DeepSeek V4.1 Flash模型,这是其新架构系列中首款原生具备多模态视觉理解能力的最小型号。该模型基于因果编码器-解码器(Causal-Encoder-Decoder)设计,是一个拥有552B参数的混合专家(MoE)模型,在输入端仅激活8B参数,在输出端激活16B参数。
media r/LocalLLaMA · 10 天前 · 6 次浏览 DeepSeek 在 Hugging Face 上发布 DeepSeek-V4-Flash-Vision-Exp DeepSeek 已在 Hugging Face 上发布了 DeepSeek-V4-Flash-Vision-Exp 模型检查点。 该仓库现已公开可用。
media Interconnects · 39 天前 · 29 次浏览 Thinking Machines发布Inkling,腾讯以Apache 2.0许可证更新Hy3 最新的开源模型成果汇总突出了Thinking Machines和腾讯的重大发布,以及Poolside和DeepSeek的更新。
media AI News (smol.ai) · 55 天前 · 24 次浏览 Thinking Machines Lab 发布开源权重的 Inkling 基础模型 Thinking Machines Lab 推出了 Inkling,这是其首个完全发布的开源权重基础模型系列。Inkling 定位为可定制的 multimodal 基础模型,而非以基准测试为最高目标的旗舰产品,支持文本、图像和音频输入,具备原生多模态能力。
media MarkTechPost · 刚刚 实时 DeepSeek 发布 DeepSeek-V4.1-Flash,支持 1M 上下文与 FP4 KV 缓存 DeepSeek AI 发布了 DeepSeek-V4.1-Flash,这是一款多模态混合专家模型,具备 100 万 token 的上下文窗口和 FP4 KV 缓存,将全局缓存占用降低至每 token 890 字节。该模型采用因果编码器-解码器架构以及压缩稀疏注意力 2(CSA2),在保持性能的同时显著降低了内存需求。
media r/LocalLLaMA · 5 小时前 · 3 次浏览 DeepSeek发布V4.1 Flash:一款成本更低、速度更快的552B MoE模型 DeepSeek已正式发布DeepSeek V4.1 Flash模型,这是其新架构系列中首款原生具备多模态视觉理解能力的最小型号。该模型基于因果编码器-解码器(Causal-Encoder-Decoder)设计,是一个拥有552B参数的混合专家(MoE)模型,在输入端仅激活8B参数,在输出端激活16B参数。