DeepSeek发布具有原生多模态支持的V4.1-Flash模型
DeepSeek已正式发布DeepSeek-V4.1-Flash模型,该模型是其新架构家族中最小的成员,并具有原生的多模态视觉理解能力。这种新架构旨在为更大的模型提供更高的能力上限、更快的推理速度、更高的吞吐量以及更好的扩展潜力。
DeepSeek已正式发布DeepSeek-V4.1-Flash模型,该模型是其新架构家族中最小的成员,并具有原生的多模态视觉理解能力。这种新架构旨在为更大的模型提供更高的能力上限、更快的推理速度、更高的吞吐量以及更好的扩展潜力。
DeepSeek 发布了 V4.1-Flash,这是一款专为极致推理效率和低成本设计的新款开源权重旗舰模型。该模型采用因果编码器-解码器架构,显著降低了活跃计算量和 KV/缓存成本。
DeepSeek推出了DeepSeek v4.1-Flash,这是一款全新的开源权重旗舰模型,采用了新型因果编码器-解码器架构,旨在最大化推理效率并降低成本。
DeepSeek AI 发布了 DeepSeek-V4.1-Flash,这是一款多模态混合专家模型,具备 100 万 token 的上下文窗口和 FP4 KV 缓存,将全局缓存占用降低至每 token 890 字节。该模型采用因果编码器-解码器架构以及压缩稀疏注意力 2(CSA2),在保持性能的同时显著降低了内存需求。
DeepSeek 正在使用华为的 Ascend 950 硬件训练其模型。这一转变紧随梁文锋在 26 个月前发表的关于需要有人站上前沿的声明。
中国监管机构正在调查DeepSeek和Moonshot AI是否可能向美国公司Anthropic泄露数据。此次调查源于有关Kimi高管的传闻,但目前的情况被描述为调查而非已确认的逮捕。
DeepSeek目前正在训练一个拥有2万亿参数的新模型,并计划最终构建一个8万亿参数的模型。
研究人员介绍了 CodeMidas,这是一种智能体管道,它使用源代码作为唯一输入,从开源代码库中实现的功能构建强化学习环境。 该方法分配智能体计算资源以探索功能、构建基于执行的测试,并通过重复 rollout 验证任务,最终生成涵盖 23 种编程语言的 5,545 个训练任务数据集。 在 GRPO 的帮助下在这些任务上训练 MiMo-V2.5,在五个多样化的基准测试中提升了性能,包括 DeepSWE (+11.7%)、ProgramBench (+17%) 和 Terminal-Bench v2.1 (+8.5%)。 轨迹分析表明,经过 RL 训练的代理表现出更好的行为,例如更深入的代码库探索和更多样化的自我验证。 这些结果确立了源代码作为构建强化学习环境的可扩展基础,能够提升编码智能体在多样化软件任务中的表现。
DeepSeek发布了DeepSeek-V4.1-Flash,这是一种多模态混合专家(MoE)模型,旨在解决智能体工作负载中长上下文计算和高KV缓存带来的高昂成本。
Atria Dawn Preview 是一个面向科学研究和工程工作流的基础代理语言模型,通过可验证经验管道进行训练,该管道将工具中介交互与可执行环境相连接。在涵盖真实世界研究、工程和数字工作的16个基准测试中,该模型的表现可与前沿代理相媲美,并在其中五个基准上取得了最高报告分数。
DeepSeek V4.1 Flash 在 Artificial Analysis Intelligence Index v4.3 更新中,于新的 Astra 基准测试中夺得第一名。
一位用户开发了自定义实现,允许 DeepSeek V4.1 模型在 NVIDIA A100 GPU 上运行,其性能超过了官方 API。
LiveBench 基准测试平台已将其评估套件中加入了 DeepSeek v4.1 Flash 模型。
DeepSeek V4.1 Flash 模型现已通过 HuggingChat 平台提供访问。
一位用户发布了使用新发布的 DeepSeek V4.1 Flash 模型生成的视频,以测试其在运动视频合成方面的能力。
DeepSeek发布了其新模型DeepSeek V4-1 Flash。这是一个多模态Mixture-of-Experts (MoE)模型,具有5520亿参数的骨干。
DeepSeek已正式发布DeepSeek V4.1 Flash模型,这是其新架构系列中首款原生具备多模态视觉理解能力的最小型号。该模型基于因果编码器-解码器(Causal-Encoder-Decoder)设计,是一个拥有552B参数的混合专家(MoE)模型,在输入端仅激活8B参数,在输出端激活16B参数。
DeepSeek 已软性退役 DeepSeek V4 Pro 模型。此举标志着该特定版本的 AI 系统不再可用。
DeepSeek 已为其 DeepSeek V4.1 Flash 模型的中间版本开放内部测试,该模型现已通过 API 提供。