← 返回 media r/LocalLLaMA · 78 天前 · open_models Deepseek 带来另一项巨大突破——DSpark。比 MTP 快得多 [解释视频] 译自 English → 中文 一位 Reddit 用户分享了一段关于 DeepSeek 新突破 DSpark 的视频链接,该模型被描述为比 MTP 快得多。 来源仅提供了一个 YouTube 链接和一个简短的标题,没有技术细节。文本中未列出任何具体的基准测试、模型名称或实验室结果。内容仅包含提交给 r/LocalLLaMA 的内容,没有其他解释。 重要性 2/3 r/LocalLLaMA DeepSeek Inference efficiency Research paper 阅读原文 相关文章 arxiv arXiv cs.CL · 53 天前 · 28 次浏览 PIVOT通过跨查询组共享前缀扫描来加速令牌级稀疏注意力 PIVOT(Proxy Indexing Via One full-prefix Traversal)是一种无需训练、可即插即用的DeepSeek稀疏注意力(DSA)索引器替代方案,它通过在邻近查询组间共享单次前缀扫描来减少计算冗余。PIVOT不再为每个查询单独对每个前置令牌进行评分,而是将查询组聚合为一个代理查询以获取候选集,随后从中为每个查询选出top-k个令牌。 arxiv arXiv cs.CL · 74 天前 · 15 次浏览 DSpark 引入基于置信度调度的推测解码以加速 LLM 推理 DSpark 是一个推测解码框架,旨在通过结合半自回归草稿生成与自适应、负载感知的验证来加速大型语言模型 (LLM) 的推理。它解决了现有并行草稿生成器中存在的接受率衰减和吞吐量下降问题。 arxiv arXiv cs.CL · 23 小时前 · 1 次浏览 DeepSeek发布V4.1-Flash,KV缓存占用仅为890字节/令牌 DeepSeek发布了DeepSeek-V4.1-Flash,这是一种多模态混合专家(MoE)模型,旨在解决智能体工作负载中长上下文计算和高KV缓存带来的高昂成本。 arxiv arXiv cs.AI · 4 天前 · 11 次浏览 Atria Dawn Preview:面向科研的基础代理语言模型 Atria Dawn Preview 是一个面向科学研究和工程工作流的基础代理语言模型,通过可验证经验管道进行训练,该管道将工具中介交互与可执行环境相连接。在涵盖真实世界研究、工程和数字工作的16个基准测试中,该模型的表现可与前沿代理相媲美,并在其中五个基准上取得了最高报告分数。 media AI News (smol.ai) · 6 天前 · 25 次浏览 DeepSeek 推出 V4.1-Flash,一款专注于极致推理效率的开源权重模型 DeepSeek 发布了 V4.1-Flash,这是一款专为极致推理效率和低成本设计的新款开源权重旗舰模型。该模型采用因果编码器-解码器架构,显著降低了活跃计算量和 KV/缓存成本。
arxiv arXiv cs.CL · 53 天前 · 28 次浏览 PIVOT通过跨查询组共享前缀扫描来加速令牌级稀疏注意力 PIVOT(Proxy Indexing Via One full-prefix Traversal)是一种无需训练、可即插即用的DeepSeek稀疏注意力(DSA)索引器替代方案,它通过在邻近查询组间共享单次前缀扫描来减少计算冗余。PIVOT不再为每个查询单独对每个前置令牌进行评分,而是将查询组聚合为一个代理查询以获取候选集,随后从中为每个查询选出top-k个令牌。
arxiv arXiv cs.CL · 74 天前 · 15 次浏览 DSpark 引入基于置信度调度的推测解码以加速 LLM 推理 DSpark 是一个推测解码框架,旨在通过结合半自回归草稿生成与自适应、负载感知的验证来加速大型语言模型 (LLM) 的推理。它解决了现有并行草稿生成器中存在的接受率衰减和吞吐量下降问题。
arxiv arXiv cs.CL · 23 小时前 · 1 次浏览 DeepSeek发布V4.1-Flash,KV缓存占用仅为890字节/令牌 DeepSeek发布了DeepSeek-V4.1-Flash,这是一种多模态混合专家(MoE)模型,旨在解决智能体工作负载中长上下文计算和高KV缓存带来的高昂成本。
arxiv arXiv cs.AI · 4 天前 · 11 次浏览 Atria Dawn Preview:面向科研的基础代理语言模型 Atria Dawn Preview 是一个面向科学研究和工程工作流的基础代理语言模型,通过可验证经验管道进行训练,该管道将工具中介交互与可执行环境相连接。在涵盖真实世界研究、工程和数字工作的16个基准测试中,该模型的表现可与前沿代理相媲美,并在其中五个基准上取得了最高报告分数。
media AI News (smol.ai) · 6 天前 · 25 次浏览 DeepSeek 推出 V4.1-Flash,一款专注于极致推理效率的开源权重模型 DeepSeek 发布了 V4.1-Flash,这是一款专为极致推理效率和低成本设计的新款开源权重旗舰模型。该模型采用因果编码器-解码器架构,显著降低了活跃计算量和 KV/缓存成本。