← 返回 media r/LocalLLaMA · 1 小时前 · open_models AntLing开源金融增强模型Ling-3.0-flash-Fin 译自 English → 中文 蚂蚁集团开源了Ling-3.0-flash-Fin,这是Ant Ling家族中首个金融增强模型,由蚂蚁集团与领先金融机构及领域专家共同开发。 该模型通过在高质量金融数据上持续训练,扩展了Ling 3.0 flash的能力。它拥有124B总参数量、5.1B激活参数量以及256K上下文窗口。其架构旨在将金融专业知识与长周期智能体工作流的高效推理相结合。 重要性 2/3 r/LocalLLaMA Alibaba (Qwen) Open weights 阅读原文 相关文章 media r/LocalLLaMA · 2 天前 · 4 次浏览 Qwen发布Qwen3.8-Max-0902,拥有2.4T参数和1M上下文 Alibaba发布了其大型语言模型Qwen3.8-Max-0902的升级版。新模型拥有2.4万亿参数,支持100万token的上下文窗口。 media AI News (smol.ai) · 6 天前 · 29 次浏览 Z.ai、腾讯和阿里巴巴发布开源权重的GLM-5.3、Hy4-preview和Qwen3.8 Flash 本周的AI新闻突出了来自Z.ai、腾讯和阿里巴巴的重大开源权重模型发布,以及推理基础设施和智能体基准测试方面的发展。 media MarkTechPost · 8 天前 · 28 次浏览 阿里巴巴Qwen团队发布Qwen3.8-Flash-Next,预览Qwen4架构 阿里巴巴Qwen团队发布了Qwen3.8-Flash-Next,这是一个开源权重的多模态混合专家模型,旨在预览即将推出的Qwen4系列架构。该检查点将125B主干与51B N-gram嵌入表和4B多令牌预测模块配对,每个令牌仅激活6B参数。 media r/LocalLLaMA · 9 天前 · 2 次浏览 Qwen发布Qwen3.8-Flash-Next模型 Qwen团队发布了Qwen3.8-Flash-Next模型,该模型现已在ModelScope上可用。 arxiv arXiv cs.LG · 11 天前 · 15 次浏览 量化感知修复比QAT更快地恢复4位LLM 作者介绍了量化感知修复(QAH),一种直接从 uncompressed 模型中蒸馏4位学生以恢复在结构压缩和量化过程中丢失的性能的管道。应用于 GPT-OSS 120B,该方法生成了 Hypernova-60B,它在9个基准测试中的7个上与 bfloat16 源相匹配或超越,同时使用的权重内存大约减少了4倍。
media r/LocalLLaMA · 2 天前 · 4 次浏览 Qwen发布Qwen3.8-Max-0902,拥有2.4T参数和1M上下文 Alibaba发布了其大型语言模型Qwen3.8-Max-0902的升级版。新模型拥有2.4万亿参数,支持100万token的上下文窗口。
media AI News (smol.ai) · 6 天前 · 29 次浏览 Z.ai、腾讯和阿里巴巴发布开源权重的GLM-5.3、Hy4-preview和Qwen3.8 Flash 本周的AI新闻突出了来自Z.ai、腾讯和阿里巴巴的重大开源权重模型发布,以及推理基础设施和智能体基准测试方面的发展。
media MarkTechPost · 8 天前 · 28 次浏览 阿里巴巴Qwen团队发布Qwen3.8-Flash-Next,预览Qwen4架构 阿里巴巴Qwen团队发布了Qwen3.8-Flash-Next,这是一个开源权重的多模态混合专家模型,旨在预览即将推出的Qwen4系列架构。该检查点将125B主干与51B N-gram嵌入表和4B多令牌预测模块配对,每个令牌仅激活6B参数。
media r/LocalLLaMA · 9 天前 · 2 次浏览 Qwen发布Qwen3.8-Flash-Next模型 Qwen团队发布了Qwen3.8-Flash-Next模型,该模型现已在ModelScope上可用。
arxiv arXiv cs.LG · 11 天前 · 15 次浏览 量化感知修复比QAT更快地恢复4位LLM 作者介绍了量化感知修复(QAH),一种直接从 uncompressed 模型中蒸馏4位学生以恢复在结构压缩和量化过程中丢失的性能的管道。应用于 GPT-OSS 120B,该方法生成了 Hypernova-60B,它在9个基准测试中的7个上与 bfloat16 源相匹配或超越,同时使用的权重内存大约减少了4倍。