过去一个月内,中国发布了四个大型语言模型:Kimi K3-2.8T、Qwen3.8-2.4T、DeepSeek-V4-Pro-0813-1.6T 和 GLM-5.3-743B。
media
r/LocalLLaMA
·
8 小时前
·
open_models
Kimi K3、Qwen3.8、DeepSeek-V4-Pro-0813 和 GLM-5.3 在一个月内发布
译自 English → 中文
相关文章
media
AI News (smol.ai)
·
2 天前
·
11 次浏览
xAI发布Grok 4.6;阿里巴巴开源Qwen3.8-MoE;DeepSeek V4 Pro正式商用
本周AI新闻重点介绍了xAI、阿里巴巴和DeepSeek的重大发布,以及开源视频模型和推理基础设施的更新。
media
Interconnects
·
12 天前
·
11 次浏览
Thinking Machines发布Inkling,腾讯以Apache 2.0许可证更新Hy3
最新的开源模型成果汇总突出了Thinking Machines和腾讯的重大发布,以及Poolside和DeepSeek的更新。
media
TLDR AI
·
25 天前
·
6 次浏览
Qwen3.8 开源发布、Kimi Code CLI、Netflix LLM 技术栈、阿里芯片软件
阿里巴巴宣布开源 Qwen3.8,这是一个拥有 2.4 万亿参数的模型,同时开源了其“玄武”AI 芯片软件技术栈,以减少对英伟达 CUDA 生态系统的依赖。
media
MarkTechPost
·
27 天前
·
24 次浏览
Kimi K3、DeepSeek V4 Pro 和 GLM-5.2 在基准测试、许可证和服务成本方面的对比
对三种开源稀疏混合专家模型——月之暗面的 Kimi K3、DeepSeek V4 Pro 以及智谱 AI 的 GLM-5.2——进行了比较,评估了它们在长周期编码和智能体工作负载方面的能力、许可条款及服务成本。
arxiv
arXiv cs.CL
·
36 天前
将 deepseek-r1:8B 蒸馏至 Qwen3-0.6B 可实现快速的设备端结构化文本增强
研究人员证明,将 8B 推理教师模型(deepseek-r1:8B)通过 QLoRA 蒸馏到 0.6B 学生模型(Qwen3-0.6B),能够以显著更低的延迟和成本实现高吞吐量的结构化提取。该研究评估了将此方法应用于将新闻文章映射为包含摘要和分类标签的 JSON 对象,并将蒸馏后的模型与少样本提示和约束解码基线进行了比较。