← 返回 media r/LocalLLaMA · 52 天前 · open_models Qwen3.6 35B-A3B 在单个提示中生成飞行模拟器 译自 English → 中文 一位 Reddit 用户展示了 Qwen3.6 35B-A3B 从单个提示中生成一个完整的、令人放松的飞行模拟器,包含山脉、云层和无限的过程化地形。 模型被指示在计划模式下无更改地实施该计划。从 GPU 上的 Q4_K_M 切换到 CPU 上的 Q8_0 显著提高了性能。用户指出,质量的提升证明了与更高精度量化相关的速度下降是合理的。 重要性 1/3 r/LocalLLaMA Alibaba (Qwen) Code generation Inference efficiency 阅读原文 相关文章 github llama.cpp · 刚刚 · 1 次浏览 实时 qwen4exp 为 MTP 推测解码添加循环状态回滚支持 qwen4exp 项目已实现循环状态回滚支持,以启用有效的多令牌预测 (MTP) 推测解码。此更改允许目标状态回退被拒绝的草稿令牌数量,从而避免将整个循环状态序列化到主机内存。 media r/LocalLLaMA · 59 天前 · 11 次浏览 Qwen 27B 在消费级硬件上的本地性能 一位用户报告称,Qwen 27B(量化为 q6kxl)在配备 4090 和 3090 GPU 的系统上运行多令牌预测时,解码速度达到 50-90 tokens/s,预填充速度达到 1500-2200 tokens/s。该模型可靠地对接各种 API,并为单页应用、LaTeX 文档、解析器和爬虫生成可运行的代码。 media MarkTechPost · 3 天前 · 8 次浏览 Z.ai与阿里巴巴独立收敛于GLM-5.3-Flash和Qwen3.8-Flash-Next的3:1线性注意力架构 Z.ai发布了GLM-5.3-Flash,这是一个拥有320B参数、18B激活参数的多模态MoE模型;而阿里巴巴的Qwen团队则发布了Qwen3.8-Flash-Next,这是一个拥有125B参数、6B激活参数的模型。尽管是独立开发,但两个团队采用了几乎相同的架构配置。 github llama.cpp · 4 天前 · 26 次浏览 llama.cpp 添加对 Qwen3.8-Flash-Next (qwen4exp) 架构的支持 llama.cpp 项目已添加对 Qwen3.8-Flash-Next (qwen4exp) 模型架构的支持,实现了其特定组件,包括超连接、门控 delta 网络、专家混合(MoE)和 PLE n-gram 哈希嵌入。 lab NVIDIA Technical Blog · 5 天前 · 5 次浏览 阿里巴巴发布用于智能体编程的 Qwen3.8-Flash-Next 176B 预览权重 阿里巴巴发布了 Qwen3.8-Flash-Next 模型权重,作为即将推出的 Qwen4 架构的预览,供开发者进行实验和评估。
github llama.cpp · 刚刚 · 1 次浏览 实时 qwen4exp 为 MTP 推测解码添加循环状态回滚支持 qwen4exp 项目已实现循环状态回滚支持,以启用有效的多令牌预测 (MTP) 推测解码。此更改允许目标状态回退被拒绝的草稿令牌数量,从而避免将整个循环状态序列化到主机内存。
media r/LocalLLaMA · 59 天前 · 11 次浏览 Qwen 27B 在消费级硬件上的本地性能 一位用户报告称,Qwen 27B(量化为 q6kxl)在配备 4090 和 3090 GPU 的系统上运行多令牌预测时,解码速度达到 50-90 tokens/s,预填充速度达到 1500-2200 tokens/s。该模型可靠地对接各种 API,并为单页应用、LaTeX 文档、解析器和爬虫生成可运行的代码。
media MarkTechPost · 3 天前 · 8 次浏览 Z.ai与阿里巴巴独立收敛于GLM-5.3-Flash和Qwen3.8-Flash-Next的3:1线性注意力架构 Z.ai发布了GLM-5.3-Flash,这是一个拥有320B参数、18B激活参数的多模态MoE模型;而阿里巴巴的Qwen团队则发布了Qwen3.8-Flash-Next,这是一个拥有125B参数、6B激活参数的模型。尽管是独立开发,但两个团队采用了几乎相同的架构配置。
github llama.cpp · 4 天前 · 26 次浏览 llama.cpp 添加对 Qwen3.8-Flash-Next (qwen4exp) 架构的支持 llama.cpp 项目已添加对 Qwen3.8-Flash-Next (qwen4exp) 模型架构的支持,实现了其特定组件,包括超连接、门控 delta 网络、专家混合(MoE)和 PLE n-gram 哈希嵌入。
lab NVIDIA Technical Blog · 5 天前 · 5 次浏览 阿里巴巴发布用于智能体编程的 Qwen3.8-Flash-Next 176B 预览权重 阿里巴巴发布了 Qwen3.8-Flash-Next 模型权重,作为即将推出的 Qwen4 架构的预览,供开发者进行实验和评估。