← 返回 media r/LocalLLaMA · 2 小时前 · open_models Qwen3.8-Max 在包括鱼缸破碎模拟在内的 35 个提示词上完成单次生成 译自 English → 中文 文章强调了 Qwen3.8-Max 在单次生成(one-shot)评估上下文中的表现,指出其处理复杂物理模拟的能力。 该模型在 35 个不同的提示词上进行了测试。它成功模拟了鱼缸破碎的场景,据来源指出,这在已评估的模型中仅与 Opus 共享此成就。结果来源于 oneshotlm.com。 重要性 2/3 r/LocalLLaMA Alibaba (Qwen) Multimodal 阅读原文 相关文章 media r/LocalLLaMA · 6 天前 · 1 次浏览 微软发布Mage-VL,一种基于编解码器的原生流式多模态模型 微软发布了Mage-VL,这是一种高效的4B参数多模态基础模型,用于图像和视频理解,采用编解码器原生的方法来简化视觉处理。该系统将视频流分离为关键帧(I帧)和预测帧(P帧),仅保留编解码器分配比特的补丁,从而将视觉标记的消耗减少超过75%。 media MarkTechPost · 15 天前 · 7 次浏览 阿里巴巴预览Qwen3.8-Max,一款拥有2.4万亿参数的多模态模型 7月19日,阿里巴巴的Qwen团队预览了Qwen3.8-Max-Preview,这是一款拥有2.4万亿参数的大型旗舰多模态模型。该公告是在上海世界人工智能大会上发布的,紧随Moonshot AI发布Kimi K3模型两天之后。 arxiv arXiv cs.AI · 21 天前 测试时扩展通过修复提示可解析性并增加token预算来提升小型VLM的性能 本研究考察了测试时扩展(TTS)是否适用于小型开放视觉语言模型,使用了EXAMS-V多语言视觉多项选择基准。比较了在Qwen2.5-VL-7B-Instruct和Qwen3.5-4B上自洽性、描述后推理结合PRM引导的束搜索以及事后选择器的表现。 arxiv arXiv cs.CL · 22 天前 测试时扩展提升了小型VLM的多语言视觉多选题表现 该研究考察了测试时扩展(TTS)是否适用于小型开源视觉-语言模型,使用EXAMS-V基准在Qwen2.5-VL-7B-Instruct和Qwen3.5-4B上比较了各种方法。 arxiv arXiv cs.CL · 29 天前 Qwen3-VL-8B-Instruct 及其他视觉语言模型在对话中高估共同基础 一项研究调查了视觉语言模型(VLMs)能否区分在协作对话中可能共享的内容与已确立为共享理解的内容。研究人员利用 HCRC MapTask 对话中的 13,077 个标注参考表达式构建了解释匹配任务,以在受控条件下评估模型行为。
media r/LocalLLaMA · 6 天前 · 1 次浏览 微软发布Mage-VL,一种基于编解码器的原生流式多模态模型 微软发布了Mage-VL,这是一种高效的4B参数多模态基础模型,用于图像和视频理解,采用编解码器原生的方法来简化视觉处理。该系统将视频流分离为关键帧(I帧)和预测帧(P帧),仅保留编解码器分配比特的补丁,从而将视觉标记的消耗减少超过75%。
media MarkTechPost · 15 天前 · 7 次浏览 阿里巴巴预览Qwen3.8-Max,一款拥有2.4万亿参数的多模态模型 7月19日,阿里巴巴的Qwen团队预览了Qwen3.8-Max-Preview,这是一款拥有2.4万亿参数的大型旗舰多模态模型。该公告是在上海世界人工智能大会上发布的,紧随Moonshot AI发布Kimi K3模型两天之后。
arxiv arXiv cs.AI · 21 天前 测试时扩展通过修复提示可解析性并增加token预算来提升小型VLM的性能 本研究考察了测试时扩展(TTS)是否适用于小型开放视觉语言模型,使用了EXAMS-V多语言视觉多项选择基准。比较了在Qwen2.5-VL-7B-Instruct和Qwen3.5-4B上自洽性、描述后推理结合PRM引导的束搜索以及事后选择器的表现。
arxiv arXiv cs.CL · 22 天前 测试时扩展提升了小型VLM的多语言视觉多选题表现 该研究考察了测试时扩展(TTS)是否适用于小型开源视觉-语言模型,使用EXAMS-V基准在Qwen2.5-VL-7B-Instruct和Qwen3.5-4B上比较了各种方法。
arxiv arXiv cs.CL · 29 天前 Qwen3-VL-8B-Instruct 及其他视觉语言模型在对话中高估共同基础 一项研究调查了视觉语言模型(VLMs)能否区分在协作对话中可能共享的内容与已确立为共享理解的内容。研究人员利用 HCRC MapTask 对话中的 13,077 个标注参考表达式构建了解释匹配任务,以在受控条件下评估模型行为。