阿里巴巴在云栖大会宣布推出 Qwen 4
阿里巴巴已在云栖大会上正式宣布发布 Qwen 4。
阿里巴巴已在云栖大会上正式宣布发布 Qwen 4。
阿里巴巴 Qwen 团队发布了 Qwen3.8-Omni-Flash,这是其首款围绕音频-视频理解和工具使用的智能体能力设计的多模态模型。该模型接受文本、图像、音频和视频输入,返回文本输出,具备 1M token 上下文窗口和原生函数调用功能。
阿里巴巴通义千问团队发布了Qwen-Audio-3.1,这是一个包含五个模型的音频堆栈,其中包括全新的Qwen-Audio-3.1-Realtime-plus,这是一款专为具备推理和工具使用能力的语音代理设计的全双工语音模型。此次发布还引入了ASR服务价格最高降低95%的优惠。
ISTA深度算法与系统实验室发布了稀疏混合专家模型Qwen3.8-Flash-Next的量化GGUF版本,以及一个移除了半数专家的实验性能力定向构建版本。
作者介绍了 RareDx,该系统将受控证据使用与知识图谱基策略优化相结合,以解决罕见病诊断中的长尾推理问题。训练流程结合了 Top-10 后训练与 RareDx-KGPO,后者将预测结果投影到规范疾病图谱中,并整合了精心策划的分级相关性、本体邻近性、生物医学相似性和表型一致性。
研究人员引入了带有理由的视觉可答性诊断(Visual Answerability Diagnosis with Rationales,VAD-R),这是一个新基准,旨在评估视觉-语言模型在不依赖捷径线索的情况下拒绝回答不可回答问题(unanswerable questions)的能力。研究表明,虽然隐藏状态能够区分问题的可答性,但当前模型未能将这种能力转化为明确的决策。
VHD-Play 是一个流水线,通过对数学模型进行采样和求解,并将其决策过程呈现为有状态工具,从而生成多样化的代理式强化学习环境。该方法确保可执行动态和轨迹评分参考直接继承自已解模型,解决了现有生成流水线中常见的对齐问题。
研究人员推出了SkillGym,这是一个框架,可将人工编写的智能体技能转化为可执行、可验证的大语言模型智能体训练环境。该系统利用技能到任务(skill-to-task)流水线实例化具体任务,并通过基于代码的检查器验证结果。
研究人员推出了 VideoX-Qwen,这是一个集成框架,将可扩展的数据构建与模型训练相结合,以推进通用、指令驱动的视频编辑。该系统利用生产流水线组织专用模型生成方向性编辑记录,从而在添加、删除、替换和属性任务中产生超过 120 万份高质量样本。
阿里云推出了Qwen3.8-Omni-Flash,这是一款原生的多模态智能体模型,专为现实世界的生产力任务设计,与之前的全模态模型相比,大幅提升了多模态理解和推理能力。
阿里巴巴宣布计划开发一款包含5万亿至10万亿参数的人工智能模型。与此同时,该公司还发布了一款专为支持其基础设施需求而设计的全新定制芯片。
阿里巴巴Qwen团队发布了Qwen-Image-2.1,这是一个统一的文本到图像生成和图像编辑模型,将之前独立的检查点整合为一个拥有70亿参数的扩散Transformer。
Qwen 发布了开源权重的 Qwen-Image-2.1,这是一款专为图像生成和编辑设计的统一模型。
阿里巴巴Qwen团队发布了Qwen3.8-LiveTranslate,这是一款下一代实时同步翻译模型,能够在说话者仍在讲话时监听实时语音并返回翻译后的文本和音频。此次发布引入了新的Interleave架构,旨在降低延迟并提升翻译质量。
阿里巴巴发布了一款开源医疗人工智能模型,能够检测癌症以及大约150种其他医疗状况。
Qwen3.8 Max (0902)模型在Artificial Analysis智能指数中获得了45分,重新夺回中国排行榜的榜首位置。
TRL v1.14 为 AsyncGRPOTrainer 引入了 LoRA 支持,使其能够训练低秩适配适配器,并仅将该小文件同步到 vLLM 推理工作节点。该架构通过使用共享存储桶作为文件系统桥接,将不同机器上的训练和生成作业解耦,消除了节点间对 NCCL 或直接网络通信的需求。
一项研究对“脆弱标记”进行了刻画,这些是开放权重语言模型中的词汇条目,它们在孤立时能够成功复制,但在嵌入周围文本时会表现出错误。该研究强调,标准隔离测试并不能保证字面身份的保留,因为标记在序列中可能会被删除、替换或截断。
ExecCritic引入了一种框架,将测试构建与源代码修复分离开来,以防止编码智能体产生虚假的信心。该系统采用一个Test智能体和一个Repair智能体,两者均由Qwen-3.5-35B-A3B提供支持,并分别使用强化学习进行训练。
研究人员推出了ExecCritic,这是一个将测试-验证-修订框架与角色特定的强化学习相结合,以增强编码智能体的框架。该系统将测试构建与源代码修复分离,使用Test智能体生成仓库原生测试,并使用Repair智能体根据执行反馈修订代码。