小米开源 MiMo-V2.6 Pro 和 Flash 模型
小米已开源 MiMo-V2.6 Pro 和 Flash 多模态模型,旨在协调智能体构建并视觉测试交互式 3D 场景。这些模型可以生成 Blender 资产、根据摄像头画面控制机械臂、生成前端和演示文稿、组装视频以及创作乐谱和 MIDI 音乐。
小米已开源 MiMo-V2.6 Pro 和 Flash 多模态模型,旨在协调智能体构建并视觉测试交互式 3D 场景。这些模型可以生成 Blender 资产、根据摄像头画面控制机械臂、生成前端和演示文稿、组装视频以及创作乐谱和 MIDI 音乐。
AntLing 发布了 Ming-Image-0.1-Design 系列,其中包括两个 6B 参数模型:Ming-Image-0.1-Design 和 Ming-Image-0.1-Design-Layer。
小米已发布MiMo-V2.6系列,推出了原生全模态模型,包括MiMo-V2.6-Pro和MiMo-V2.6-Flash。该公司还推出了MiMo-V2.6-Pro-UltraSpeed,在保持同等质量的前提下,输出速度最高提升20倍。
AWS Strands Agents 团队发布了 Strands Harness,这是一个开源的通用代理框架,基于 Apache 2.0 许可证提供,支持 Python 和 TypeScript。该工具旨在弥合在 Claude Code 或 Codex 等环境中进行代理原型设计与使用自定义循环部署代理之间的差距。
微软研究院已发布并开源了RetroChimera,这是一个用于逆合成预测的新框架,它结合了两个互补模型以提出高质量的合成路线。该系统将基于Transformer的从头生成模型R-SMILES 2与基于图神经网络(GNN)的NeuralLoc模型相结合,采用一种学习到的集成策略对预测结果进行排序。
阿里巴巴Qwen团队发布了Qwen-Image-2.1,这是一个统一的文本到图像生成和图像编辑模型,将之前独立的检查点整合为一个拥有70亿参数的扩散Transformer。
tokenizers 库发布了版本 1 的候选版本,显著提升了文本编码的性能,解决了训练和服务工作流中的瓶颈。该更新在保持与 v0.23 API 兼容的同时,为十个模型系列带来了大幅度的加速。
Multiverse发布了一篇论文,详细介绍了一种将大型语言模型剪枝重新表述为约束二进制优化问题并映射到伊辛玻璃的方法。通过将Transformer块视为具有由损失海森矩阵导出的成对耦合的自旋,该方法无需迭代基准测试即可识别最优的块移除配置。
作者就开源权重模型的现状进行了简报,指出自2025年4月左右以来,中国AI公司已成为该领域的明确领导者。这一转变通过Hugging Face的下载指标和能力基准测试中的表现得到证实。
Qwen 发布了开源权重的 Qwen-Image-2.1,这是一款专为图像生成和编辑设计的统一模型。
Stepfun已发布Step 5 Preview 600B-A27B模型,目前可通过其产品及API使用。 该模型的开源权重版本将于10月15日发布。
仓库 stepfun-ai/Step-5-Preview-BF16 已发布到 Hugging Face。提交标题表明该模型看起来很有前景。
Stepfun的新“Step 5”模型的预览已在网上泄露。
阿里巴巴发布了一款开源医疗人工智能模型,能够检测癌症以及大约150种其他医疗状况。
inclusionAI 已在 Hugging Face 上发布了 Realtime-Venus 系统,包含两个检查点:Realtime-Venus-Omni 和 Realtime-Venus-Audio。Omni 检查点是一个 9B 的音视频交互模型,基于 MiniCPM-o 4.5 适配而成,能够持续观察并聆听以决定何时回应。
由清华大学教授戴继峰创立的隐身初创公司Naive AI已完成三轮融资,总额达4亿美元,估值超过14亿美元。该公司正准备以开源权重形式发布其首个大型语言模型(同样命名为Naive),最早可能在本月推出。
腾讯发布了 WeVisDoc,这是一种针对页面图像端到端的文档解析器,基于 Qwen3-VL 模型微调而成。该系统将页面图像转换为结构化的 Markdown,包括 LaTeX 公式和 HTML 表格。
腾讯发布了 WeVisDoc-4B,这是一款用于页面图像的端到端文档解析器,可将页面转换为包含 LaTeX 公式和 HTML 表格的结构化 Markdown。该模型基于 Qwen3-VL-4B-Instruct 进行微调,在 OmniDocBench v1.6 上取得了 95.38 的总体得分,并在所有四项报告的设置中位居被比较的解析器之首。
Together 提供了一套框架,帮助企业通过托管服务从闭源 AI 模型迁移到开源模型(OSM),旨在降低复杂性并加速采用。该过程包括通过基准测试发现合适的模型、通过流量回放进行评估、调整提示词或权重,以及计算投资回报率以证明切换的合理性。
Mozilla的一份报告指出,中国的开源AI模型已缩小研发差距,仅落后于美国前沿产品四个月。尽管进展迅速,这些模型在某些基准测试中仍然落后。