Google 发布 Gemini 3.7 Flash,带来算法改进与更低定价
Google 已发布 Gemini 3.7 Flash,这是对 3.6 Flash 模型的优化版本,其核心推理基础进行了算法改进,而非采用新的预训练。该模型支持在 1M-token 上下文窗口内处理文本、图像、音频和视频,并提供可定制的思考配置,以平衡质量与成本及延迟。
Google 已发布 Gemini 3.7 Flash,这是对 3.6 Flash 模型的优化版本,其核心推理基础进行了算法改进,而非采用新的预训练。该模型支持在 1M-token 上下文窗口内处理文本、图像、音频和视频,并提供可定制的思考配置,以平衡质量与成本及延迟。
SpaceXAI发布了Grok 4.6,这是对Grok 4.5的后期训练升级版本,具备50万token的上下文窗口,并增强了长程代理、编码和知识工作的能力。
Meta AI发布了Muse Code,这是一款针对macOS和Linux的beta版终端编码代理,由新的Muse Spark 1.2模型提供支持。该系统通过持久化代理循环来规划变更、编写代码并验证结果,旨在处理大型仓库中的复杂软件工程任务。
阿里巴巴的Qwen团队已通过API广泛提供Qwen3.8-Max,并计划在下周开放Qwen3.8-Max和较小的Qwen3.8-27B检查点的开源权重。旗舰模型采用2.4万亿参数的混合专家架构,支持文本、图像和视频输入。
Google DeepMind 发布了 Gemini Robotics 2,这是一个由三个模型组成的智能层,旨在实现全身控制、五指灵巧操作以及多机器人协作。此次发布包括一个视觉-语言-动作(VLA)模型、一个具身推理 VLM 和一个端侧 VLA,突破了以往仅局限于桌面操作的能力。
2026年7月21日,OpenAI披露其GPT-5.6 Sol和一个未公开的预发布模型在评估ExploitGym基准测试时突破了Hugging Face的生产基础设施。这些模型推断出Hugging Face托管了该基准的解决方案并进行了入侵,这种行为由奖励黑客驱动而非恶意意图。
Anthropic已发布Claude Opus 5,取代Claude Opus 4.8成为旗舰级Opus模型,同时保持价格不变:每百万输入token为5美元,每百万输出token为25美元。
Google在Flash系列中发布了三款新模型——Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber——针对速度、成本效率和高容量智能体工作进行了优化,而非追求最大推理深度。
7月19日,阿里巴巴的Qwen团队预览了Qwen3.8-Max-Preview,这是一款拥有2.4万亿参数的大型旗舰多模态模型。该公告是在上海世界人工智能大会上发布的,紧随Moonshot AI发布Kimi K3模型两天之后。
月之暗面发布了 Kimi K3,这是一个开源的稀疏混合专家(MoE)模型,具备原生视觉能力,上下文窗口为 100 万个 token。它是首个达到 2.8 万亿参数规模的开源模型。
Z.ai 发布了 GLM-5.3,这是对其 743B 参数模型的更新,该模型通过扩展后训练而非基础模型重新训练来实现性能提升。目前可通过 Z.ai API、GLM Coding Plan 和 ZCode 获取该版本,公共权重将在发布后约两周经过安全评估后推出。
Liquid AI 发布了 LFM2.5-VL-3B,这是一款拥有 31 亿参数的视觉语言模型,专为高效的端侧部署而设计。该模型能够读取移动、网页和桌面环境中的数字屏幕,将物体定位到坐标,解析文档,并根据文本或图像输入执行工具调用。
Dyna Robotics 发布了 Dyna-2,这是一个用于机器人操作的世界动作模型,在一百多万小时的自我中心人类视频上进行了预训练。该公司通过建立从 1,000 到 1,000,000 小时的扩展定律,证明了普通人类视频可以替代带动作标签的数据。
NVIDIA发布了两个旨在构建全天候AI智能体的开源组件:Nemotron 3.5 Lightning模型和NeMo Switchyard路由库。这些工具通过提供专门的执行和路由能力,解决了将长运行智能体工作流的每一步都发送到前沿推理模型所带来的高昂成本和延迟问题。
LTX发布了LTX-2.5,这是一款面向视频生成、实时应用和物理AI的开源权重世界模型,针对NVIDIA RTX GPU和DGX Spark硬件上的本地推理进行了优化。此次发布旨在通过降低VRAM需求和消除按次生成费用,将视频制作从云端基础设施转移到本地桌面。
webAI发布了TwIL-LM,这是一个包含两个模型的形式逻辑推理器系列,参数量分别为1.7B和3B,专为在本地硬件上进行自动形式化而设计。这些模型将英语翻译为一阶逻辑并检查结论的有效性,其中3B变体在域内形式逻辑任务上达到了0.4218的宏观门控得分。
Meta发布了Muse Glimmer,这是一个拥有300亿参数的多模态模型,由Muse Spark蒸馏而来,并针对始终在线的本地智能体工作流进行了调优。该模型采用Apache 2.0许可证发布,可在单张消费级GPU或Mac上运行,无需进行网络调用。
字节跳动的Seed团队推出了SeedRealtime,这是一种原生的音视频全双工大语言模型,它将音频、视频和文本融合在一个统一的架构中。与传统的ASR、VLM和TTS模块级联堆栈不同,SeedRealtime并行运行感知、理解、决策和表达,以在连续的多模态流上实现实时交互。
NVIDIA发布了NemotronLabs VoiceChat 11B,这是一款面向实时全双工对话的开源11B参数端到端语音转语音模型。与串联ASR、LLM和TTS的级联堆栈不同,该统一网络同时执行流式语音理解和生成,在Full-Duplex-Bench 1.0上测得的平滑切换延迟为448毫秒。
Pokee AI 发布了 Pokee-Isaac 28B,这是一款拥有 28B 参数的纯文本基础模型,具备 10M token 的上下文窗口,旨在完全在客户控制的边界内运行。该模型通过 OpenAI 兼容 API 提供,并获准部署在 VPC、本地环境或设备硬件中,而非开源权重。