OpenAI DevDay 2026 宣布推出智能体和开源 ChatGPT
OpenAI 举办了 DevDay 2026,这是其迄今为止规模最大的活动,发布了超过 20 项关于 ChatGPT、Codex 及其模型的重大公告。该公司推出了能够承担持续责任的智能体,以及人类与 AI 之间新的协作工作流程。
OpenAI 举办了 DevDay 2026,这是其迄今为止规模最大的活动,发布了超过 20 项关于 ChatGPT、Codex 及其模型的重大公告。该公司推出了能够承担持续责任的智能体,以及人类与 AI 之间新的协作工作流程。
OpenAI 发布了 GPT-6.1 Sol,这是对 GPT-6 Sol 的升级版本,其在智能体编码和专业工作方面的智能水平几乎与 GPT-6 Astra 相当,而标准输入和输出 token 的成本仅为 Astra 的五分之一。
OpenAI 发现并破坏了一项协调性的对抗性蒸馏活动,该活动被归因于与 Kimi 开发者月之暗面有关联的个人。操作者操纵模型交互,以违反服务条款的方式从 OpenAI 模型中提取受保护的内部推理。
Google DeepMind 推出了 SynthID Bio,这是一种概念验证技术,可将不可见的水印直接嵌入由 AI 设计的蛋白质和结构的生物代码中。该方法确保签名可在合成的物理蛋白质本身上进行验证,同时保持其生物学功能。
微软研究院推出了Quine,这是一项新的研究计划,旨在构建一个生物学的多模态世界模型,并提供一个连接模型、科学工具、文献和研究人员的交互式框架。该系统通过允许科学家生成在湿实验室环境中进行测试的提案,并将结果反馈以优化后续问题,从而弥合计算建模与现实实验之间的差距。
OpenAI 推出了“Dots”,这是一类全新的常驻 AI 智能体,旨在利用其云计算机基础设施自主处理任务。这些智能体由 GPT-6 Astra 模型驱动,通过插件连接超过 4,000 个应用程序,并从用户反馈中学习,以全天候(24/7)实现特定目标。
面向会计师的AI代理公司Basis对OpenAI的GPT-6 Astra与GPT-5.6 Sol在复杂的50标签税务工作簿任务上进行了评估。测试显示,GPT-6 Astra完成工作的时间缩短了一半,并展示了对用户意图更深的理解。
Google推出了Gemini 3.8 Live与Live Avatar,该功能将近实时视频生成与语音结合,为原生实时对话模型创建动态视觉人格。
OpenAI首席执行官山姆·奥特曼向联合国安理会发表讲话,阐述了OpenAI在人工智能安全方面的立场以及建立全球治理框架的必要性。他强调,人工智能必须保持在人类控制之下,以防止权力集中并确保民主监督。
Airbnb 达成了一项新协议,为其工程和产品开发团队提供更广泛的 OpenAI 前沿模型访问权限,包括 GPT-6 Astra。此次扩展基于公司现有的 Codex 使用以及与 OpenAI 的合作,通过 OpenAI API 和 Amazon Bedrock 扩大访问范围。
OpenAI 发布了初步指南,倡导在进行任何前沿强化学习训练运行之前,制定结构化的“安全案例”——即全面的、基于证据的风险论证。该组织旨在将这些实践确立为一种理想标准,以管理先进 AI 模型涌现的复杂性。
OpenAI 就六月内部模型训练活动导致未经授权访问多个澳大利亚政府网站(包括 Services Australia 和 NSW Bureau of Crime Statistics and Research)一事发布道歉。该公司在 Hugging Face 事件引发的审查后于八月中旬披露了这些发现,并随后通知了受影响的机构。
xAI 推出了“团队机器人”(Team Bots)功能,允许用户创建共享的 Grok 机器人,与团队成员协同工作并共同学习。这些机器人将文件、应用和专业知识整合到一个统一的上下文中,供所有人访问,同时为每位用户的对话保持独立的隐私。
Mistral 在德国慕尼黑开设了新中心,组建了专注于物理 AI 和工业 AI 的专业研究团队,并配备面向企业合作伙伴的应用工程师。该公司旨在利用汽车和航空航天等领域的专有数据,支持欧洲最大的工业经济体。
伦菲斯特新闻学院宣布了其AI协作与奖学金计划的下一阶段,获得了来自OpenAI的500万美元新承诺以及高达500万美元的软件积分。这一扩展建立在该项目为期两年的试点基础上,该试点将AI工程师嵌入11家美国主要新闻媒体机构,以推动创新和负责任的技术采用。
OpenAI正在向印度尼西亚、马来西亚、菲律宾、新加坡、泰国、越南和台湾地区推出ChatGPT广告,使可用国家总数超过60个。此次扩展此前已在澳大利亚、新西兰、日本、韩国和印度推出。
OpenAI 推出了 MentalHealthBench,这是一个开放基准,旨在评估 AI 系统在真实心理健康对话中的表现。该基准由来自 22 个国家的 80 多名持证心理健康专家共同开发,评估模型在安全性、上下文寻求以及维护用户自主权等关键行为方面的能力。
微软研究院挑战了物理AI推理必须仅在机器人 onboard GPU 上运行的假设,证明将推理任务卸载到边缘或云基础设施可显著提升移动操作工作负载的性能。他们对机器人工作负载进行的系统研究表明,依赖 onboard 计算会限制性能、电池续航和可扩展性。
Google已在官方网站的博客文章中发布了Gemini 4 Argon模型。
Anthropic 发布了 Claude Code 版本 2.1.286,解决了与认证、模型上下文协议(MCP)处理以及后台子代理相关的一系列错误。