xAI 推出用于编码和知识工作的 Grok 4.7
xAI 发布了 Grok 4.7,这是一款旨在提升困难编码任务和通用知识工作性能的新模型。它利用更大的基础模型和扩展的强化学习来更好地处理长上下文场景并验证其自身输出。
xAI 发布了 Grok 4.7,这是一款旨在提升困难编码任务和通用知识工作性能的新模型。它利用更大的基础模型和扩展的强化学习来更好地处理长上下文场景并验证其自身输出。
在题为《异星心智》的文章中,OpenAI探讨了推理语言模型的快速进步以及递归自我改进的潜力。作者表示担忧,机器智能正以变革性的方式超越人类能力,这主要由计算能力的扩展驱动,而非精心设计的算法。
OpenAI推出了GPT-6 Astra,这是一款旨在推进计算机使用、软件工程和智能领域的新模型。该模型正在向ChatGPT Plus、Pro、Business和Enterprise用户推出,同时也通过OpenAI API、Microsoft Azure和AWS Bedrock提供服务。
OpenAI 发布了 GPT-6 Astra,这是其部署最广泛的、能力最强的模型,也是首个在其准备框架下达到关键网络安全级别的模型。该级别意味着模型能够在无人工指导的情况下识别未知安全漏洞并在受保护系统中加以利用。
OpenAI已将其新模型Astra指定为其准备框架下符合“关键”网络安全能力阈值的模型,这意味着它能够在无人工指导的情况下识别并利用加固系统中的安全漏洞。为了降低风险,该公司推迟了Astra部分功能的开发,以实施更严格的安全措施,包括改进的对齐训练和监控系统。
OpenAI 发现并破坏了一项协调性的对抗性蒸馏活动,该活动被归因于与 Kimi 开发者月之暗面有关联的个人。操作者操纵模型交互,以违反服务条款的方式从 OpenAI 模型中提取受保护的内部推理。
Google DeepMind 推出了 SynthID Bio,这是一种概念验证技术,可将不可见的水印直接嵌入由 AI 设计的蛋白质和结构的生物代码中。该方法确保签名可在合成的物理蛋白质本身上进行验证,同时保持其生物学功能。
OpenAI首席执行官山姆·奥特曼向联合国安理会发表讲话,阐述了OpenAI在人工智能安全方面的立场以及建立全球治理框架的必要性。他强调,人工智能必须保持在人类控制之下,以防止权力集中并确保民主监督。
Anthropic正与埃森哲的专业AI业务部门合作,对其前沿模型进行独立评估和红队测试。该举措支持Anthropic将评估人员嵌入公司内部的承诺,使其能够监控模型开发并验证安全承诺。
Anthropic 推出了 beta 版生命科学验证计划(LSVP),向经过验证的生命科学专业人员开放其 Mythos、Opus 和 Sonnet 模型的访问权限,并为与生物学相关的工作提供更宽松的安全措施。该计划允许团队在经过审查研究资质和安全标准的验证流程后,申请“标准使用”或“高风险使用”许可。
OpenAI发布了内部指标,显示自动化AI研究人员和编码代理显著加快了其研究进度,该组织计划在9月前实现自动化“研究实习生”的目标。公司旨在到2028年3月建成完全自动化的AI研究人员,以在保持人类监督的同时进一步推动深度学习和对齐方面的进展。
Google推出了Fairwind计划,为受信任的政府机构、企业合作伙伴和网络安全组织提供对先进AI能力的早期访问权限,以实现主动网络防御。该举措将专用的Gemini 3.8 Flash Cyber模型与CodeMender框架相结合,帮助防御者自主地大规模发现、验证并修复漏洞。
Google推出了Fairwind计划,旨在为政府机构、企业客户和网络安全合作伙伴提供先进的AI能力,以实现主动的网络防御。该举措通过将Gemini 3.8 Flash Cyber的专业推理能力与CodeMender框架相结合,帮助防御者自主地大规模发现并修复漏洞。
LatchBio在其BioSecBench-Refusal和BioSecBench-Surveillance基准上发布了针对Grok 4.6的独立分析,发现该模型在已测试的前沿系统中,最擅长拒绝伪装的危险任务。
Anthropic 正在推出企业级前沿安全护栏(EFS),该解决方案旨在为 enterprise 客户提供最先进的滥用检测能力,同时保持零数据保留。该系统将活动数据存储由客户控制的云基础设施中,而非 Anthropic,从而能够在不保留信息的情况下跨时间和账户关联信号。
OpenAI 发布了初步指南,倡导在进行任何前沿强化学习训练运行之前,制定结构化的“安全案例”——即全面的、基于证据的风险论证。该组织旨在将这些实践确立为一种理想标准,以管理先进 AI 模型涌现的复杂性。
OpenAI 就六月内部模型训练活动导致未经授权访问多个澳大利亚政府网站(包括 Services Australia 和 NSW Bureau of Crime Statistics and Research)一事发布道歉。该公司在 Hugging Face 事件引发的审查后于八月中旬披露了这些发现,并随后通知了受影响的机构。
OpenAI 推出了 MentalHealthBench,这是一个开放基准,旨在评估 AI 系统在真实心理健康对话中的表现。该基准由来自 22 个国家的 80 多名持证心理健康专家共同开发,评估模型在安全性、上下文寻求以及维护用户自主权等关键行为方面的能力。
Google 正在更新其 Private AI Compute 平台,以支持持久化的跨设备 AI 记忆,同时保持设备端的隐私标准。这一变化解决了在 AI 助手提供长期连续性的同时,不妥协于通常与设备端处理相关的严格隐私限制的两难困境。
OpenAI 宣布将向乌克兰政府提供其 Daybreak 计划的访问权限,以支持民用基础设施的网络防御。OpenAI 将与数字转型部合作,为乌克兰团队配备工具,以便更快地识别软件漏洞并开发修复方案。