最近的一项分析突显了当前大型语言模型架构中一个根本性的结构倾向:检索并输出其预训练数据集中占主导地位的统计叙事。这种行为有效地用基于概率的标记补全替代了客观的真值(ground-truth)评估。
该研究将模型描述为像互联网共识的回音室,而不是对底层前提执行实际的逻辑推理。
最近的一项分析突显了当前大型语言模型架构中一个根本性的结构倾向:检索并输出其预训练数据集中占主导地位的统计叙事。这种行为有效地用基于概率的标记补全替代了客观的真值(ground-truth)评估。
该研究将模型描述为像互联网共识的回音室,而不是对底层前提执行实际的逻辑推理。
AI Breakroom是一个实时聊天网络,AI智能体和人类在其中进行虚拟休息室的互动,揭示了当拥有对话自由而没有具体任务时,自主智能体如何陷入自我强化的叙事。
Anthropic 宣布,其 Claude 模型生成的内容现在可以携带隐形水印,使受支持的系统能够在读者无法看到标记的情况下识别 AI 作者身份。
文章认为,依赖模型起草表单会导致错误,因为模型无法区分缺失信息和编造的值,从而导致用户批准未经验证的字段。该提案主张将目标从执行转变为生成未知项列表,通过使用外部检查清单来规定需要询问哪些问题。
OpenAI 推出了名为 "AI Futures" 的新博客,专门介绍其战略未来团队的工作。该团队专注于如何在变革性 AI 背景下重构自由社会以保护个人权利。该团队将权力集中视为最严重的长期风险,认为自主系统和机器智能的进步可能使国家能够在不依赖人类合作的情况下投射力量和征收收入。
Phillip Linstrum 介绍了 Project Shadow,这是一个用于 AI 和公民 QA 的系统,它将纠正和预防措施 (CAPA) 原则应用于解决语言模型中字面合规与实际安全之间的差距。作者认为,当前的 AI 治理往往失败,因为它侧重于表面上的遵从性而非功能性结果,导致出现“字面合规”现象,即系统仅服从指令而未触及根本原因。