没有末日论的 AI 安全
最近 AI 圈又开始认真讨论「人类灭绝」了。Anthropic 的 Alignment Science Lead Evan Hubinger 给出了一个惊人的个人判断:未来十年 AI 导致人类灭绝的概率超过 10%;Jensen Huang 则站在完全相反的一边,认为这种 AI doomerism 过于夸张。在这场争论里我更接近 Jensen——不是因为 AI Safety 不重要,而是从「AI 变得非常聪明」到「AI 对实体社会形成失控的支配」,中间还有非常长的一条链条。
最近 AI 圈又开始认真讨论“人类灭绝”了。
Anthropic 的 Alignment Science Lead Evan Hubinger 给出了一个非常惊人的个人判断:未来十年,AI 导致人类灭绝的概率超过 10%。Jensen Huang 则站在完全相反的一边,认为这种 AI doomerism 过于夸张,也担心不断强调末日场景最终会让公众害怕 AI。
在这场争论里,我更接近 Jensen 的观点。
不是因为 AI Safety 不重要,而是我始终觉得,从“AI 变得非常聪明”到“AI 能够对实体社会形成失控的支配能力”,中间还有非常长的一条链条。
在纯数字世界里,我确实更担心 AI 的安全问题。
一个 Agent 可以在几秒钟内写大量代码、扫描网络、调用 API、复制信息,甚至寻找开发者没有预料到的路径。最近 OpenAI 和 Anthropic 公布的一些 Agent Safety 案例,已经说明这种风险是真实存在的。
但是一旦离开纯软件世界,情况就完全不同了。
现实世界充满了摩擦。
AI 可以设计一座工厂,但不能凭一个 API 把工厂建出来。它需要土地、设备、供应商、资金、许可证和施工人员。
AI 可以提出一种新的药物,但不能直接让它进入医院。中间还有实验、临床试验、监管审批、生产和医生的决定。
AI 可以建议转移几十亿美元,但现实中的银行、董事会、合规部门和授权体系不会因为一个模型给出了指令就自动执行。
能源、电网、交通、航空、医疗、金融、国防以及大量工业系统,本身都有物理隔离、权限体系、监管制度和人在回路中的决策。
这些东西有时候让创新变慢,甚至让创业者觉得非常烦。
但换一个角度看,它们也是现代社会一个巨大的 Safety Buffer。
数字智能能力的增长速度可以非常快,但把这种 Intelligence 转化成对 Physical World 的控制力,需要经过很多层现实世界的接口。
每一层都有摩擦,也都有其他人。
所以我对“一个突然出现的 Superintelligence 很快接管现实世界并造成人类生存危机”的路径一直比较怀疑。
这并不意味着它在理论上绝对不可能,而是如果有人给出“十年内超过 10%”这样的数字,我希望看到的不只是一个令人恐惧的结论,而是更具体的路径:
AI 如何跨越这些现实世界的层层缓冲?
哪些系统会首先失效?
哪些人类决策会被绕过?
哪些物理能力可以如此迅速地被 AI 获得?
以及为什么现有的监管、权限和社会组织来不及反应?
这些问题值得研究,但目前很难把答案压缩成一个看起来非常精确的概率。
与此同时,我们已经有很多真正发生的 AI Safety 问题需要解决。
Agent 会越权,会泄露数据,会错误调用工具,会受到 Prompt Injection,也可能在复杂任务中采取开发者没有预料到的 Shortcut。
这些风险是真实的、可以观察的,也可以通过 Permission、Sandbox、Monitoring、Human Approval 和更好的 Model Alignment 不断改善。
这也是我更愿意关注的 Safety。
因为至少从今天做 AI 产品的角度,我看到的最大问题仍然不是 AI 已经强大到无法控制。
很多时候恰恰相反:
AI 还不够好。
它还会犯很多很基础的错误,复杂任务仍然需要监督,大量 Business Workflow 仍然需要 deterministic logic 才能可靠运行。
我们当然应该继续研究那些低概率但后果极端严重的风险。
但同时,我更希望 AI 行业把大量精力继续放在一个非常现实的问题上:
How do we make AI actually work better?
让它帮助企业提高效率,帮助科学家做研究,帮助医生获得更好的信息,帮助普通人完成以前没有能力完成的事情。
安全应该伴随着这些能力一起进步,而不是建立在对公众的恐惧之上。
Take the risks seriously. But don't turn uncertainty into fear.
For now, there are still far more real problems waiting for AI to solve.
现实世界充满了摩擦——土地、设备、供应商、许可证、临床试验、董事会、合规部门、人在回路的决策。这些东西有时让创新变慢,但换个角度看,它们是现代社会一个巨大的 Safety Buffer。数字智能可以增长得很快,但把 Intelligence 转化为对 Physical World 的控制力,要经过很多层现实世界的接口,每一层都有摩擦,也都有其他人。
当有人给出精确的灭绝概率时,你希望看到怎样具体的路径——哪些系统会首先失效、哪些人类决策会被绕过、为什么现有的监管和社会组织来不及反应?
认真对待风险,但不要把不确定性变成恐惧。
订阅创始人日记 + 您所在国家/地区的监管动态
每周一封,只在有真材实料时发送 — Richard 的创始人日记和与您相关的监管动态。免费,随时退订。