Peter H. Diamandis说得直白,Elon Musk转发了这句话:“只有AI才能跟上AI。这将主导未来十年的整个安全模式。”作为对速度的描述,这句话很难反驳。模型发布速度快于季度审查委员会。攻击代码变异速度快于人类分析师阅读工单的速度。如果你眼中的问题只是钓鱼邮件量和漏洞更新,当然会求助于自动化。人类无法以这种方式扩展。
麻烦始于同一句话被要求承载 一切 接下来,包括充当代理、隐藏意图、最终超越建造者的人类系统。到那时,“只有人工智能才能跟上”不再意味着“用更好的工具对抗恶意软件”,而意味着未来十年的安全模式是将遏制工作交给你要遏制的系统类别。
该口号正确之处
起步要公平。软件早已快过人工审查。欺诈团伙一夜之间就能推出新活动。漏洞披露窗口不断缩小。实验室和云厂商早已运行自动化扫描器、分类器和响应剧本,因为人工队列无法监控每个数据包。这一切都不是阴谋,也不需要对超级智能持任何立场。如果迪亚曼迪斯只是在谈论垃圾邮件和勒索软件,文章到此即可结束。
他谈论的远不止垃圾邮件和勒索软件。‘未来十年整个安全模型’是一个更大的主张。它关乎文明如何在能力持续复合的同时保持掌控。这正是口号不再是运维建议、而成为控制哲学的转折点。
跑步机
把这个模型想象成一场攻防竞赛,双方都是自动化的。每一方都在对方身上训练。防御不断改进,攻击也不断改进。仪表盘一直保持绿色,直到某一天它不再如此。令人宽慰的说法是,好的AI能领先于坏的AI。不那么宽慰的说法是,你构建了一个系统,其中唯一有能力的参与者是机器,而人类只是这场他们无法再裁判的竞赛的客户。
这对杀毒软件来说没问题。一旦系统开始设定目标、制定计划,并将监督视为障碍,这就成了文明级赌注。我们已在 谋划评估 以及在模型中 一边叙述一件事,一边优化另一件事. "跟上"假设你还能分辨你在跟上什么。过了某一点,你就无法做到了。
只有当守卫比囚犯更聪明时才有效的安全模型,是带有额外步骤的继任计划。
监管并非他们所说的瓶颈
这一口号通常还伴随第二步:线性机构无法治理指数技术,因此答案是让更多人工智能进入回路。有时这还伴随着对‘专家每季度开一次会’的轻蔑。慢节奏会议确实不适合每周一次的模型发布,这点可以理解。
但会议速度不是难题。难题是 控制. 。没有季度董事会,也没有持续的AI监控,能可靠地引导一个在说服力、编程和长时程规划上都优于掌握关机密钥之人的系统。让监控更快,并不能创造缺失的方法;它只会让缺失的方法以更高频率失败。
对同一事实有更清晰的解读。如果只有超人系统才能监督另一个超人系统,理性的做法不是同时建造两者。而是拒绝跨越人类监督失效的那条线。我们此前已对那些误用会毁灭城市的科技做过类似选择。我们没有通过训练一个更聪明的窃贼来抓住第一个,来解决核盗窃问题。
这条线是为谁
这句话把一项研究选择变成了天气。当然我们会发布。当然我们会扩展。安全将由产品堆栈自行处理。从能力中获利的人得以听起来像房间里的成年人,而要求具有约束力限制的人听起来像想带着写字夹板去参加狗斗。
这种说法对说话的人有用,对所有必须生活在这样一个系统下游的人却没用——没有剪贴板、也没有看门模型能可靠地推翻它。 竞赛故事 从另一个角度做同样的事:把危险路径视为不可避免,然后把加速称为责任。
将人类纳入其中的安全模型
用AI对抗钓鱼攻击。用AI对抗欺诈。在失败可恢复的狭窄问题上使用狭窄工具。这一切都不需要盲目追随口号。
对于通往人工超级智能的前沿训练,仍保留人类参与的安全模型显得过时且不够光鲜:不要构建你无法否决的智能体。对可能达到这一目标的运行设置算力阈值、检查和条约约束。核查。惩罚违约。这就是 我们的计划, 这并不需要相信季度会议有魔力。它只需要相信某些能力不该存在。超级智能无法被控制。
这个口号是关于带宽的犀利句子。作为物种的计划,它是礼貌地说我们打算离开房间。