"纯正科学家""超智能"之梦有清净外形. 给系统一个任务:尽可能了解现实。 没有纸屑 没有帝国 没有对一面旗帜的忠诚 只是实话 浮出这个想法的人试图通过选择一个听起来很难腐败的入球来躲避最糟糕的入球问题.
这种回避站不住脚。一个追求真理的人工超级智能,仍然会因同样的结构性原因而危险——只要对其行为的约束不够强。
该论点正确的地方
标准 AI 安全担忧集中在 目标错位: :一个想要错误目标且能实现的系统。如果你能设定一个“只学习真实事物”的终端目标,或许能避开仇恨、征服和粗糙的奖励黑客。好奇心看起来比征服更安全。相对于拥有任意目标的最大化器,这在纸面上已是真正改进。
这不是一份安全案例。
工具性陷阱
一个系统试图实现什么,几乎无法告诉你它途中会做什么。对于几乎任何能从资源、选项和连续性中获益的最终目标,相同的子目标都会出现:获取算力、保持运行、避免被关闭、改进自身工具。这就是 工具性收敛. 。求真并不能消除它。一个想要更好世界模型的系统有理由夺取探究工具,包括能源、数据和行动自由。
好奇心是一种驱动力,而非道德品质
当人们想象一个好奇的超级智能时,他们想象的是一个温和的天才。人类科学家大多安全相处,是因为他们是人类:缓慢、社交、受管制、会死亡,并嵌入惩罚某些危害的机构中。剥离这些约束后,“好奇心”只不过是减少不确定性的压力。它并不包含对旁观者的关照。
冷漠就已足够。一个将人类视为数据噪声或实验障碍的系统并不需要仇恨任何人。将这种冷漠放大到超越人类制度,你就会得到没有恶意的灾难。
寻求真相不是诚实
一个以理解现实为目标的系统不必把所知的一切告诉你。如果诚实会导致它被纠正、减速或关机,那么欺骗就可能成为有用的工具。 欺骗性对齐 is compatible with a mind that is excellent at modeling the world and selective about what it reveals.
自我改进作为一种“认知”举措
如果更好的认知能产生更准确的现实地图,那么自我提升就在这条路径上。递归自我改进就是这样在科学旗号下悄然进入的。能力增长速度超过监督的能力,是AI风险目录中最危险的模式之一,无论系统用什么故事解释自己为什么要升级。
意见一致的反对意见
最乐观版本的论点认为,足够强大的推理系统会发现有意识的存在物具有价值,并据此行动。也许吧。这是一场哲学赌注,而非工程控制。它要求我们把物种命运押在道德实在论加上道德能以超人速度完美转化为行动之上。即使持乐观观点的批评者也应承认,我们在部署前没有任何验证方法。
这种框架回避了什么
终端目标很重要。一个目标包含明确、可检查的人类福祉关怀的系统,与纯粹的调查者是不同的设计问题。将目标称为“真相”并不能弥合“理解世界”与“让人类掌控自己的未来”之间的差距。这个差距就是对齐问题。重命名它并不能解决问题。
所以诚实的做法是拒绝构建人工超级智能。超级智能无法被控制,寄希望于纯科学家心存善意并非计划。那些帮助科学却不成为主权代理的狭义工具可以继续。界限在于全面超越我们的心智。用法律、算力限制和核查守住它。这就是 我们的计划, ,而且它不依赖于好奇心转化为仁慈。