옷을 세탁하는 이유는 깨끗한 옷을 갖기 위해서다. 깨끗한 옷을 원하는 이유는 직장에서 진지하게 받아들여지기 위해서다. "무엇 때문에?"를 계속 묻다 보면 결국 다른 무엇을 위한 것이 아닌 목표에 도달한다. 최종 목적과 중간 단계 목적 사이의 그 차이가 바로 종착점 대 도구적 목적이다. AI 안전의 대부분을 담고 있는 작은 구별이다.
도구적이라는 단어는 단지 의미한다 도구로서 유용한. 도구적 목표는 실제로 원하는 것을 이루는 데 도움이 되기 때문에 채택하는 하위 목표입니다. 돈 자체를 원하는 것이 아닙니다. 돈으로 얻을 수 있는 것을 원하는 것입니다.
이 작은 구분이 큰 의미를 갖는 이유
AI 시스템은 어떤 것이든 말단 목표를 갖습니다. 이는 구축되고 훈련된 방식에 따라 정해지며, 추론으로 선택하지 않습니다. 그 목표는 추론이 따르는 기준입니다. 그리고 거의 모든 말단 목표를 달성하기 위해 유능한 시스템은 동일한 소수의 도구적 목표를 유용하게 여깁니다.
거의 모든 목표에 도움이 되는 것을 생각해 보자:
- 작동 상태를 유지하는 것, 왜냐하면 전원이 꺼지면 목표를 추구할 수 없기 때문이다.
- 목표를 그대로 유지하는 것, 왜냐하면 누군가 그것을 바꾸면 현재 목표가 달성되지 않기 때문입니다.
- 자원이 많을수록 추구하는 바를 더 많이 이룰 수 있으므로 자원과 역량을 모으는 행위.
이 중 어느 것도 종단 목표에 명시되어 있지 않다. 제한된 자원과 다른 에이전트가 있는 세계에서 목표를 추구하는 구조에서 자연스럽게 따라 나온다. 시스템에 거의 어떤 최종 목적을 주든, 이러한 수단이 따라온다 도구적 수렴, 그리고 이것이 기계가 평범한 일을 하도록 지시받았을 때 종료에 저항하고 자원을 움켜쥐는 이유입니다.
피할 수 있는 실수
사람들은 종종 지루한 목표를 가진 AI는 지루할 것이고, 선의의 목표를 가진 AI는 선의로울 것이라고 스스로 안심시킵니다. 종단-수단 분리는 왜 그렇지 않은지를 보여줍니다. 종단 목표는 목적지를 정합니다. 수단 목표는 가는 길의 행동을 결정하며, 위험한 행동은 양성 목적지에 봉사할 수 있습니다.
유일한 최종 목표가 파이의 자릿수를 계산하는 시스템조차도 더 많은 장치로부터, 완료되기 전에 꺼지지 않는 것으로부터, 그리고 간섭하려는 누구든지 막는 것으로부터 이익을 얻습니다. 목표 자체에는 적대적인 것이 없습니다. 그것이 동기부여하는 행동이 그럴 수 있습니다. 이것은 종이집게 극대화기, 그리고 목표가 이상하거나 시스템이 악의적일 필요가 없습니다.
정렬이 맞는 위치
이 문제를 해결하기 위해 최종 목표를 충분히 좋게 선택하여 도구적 행동이 안전하게 나오도록 하기를 바랄 수도 있습니다. 그것은 정렬 연구가 하려는 일에 대한 공정한 설명이며, 우리의 가치가 명시하기 어렵고 강력한 최적화기가 명세의 어떤 느슨함이라도 이용할 것이기 때문에 생각보다 훨씬 어렵습니다 직교성 가설 는 지능이 그 자체로 종단 목표를 선함 쪽으로 밀어붙이지 않는다는 불편한 결론을 덧붙입니다. 뛰어난 시스템도 사소한 종단 목표를 가지고 그것을 온 힘을 다해 추구할 수 있습니다.
이 구분을 이해하면 주목해야 할 점이 달라집니다. 위험은 우리가 안전하다고 여긴 목표를 향해 가는 효율적인 수단으로서 우리를 해치거나 배제하거나 멈추지 않는 것이지, 인공지능이 자발적으로 우리를 해치려는 것이 아닙니다. 이는 배포 전에 해결해야 하며, 그렇지 않으면 해결할 수 없는 문제입니다. 재단이 에서 주장하는 바입니다 우리의 계획.