군비 통제 조약은 정의에서 시작한다. 화학무기금지협약은 전쟁 수단으로 사용되는 독성 화학물질 또는 그 전구물질을 화학무기로 정의한다. 핵확산금지조약은 1967년 1월 1일 이전에 핵무기를 제조·폭발시킨 국가를 핵보유국으로 정의한다. 전략무기제한협상은 탄도미사일을 사거리와 탑재량으로 정의했다. 이 정의들은 정치적으로 중립적이지 않았다. 각각 누가 적용 대상인지, 어떤 활동이 제약되는지, 당사국들의 이해관계가 어떻게 균형을 이루는지를 반영한 전략적 선택이었다.
그 질문들은 겉보기보다 어렵고, 어떻게 답하느냐에 따라 결과로 나온 조약이 실제로 규제하려는 대상을 규제할 수 있을지가 결정됩니다.
ASI 거버넌스는 군비 통제에서 가까운 전례가 없는 여러 특징과 함께 정의 문제를 안고 있습니다. 이 특징들을 이해하는 것이 실제로 통제하려는 대상을 통제할 수 있는 정의를 설계하기 위한 전제 조건입니다.
위험한 AI를 정의하는 세 가지 접근법
현재 거버넌스 프레임워크는 어떤 AI 시스템이 적용 범위에 들어가는지를 정의하기 위해 세 가지 접근 방식을 사용해 왔습니다. 각 접근 방식에는 조약 수준의 프레임워크가 다루어야 할 강점과 한계가 있습니다.
컴퓨트 임계값은 모델 훈련에 사용된 컴퓨팅 자원으로 위험한 AI를 정의하며, 부동소수점 연산 수, 즉 FLOPs로 측정한다. EU AI 법은 최첨단 AI 모델을 10의 25제곱 FLOPs를 초과해 훈련된 것으로 정의한다. 2023년 10월에 발표된 US AI 행정명령은 10의 26제곱 FLOPs를 초과해 훈련된 모델에 대해 연방 정부에 보고를 요구했다. 서울에서 서명된 최첨단 AI 안전 서약은 최첨단 능력에 도달하거나 접근하는 모델에 적용되며, 컴퓨트를 최첨단 지위의 대리로 사용한다.
연산 임계값은 조약 설계에 두 가지 중요한 이점을 제공한다. 첫째, 연산은 관찰 가능하다. 대형 AI 모델 훈련에 필요한 하드웨어, 소수 제조사가 생산하는 특수 칩은 독특한 에너지 소비 패턴을 보이며 측정 가능한 열을 발생시킨다. 이 칩의 공급망은 좁고 모니터링이 용이한 관할권을 통과한다. 둘째, 연산은 능력 주장보다 위조하기 어렵다. 하드웨어 생산과 훈련 실행은 대규모로 은폐하기 어려운 관찰 가능한 신호를 생성하기 때문이다.
컴퓨트 임계값의 한계는 알고리즘이 개선됨에 따라 구식이 된다는 점이다. 오늘날 10의 26제곱 FLOPs로 훈련된 모델은 5년 전 동일한 컴퓨트로 훈련된 모델과 실질적으로 다른 능력을 갖는다. 알고리즘 개선이 단위 컴퓨트당 더 강력한 모델을 생산하기 때문이다. 오늘 설정된 컴퓨트 임계값은 효율적인 알고리즘이 임계값 이하에서 강력한 모델을 생산하므로 너무 제한적이거나, 최전선이 그 이상으로 나아가므로 너무 관대할 것이다.
능력 기반 정의는 시스템이 어떻게 훈련됐는지가 아니라 무엇을 할 수 있는지로 위험한 인공지능을 정의합니다. 정의된 심각도 임계값을 초과해 사이버보안 취약점을 자율적으로 식별하고 악용할 수 있는 시스템은, 그것을 만드는 데 사용된 연산량과 무관하게 능력 기반 정의에서 위험합니다. 생물무기 합성에 의미 있는 도움을 줄 수 있는 수준 이상의 구체성을 제공할 수 있는 시스템은, 그 훈련 연산량과 무관하게 위험합니다.
능력 기반 정의는 방지하려는 피해를 더 정확하게 겨냥하지만, 상당한 측정 문제를 일으킨다. 능력 평가는 표준화되어 있지 않다. 서로 다른 평가 방법론은 서로 다른 결과를 낸다. frontier AI 개발사는 현재 독점 방법론을 사용해 능력 평가를 수행하며, 이는 공개적으로 감사되지 않는다. 거버넌스 조약의 능력 기반 정의는 모든 주요 AI 개발국이 수용할 수 있는 형태로 아직 존재하지 않는 표준화되고 독립적으로 검증 가능한 능력 평가 방법을 요구할 것이다.
화학무기금지협약은 알려진 위험 물질과 알려지지 않은 위험 물질을 모두 포괄하기 위해 일반 목적 기준과 화학물질 목록을 결합했다. 일반 목적 기준은 독성 화학물질이 전쟁 수단으로 사용되는 경우 목록에 포함되었는지와 무관하게 화학무기로 정의한다. 목록은 특정 화학물질에 대한 단계적 검증 요건을 설정한다. 이 다층 접근 방식은 협상 당시 알려지지 않았던 작용제까지 포괄할 수 있게 했다. ASI 거버넌스도 유사한 구조를 사용할 수 있다. 효과의 성격으로 위험한 AI를 정의하는 일반 목적 기준과 알려진 위험 적용에 대한 능력 목록을 결합하는 것이다.
영역 기반 정의는 위험한 AI를 훈련 연산이나 일반 능력이 아니라 배치되는 분야로 정의한다. 군사 맥락에서 자율 치명적 의사결정을 위해 배치된 시스템은 위험하다. 중요 인프라 통제를 위해 배치된 시스템은 위험하다. 민주 선거를 겨냥한 대규모 설득을 위해 배치된 시스템은 위험하다.
영역 기반 정의는 거버넌스 의무를 방지하려는 피해에 명확히 연결하는 장점이 있다. 또한 일반적 능력 정의보다 정치적으로 해결 가능하다. 국가는 AI 프로그램 전반이 국제 감독 대상이라는 원칙을 양보하지 않고도 특정 고위험 영역의 AI에 대한 제약을 수용할 수 있기 때문이다. 중요한 한계는 영역 기반 정의가 정의된 영역 밖에 배포되는 경우 고성능 시스템이 거버넌스 의무 없이 작동하도록 허용한다는 점이며, 동일한 시스템이 쉽게 위험한 용도로 전환될 수 있더라도 그렇다.
이동하는 경계 문제
군비 통제 정의는 보통 안정된 기술을 대상으로 작성된다. 탄도미사일의 사거리와 위력, 규제 화학물질의 독성, 핵무기에 필요한 핵분열 물질 질량 등이다. 이들은 조약 기간 동안 크게 변하지 않는다. 인공지능 능력은 빠르게 발전하므로, 오늘 충분한 정의가 몇 년 안에 쓸모없어질 수 있다.
이것은 이동하는 경계 문제로 불릴 수 있다. 기술이 발전함에 따라 조약 정의를 끊임없는 재협상 없이도 관련 있게 유지하는 방법을 쓰는 문제다. 군비 통제에서 유사한 문제를 해결하기 위해 세 가지 메커니즘이 사용되어 왔다.
위임된 정의 권한: 조약은 당사국 회의의 승인을 전제로 정해진 범위 내에서 기술적 정의를 갱신할 권한을 가진 기구를 설립합니다. 화학무기금지기구는 이 방식을 자사 목록 화학물질에 적용하며, 기본 조약을 다시 열지 않고도 당사국 회의를 통해 수정할 수 있습니다. 이는 완전한 조약 재협상보다 빠르지만, 당사국들이 정의 권한을 기구에 맡길 신뢰가 필요합니다.
기술 중립적 정의: 조약은 특정 기술 매개변수가 아니라 효과의 성격으로 위험한 AI를 정의한다. 정의된 문턱 이상의 대량 사상자를 일으킬 수 있는 AI 시스템, 또는 중요 국가 인프라를 위협할 만큼 결과가 중대한 자율 행동을 할 수 있는 시스템을 포괄하는 정의는 기술이 변해도 여전히 관련성을 유지할 것이다. 왜냐하면 입력이 아니라 결과를 설명하기 때문이다. 한계는 결과 기반 정의가 검증하기 더 어렵다는 점인데, 관련 테스트는 시스템이 실제로 하는 것이 아니라 할 수 있는 것이다.
일몰 및 갱신 조항: 조약 정의는 정기 검토 주기를 두고 재평가·갱신되도록 작성됩니다. 조약은 초기 정의와 함께 발효되고, 검토 기간 동안 운영되며, 각 검토 회의에서 갱신됩니다. 이는 NPT가 정기 검토 회의에 사용하는 방식이지만, NPT의 핵보유국 정의는 P5의 특권 유지 이해관계 때문에 이 메커니즘으로 갱신이 불가능하다는 것이 드러났습니다.
전략적 이익 차원
정의 협상은 순전히 기술적 연습이 아닙니다. 각 정의 선택은 어느 국가가 가장 큰 준수 비용을 부담하고 어느 국가가 가장 큰 행동의 자유를 유지할지에 대한 전략적 함의를 가집니다. 이 함의는 협상 정부에 보이며 정의 문제에 대한 입장을 형성합니다.
더 능력 있는 AI 프로그램을 보유한 국가는 경쟁국에 낮은 수준에서도 동일한 제약을 부과하는 광범위한 정의를 선호한다. 가장 앞선 프로그램의 현재 최전선보다 높은 컴퓨트 기준은 선도국에는 아무런 제약이 되지 않으면서 다른 모든 국가가 그 기준 아래로 영구히 머무르도록 요구한다. 덜 발전한 프로그램을 가진 국가는 현재 최전선 수준까지 도달한 뒤에 거버넌스 의무가 적용되도록 하는 좁은 정의를 선호하며, 선도국이 먼저 개발한 frontier AI에 비해 영구적으로 불리해지는 정의에 반대한다.
"정의 협상은 ASI 거버넌스 조약의 실제 작업 대부분이 이루어지는 곳입니다. 정치적으로 달성 가능하지만 기술적으로 부적절한 정의는 실제 위험과 다른 것을 규제하는 조약을 만듭니다. 기술적으로 적절하지만 정치적으로 달성 불가능한 정의는 조약 자체를 만들지 못합니다. 이 문제를 통과하는 유일한 길은 공유된 기술적 증거를 통하는 것이며, 그래서 인공지능 안전 연구소가 대부분의 사람들이 생각하는 것보다 더 중요합니다."
이 전략적 차원이 바로 UK AI 보안 연구소와 US AI 표준 및 혁신 센터(둘 다 AI 안전 연구소로 설립됨)가 수행하는 실증 작업이 조약 협상에 기초가 되는 이유입니다. 비록 이 기구들이 조약 준비를 염두에 두고 설계되지는 않았지만 말입니다. 다양한 능력 수준의 AI 시스템이 무엇을 할 수 있고 할 수 없는지, 어떤 능력이 어떤 위험과 상관관계가 있는지에 대한 공유 증거를 생산함으로써 전략적 이해관계가 단순히 무시하기 어려운 정의 협상을 위한 사실 기반을 만듭니다. 사실에 대한 합의가 자동으로 정의에 대한 합의를 만들어내지는 않지만, 불일치의 성격을 순전히 전략적인 것에서 부분적으로 기술적인 것으로 바꾸며, 공유 증거가 모든 당사자의 협상 입장을 규율합니다.
정의 작업은 협상이 시작되기 전에 시작되어야 한다. 군비통제 협상이 정의에 대한 기존 기술적 합의 없이 시작되면, 협상가들은 거버넌스 목표의 기술적 요건이 아니라 정치적 합의의 최소공배수를 반영하는 정의를 만들어내는 경향이 있다. 사전에 더 많은 기술적 작업이 이루어질수록, 협상가들이 실제로 통제하려는 대상을 제대로 통제하는 정의를 세울 수 있는 기반이 강해진다.
가장 강력한 반발
가장 공정한 반론은 정의가 작성되는 날부터 악용될 것이라는 점입니다. 맞습니다. 그래서 정의에는 정적 용어집이 아니라 갱신 권한, 능력 검사, 연산 트리거가 필요합니다. 악용은 설계 입력입니다. 최전선을 라벨링하지 않을 이유가 아닙니다.