AI 안전 논의는 종종 멀리 떨어진 시나리오, 즉 아직 도달하지 않은 능력 문턱에서의 배신적 전환과 정렬되지 않은 목표를 가진 초지능 시스템에 집중한다. AI 설득 위험은 다르다. 위협의 기본 형태는 오늘날 이용 가능한 시스템에 이미 존재하며, 지금 당장 선거와 공공 담론에 영향을 미친다. 더 위험한 장기 버전은 빠르게 발전하는 기술의 외삽이며, 순전히 가설적인 미래가 아니다.
개인의 심리를 초인간적 정밀도로 모델링하고 이용할 수 있는 장기적 버전이 기술이 향하는 방향입니다.
우려는 AI가 선전물을 작성하기 쉽게 만든다는 점만이 아닙니다. 이전 기술들도 이미 그랬습니다. 우려는 AI가 질적으로 다른 것을 가능하게 한다는 점입니다. 개인의 심리 프로필에 맞춰 실시간으로 응답에 따라 업데이트되는 고도로 개인화된 설득 메시지를 대규모로 생성하는 것입니다. 개인화, 규모, 낮은 한계 비용의 조합은 이전 어떤 도구도 따라올 수 없는 영향력 능력을 만듭니다.
AI 설득이 다른 점은 무엇인가
전통적인 영향력 작전(방송 광고, 정치 메시지, 국가 선전)은 많은 사람에게 동일한 메시지를 전달한다. 메시지는 신중하게 제작되고 광범위하게 테스트될 수 있지만, 서로 다른 청중 사이의 타협일 수밖에 없다. 숙련된 인간 설득자는 대화 상대에 맞춰 접근 방식을 조정할 수 있지만, 제한된 수의 사람과만 대화할 수 있다. 이 두 가지 능력(방송 규모와 개인 맞춤화)은 역사적으로 긴장 관계에 있었다.
인공지능은 이 긴장을 해소한다. 개인 데이터(검색 기록, 소셜 미디어, 이전 응답)에 접근할 수 있고 다양한 설득 콘텐츠를 생성할 수 있는 시스템은 수백만 명에게 동시에 도달하면서도 각 상호작용을 특정 개인에 맞춰 조정할 수 있다. 또 다른 개인화된 설득 메시지를 생성하는 한계 비용은 거의 0에 가까워진다. 시스템은 어떤 접근이 효과가 있고 없는지를 실시간으로 파악해 반복할 수 있으며, 이는 어떤 인간 영향력 작전도 따라올 수 없는 규모이다.
비대칭 문제
AI 설득력은 매우 집중되어 있습니다. 설득에 최적화된 AI를 대규모로 배치하려면 상당한 자원, 데이터, 컴퓨트, 엔지니어링 능력, 배포 채널 접근이 필요합니다. 이러한 요구사항은 대기업, 국가, 부유한 개인 등 자원이 풍부한 행위자에게 유리합니다. 표적이 되는 사람들은 이에 상응하는 대응 능력이 없습니다. 결국 AI 도구로 접하는 내용을 평가하는 데 도움을 받을 수는 있겠지만, 공격과 방어의 비대칭은 단기적으로 공격자에게 유리합니다.
과거에는 필사실이 가득한 창고가 필요했던 캠페인이 이제는 점심 전에 메시지 변형을 수천 개씩 작성할 수 있으며, 각 변형은 유권자 집단의 특정 부분에 맞춰 조정됩니다. 이는 이미 존재하는 제품 범주이지, 먼 미래의 스케치가 아닙니다. 그 해상도에서의 설득은 신과 같은 모델이 만들어지기 전에 나타나는 AI 위험이 됩니다.
이것은 구조적 문제이지, 특정 허위정보 조각에 관한 문제가 아니다. AI 기반 영향력 작전의 개별 주장이 모두 기술적으로 사실이라고 해도, 심리적 취약점을 대규모로 체계적으로 공략하는 것은 민주적 숙의가 의존하는 인식론적 환경을 왜곡한다. 영향력 작전의 목표는 운영자의 이익에 부합하는 방식으로 사람들의 이슈, 후보, 기관에 대한 감정을 형성하는 것이지, 반드시 속이는 것이 아니다.
단기 증거
2023년 이후 여러 국가의 총선에서 AI 생성 영향력 콘텐츠가 문서화되었다. AI로 합성 미디어를 생성하고, 실제 공인들의 인용을 조작하며, 대규모 인간 운영자 팀이 필요할 규모의 고용량 협조 게시물을 생산하는 영향력 작전이 독립 연구자와 플랫폼 보안 팀에 의해 확인되고 보고되었다. AI 생성 콘텐츠가 개선되면서 작전은 탐지하기 어려워졌고, 탐지 도구는 생성 도구를 따라가지 못하고 있다.
위험은 현재 기술 환경에 존재하며 실제 정치 과정에 영향을 미치고 있으며, 궤도는 가설이 아니라 더 강력하고 탐지하기 어려운 설득 도구로 향하고 있습니다. 문제는 이를 실질적 위험으로 다룰지 여부가 아니라, 비례적이고 효과적인 거버넌스 대응이 무엇인가입니다.
장기적 격화
현재 AI 설득 도구는 효과적이지만 근본 수준에서 설득에 최적화되어 있지는 않습니다. 개인 심리 모델이 더 정교하고, 개인에 대한 더 상세한 데이터를 보유하며, 장기 관계 시뮬레이션 능력이 더 큰 미래 시스템은 상당히 더 효과적일 수 있습니다. 개인의 신념, 우려, 심리적 취약점을 지속적으로 모델링하고 수주 또는 수개월에 걸쳐 상호작용할 수 있는 시스템은 현재 도구가 달성하는 것보다 훨씬 큰 효과를 낼 수 있습니다.
이것이 초지능 스펙트럼 끝에서 인공지능 설득 위험이 취하는 형태입니다: 단순한 대량 허위정보가 아니라, 현재 어떤 도구보다 훨씬 나은 인간 심리 모델을 가진 시스템에 의한 개인 맞춤형 장기 인식 조작입니다 단일체 시나리오 그리고 가치 고정 는 직설적입니다. 고도로 효과적인 AI 설득 도구를 가진 행위자는 이를 ASI 거버넌스에 대한 여론을 조작하는 데 사용할 수 있으며, 이는 민주적 기관이 그 행위자의 권력을 제한할 제약을 부과하기 어렵게 만듭니다.