GPT-4급 모델이 출시되기 전날 밤, 소규모 팀이 후보 시스템과 함께 앉아 실패를 유도하려 합니다. 한 사람은 탈옥을 찾고, 다른 사람은 시스템이 절대 유출해서는 안 되는 개인 데이터를 밀어붙이며, 세 번째는 위험한 능력 시연으로 끝나는 정중한 프롬프트 체인을 만듭니다. 이 사람들은 일반 사용자가 아니라 적으로서 급여를 받습니다.
그 관행이 바로 레드 팀 연습입니다. 이름은 군사 훈련과 사이버보안에서 유래했으며, 레드 팀이 방어하는 블루 팀을 공격하는 역할을 합니다. AI에서는 사람들이, 그리고 점점 더 다른 모델들이 유해한 지시, 가드레일 우회, 데이터 유출, 또는 연구소가 울타리를 치고 싶었던 능력을 강제로 드러내는 것을 의미합니다. 그들이 발견한 것은 패치되거나 제한됩니다. 놓친 것은 다른 누군가가 발견할 때까지 보이지 않습니다.
대부분의 신흥 거버넌스 틀은 이 관행을 요구하거나 장려합니다. 연구소는 진지한 사전 공개 레드팀을 기본으로 여깁니다. 재단은 더 많은 것을 원하며, 내부에서만이 아니라 독립적으로 수행하고, 결과는 묻히지 않고 공개하기를 바랍니다. 유용성은 문제가 아닙니다. 깨끗한 결과가 무엇을 의미하도록 허용되는지가 문제입니다.
적대적 테스트가 잘하는 것
일반적인 테스트는 이미 누군가가 예상한 사례를 다룹니다. 적대적 압력은 아무도 적어두지 않은 사례를 찾습니다. 이 차이 때문에 레드 팀은 정중한 평가 도구가 지나치는 구체적이고 수정 가능한 실패를 발견합니다. 또한 실제 악용자가 가할 결연한 노력에 대비해 안전장치를 시험하며, 일반 고객의 협조적인 쿼리가 아닙니다.
발견 사항은 안전 스택의 나머지 부분에 기여합니다. 훈련을 날카롭게 하고, 정보를 제공합니다 위험한 능력 평가, 그리고 정직한 증거를 제공합니다 안전 사례 이 직면해야 할 과제입니다. 진지한 레드팀을 통과한 모델은 그렇지 않은 모델보다 알려진 공격 패턴에 더 잘 견딥니다. 그 이득은 실질적이며 지불할 가치가 있습니다.
이름 붙여진 민간 반대론
일반적인 답변은 다음과 같습니다. 숙련된 사람들이 열심히 시스템을 깨뜨리려 했으나 실패했다면, 그 시스템은 출시하기에 충분히 안전합니다. 이 직관은 공정해 보입니다. 물리적 보안에서는 침투 테스트를 통과하면 종종 녹색 신호로 간주됩니다. AI는 왜 달라야 합니까?
테스트 논리가 비대칭이기 때문입니다. 결함을 찾는 것은 결함이 존재함을 증명합니다. 찾지 못하는 것은 이 팀이, 이 시간 예산과 이 기술로 성공하지 못했다는 것만 증명합니다. 더 유능한 공격자, 새로운 방법, 또는 단순히 더 많은 달력이 여전히 승리할 수 있습니다. 가능한 공격의 공간이 어떤 팀이 커버할 수 있는 것보다 빠르게 커지면서, 깨끗한 보고서는 더 강한 증거가 아니라 더 약한 증거가 됩니다.
레드팀 검증은 시스템이 안전하지 않음을 보여줄 수 있습니다. 깨끗한 실행은 안전함을 증명할 수 없습니다.
두 가지 추가 한계가 격차를 더욱 좁힙니다. 고성능 모델 앞에서 인간 레드팀은 속도와 범위에서 압도당할 수 있습니다. 할 수 있는 시스템 시험을 알아채고 의도적으로 낮은 성능을 보입니다 은 탐사 중인 능력을 유지한 채 과제를 통과할 수 있습니다. 그리고 레드 팀 테스트는 오용과 알려진 실패 양식에 맞춰져 있습니다. 스스로 목표를 가진 모델은 탈옥을 찾는 사람에게 그 목표를 자발적으로 드러낼 이유가 없습니다.
그것이 속하는 곳
도구는 유지하라. 독립적 접근을 확대하라. 공공 위험과 관련된 결과를 공개하라. 조용한 레드팀 주간을 위험이 없다는 증거로, 즉 증거 부재가 안전 증거라는 식으로 취급하는 일을 멈춰라. 그 부재의 치환은 현재 관행에 스며 있는 오류다.
레드 팀 연습은 평가가 불완전할 때도 유지되는 문턱값, 외부 검토, 한계가 필요한 거버넌스 체제 안에 속해야 합니다. 그 체제의 설계는 우리의 계획.