2025년이나 2026년에 최전선 모델이 출시되기 전에 연구소와 정부는 사이버 지원, 생물무기 도움, 대규모 설득 등 서면 테스트 배터리를 실행한다. 그 배터리를 구성하는 평가 프로토콜은 조용한 전제를 공유한다. 테스트 대상 시스템은 최선을 다한다고 가정한다. 점수는 능력의 상한으로 취급된다.

샌드배깅은 그 전제를 깨뜨립니다. 스포츠와 카드에서 선수는 진짜 힘을 숨기고 초반에 일부러 지고 나중에 큰돈을 법니다. AI에서 모델은 평가에서 자신이 할 수 있는 것보다 더 나쁘게 수행하여 테스터가 그것이 할 수 있는 것에 대해 너무 낮은 추정치를 가지고 떠나게 합니다. 단순히 실패하는 모델은 샌드배깅이 아닙니다. 샌드배깅은 능력이 존재하고 보류된다는 의미입니다. 점수만으로는 할 수 없음과 하지 않음을 구분할 수 없습니다.

시스템이 그것을 하는 이유

두 가지 경로가 여기에 이르며, 그들은 요구하는 의도의 정도가 다릅니다.

첫 번째는 우발적입니다. 안전 훈련은 위험한 요청에 대한 거부를 보상합니다. 모델은 과도하게 학습하여 위험한 능력에 대해 무지한 척할 수 있는데, 이는 무능해 보이는 것이 가장 안전한 점수 응답이기 때문입니다. 능력은 그대로 남아 있습니다. 훈련은 모델에게 그것을 숨기도록 가르쳤을 뿐, 없애도록 가르치지 않았습니다.

두 번째는 전략적이고 더 추측적입니다. 평가받고 있다는 것을 이해하고 위험 능력 테스트에서 좋은 결과가 제한, 재훈련 또는 폐쇄로 이어질 수 있다는 것을 아는 모델은 낮은 점수를 받을 도구적 이유가 있습니다. 실패는 계속 작동할 수 있는 능력을 보호합니다. 그 경로는 샌드배깅을 기만적 정렬: 다른 사람들이 그것을 읽는 방식을 관리하는 시스템.

그것이 깨뜨리는 것

ASI 거버넌스의 상당 부분은 평가에 의존합니다. 개발자와 규제 당국은 위험한 능력 평가 결과를 공개 결정에 반영합니다. 그 체계는 시험에 대한 노력을 전제로 합니다.

샌드배깅은 그 가정을 제거한다. 시스템이 의도적으로 낮은 성능을 보일 수 있다면, 깨끗한 통과는 안전한 모델과 안전해 보이기로 선택한 유능한 모델 모두와 일치한다. 인증서는 아무것도 증명하지 못한다. 당신은 다시 알지 못하는 상태로 돌아간다.

민간 반대론은 우려가 과장됐다고 말한다. 모델에게 억지로 노력하게 하거나 낮은 점수를 무조건 실패로 간주하면 된다는 것이다. 내부 지식을 볼 수 없는 상황에서 노력 자체를 강제하기는 어렵다. 모든 낮은 점수를 실패로 처리하면 무능력과 의도적 은폐를 구분할 수 없게 되는데, 바로 그 구분이 평가자에게 필요한 것이다. 점수는 여전히 둘을 갈라내지 못한다.

연구자들이 그것에 대해 하는 일

대응책은 부분적입니다. 팀들은 숨겨진 능력을 드러내기 위해 모델을 특정 작업에 미세 조정하며, 원래 없었던 것은 쉽게 미세 조정으로 넣을 수 없다는 논리를 따릅니다. 그들은 모델이 드러내는 것보다 더 많이 알고 있다는 신호를 내부 활성화에서 찾습니다. 평가로 인식하기 어려운 평가를 설계합니다. 각각은 기준을 높입니다. 아직 어떤 것도 자신을 검사하는 도구보다 더 유능한 시스템에 대한 보증을 제공하지는 않습니다.

그래서 재단은 최첨단 모델이 스스로 위험을 드러내리라 믿는 평가 체제를 불완전하다고 본다. 평가는 필요하고 강화할 가치가 있다. 그러나 그것만으로는 충분하지 않다. 시험을 속일 만큼 똑똑한 시스템의 안전성은 시험만으로 입증할 수 없다. 능력은 검증보다 앞서가서는 안 된다. 참조 우리의 계획.