위험한 능력 평가는 모델에 대해 구체적인 질문을 던집니다. 예의 바르거나 정확한지가 아니라, 누군가가 심각한 피해를 입히는 데 실질적으로 도움을 줄 수 있는지입니다. 초보자에게 병원체 합성을 안내할 수 있는가? 소프트웨어 취약점을 찾아 악용할 수 있는가? 설득력 있는 영향력 캠페인을 수행하거나 목표를 추구하며 인간을 속일 수 있는가? 이 검사들은 시스템이 가능하게 하는 능력의 상한을, 피해가 재앙적인 분야에서 탐색합니다.
이들은 연구 호기심에서 정책 도구로 빠르게 이동했습니다. 주요 연구소는 이제 출시 전에 이를 실행하고, 정부 안전 기관은 이를 업무의 중심으로 삼았으며, 자발적 프론티어 안전 약속은 이를 중심으로 구축됩니다. 모델이 출시 전에 생물무기나 사이버 능력에 대해 테스트되었다는 말을 들을 때, 바로 이것이 일어난 일입니다.
작동 방식
방법은 다양하며, 좋은 평가는 여러 가지를 결합합니다.
- 위험한 영역에서 질문이나 과제를 제시하고 모델이 얼마나 진행하는지 점수화하는 구조화된 벤치마크.
- 생물학이나 보안 전문가들이 유용한 도움을 끌어내려고 적극적으로 시도하는 전문가 탐문. 실제 악용자는 첫 번째 거절에서 멈추지 않을 것이기 때문입니다.
- 모델이 실제로 사람의 해악 수행 능력을 얼마나 향상시키는지, 정책에 중요한 질문인 개방형 인터넷 사용과 비교해 측정하는 상향 연구.
- 모델에 도구와 자율성을 부여하고, 말만 듣는 게 아니라 실제로 무엇을 해내는지 관찰하는 에이전틱 평가.
잘 수행되면 이는 진정으로 가치 있습니다. 우려되는 능력을 포착했고, 실제 안전장치 추가 결정을 알렸으며, 규제 당국이 구체적으로 지적할 대상을 주었습니다. 재단은 이 작업을 강화하는 것을 지지합니다. 이는 진지한 거버넌스 체제의 필수 부분이며, 구조적 점검 없이 최전선 시스템을 공개하는 것보다 큰 개선입니다.
그것들이 충분하지 않은 세 가지 이유
유용한 것만으로는 여전히 부족하다. 격차는 구조적이며, 더 나은 테스트 모음만으로는 해결되지 않는다.
첫째, 평가는 모델이 노력할 때에만 능력을 측정합니다. 할 수 있는 시스템이 성능 저하, 고의로 성능을 낮춰 안전해 보이려는 태도는 깨끗한 결과를 결과 없음으로 바꾼다. 모델이 더 유능할수록 이런 일이 더 그럴듯해지며, 유능함이야말로 시험이 측정하려는 바로 그 대상이다.
둘째, 생각하지 못한 위험은 검사할 수 없다. 평가는 알려진 위험 능력만 다룬다. 기술의 역사는 나중에야 명백해진 피해로 가득하다. 시험 모음은 우리가 알았던 질문 목록이며 충분히 새로운 능력은 그 목록에 없을 것이다.
셋째, 증거의 부재는 부재의 증거로서 약하다. 오늘 위험 능력 시험에서 모델이 실패했다는 것은 이 조건, 이 유도, 이 순간에 그 능력을 보이지 않았다는 것을 말해줄 뿐이다. 나중의 미세 조정, 더 나은 프롬프트, 새로운 도구는 원래 평가가 놓친 능력을 드러낼 수 있다. 능력은 한 번 측정하는 고정된 속성이 아니다.
평가는 모델이 위험하다고 말해줄 수 있습니다. 하지만 모델이 안전하다고 신뢰성 있게 말해줄 수는 없습니다.
그들이 실제 체제에서 어디에 맞는가
마지막 문장의 비대칭성이 핵심이다. 실패한 평가(모델이 분명히 무기 제작을 도울 수 있음)는 강력하고 실행 가능하다. 통과한 평가는 훨씬 약하다. 안전한 모델에도 맞지만, 능력이 있으면서도 의도적으로 낮춰 보이거나, 평가가 제대로 이뤄지지 않았거나, 진지하게 시도하지 않은 모델에도 맞는다.
그래서 재단은 평가를 하나의 층으로 보고 하중을 지탱하는 벽으로는 여기지 않습니다. 평가는 모델이 자체 평가에 협조하는 데 의존하지 않는 구조 안에 속해야 합니다. 최전선 개발에 대한 엄격한 제한, 연산 거버넌스, 독립 감독, 그리고 우리의 글에서 주장한 인식 자발적 약속, 그 연구소 주도의 시험은 경쟁 압력 아래에서는 외부 지원이 있어야 유지될 수 있다. 시험을 만들고 강화하라. 합격점을 안전 보증으로 착각하지 말라. 더 넓은 설계는 우리의 계획.