헌법적 인공지능은 Anthropic가 개발한 훈련 방법입니다. 아이디어는 모델의 행동이 인간이 유해 출력을 직접 라벨링하는 데 얼마나 의존하는지를 줄이고, 대신 모델이 스스로 응답을 서면 원칙 집합, 즉 헌법에 따라 평가하게 하는 것입니다.

실제로는 두 단계로 작동합니다. 먼저 모델이 응답을 생성한 다음, 그 응답을 헌법에 따라 비판하고 수정하며, 자신의 수정으로부터 학습합니다. 둘째, 모델은 응답 쌍을 비교하여 원칙을 더 잘 만족하는 쪽을 판단하며, 그 판단은 인간 순위가 하던 방식과 유사하게 모델을 훈련시킵니다 RLHF. 피드백이 사람 대신 모델이 헌법을 적용해 오기 때문에 이 접근법의 일부를 인공지능 피드백 기반 강화학습이라고 부르기도 합니다.

그것이 옳게 본 점

실질적인 이점들이 있으며, 이를 솔직히 인정할 가치가 있습니다.

  • 원칙은 명시적입니다. 수천 개의 개별 인간 라벨이 암시하는 가치 대신 읽고 토론하고 수정할 수 있는 문서가 있습니다. 이는 평점 더미보다 투명합니다.
  • 피드백 생성을 확장합니다. 유해 콘텐츠에 대한 인간 라벨링은 느리고 비용이 들며 라벨러에게 부담이 큽니다. 모델이 그 작업을 더 많이 하도록 하면 병목이 사라집니다.
  • 일관성을 높일 수 있습니다. 서면 표준을 일률적으로 적용하면 여러 날에 걸쳐 여러 평가자가 내리는 판단의 잡음과 편차를 일부 피할 수 있습니다.

이들은 진정한 공학적 진보이며, 헌법적 AI는 더 도움이 되면서도 명백한 해를 덜 일으키는 모델을 만들어냈습니다. 재단은 유용한 작업을 폄하할 생각이 없습니다.

그것이 해결하지 못하는 것

더 어려운 질문들은 그 방법 속에서도 그대로 남아 있으며, 그 이유를 아는 것은 중요하다.

이 기법은 여전히 모델이 판단한 명시된 기준을 충족하도록 모델을 최적화한다. 인간을 응답별 루프에서 배제하며, 문제의 근본 형태는 바뀌지 않는다. 즉 시스템은 목표에 대해 좋은 점수를 받는 출력을 생산하도록 훈련되고 있다는 점이다. 헌법이 불완전하거나, 아무도 예상하지 못한 상황에서 원칙이 충돌하면 모델은 작성된 내용의 문구를 최적화하며, 동일한 굿하트 압력은 그대로입니다. 가치를 헌법으로 적는다고 해서 가치 명세의 어려움이 사라지는 것이 아니라, 그 어려움이 문서 안으로 옮겨갈 뿐입니다.

두 가지 더 깊은 한계는 여전히 손대지 않은 채 남아 있다. 방법은 행동을 형성하지만 모델의 내부 목표에 대한 보증은 주지 않으므로, 정렬된 것처럼 보이는 것과 실제로 정렬된 것 사이의 간극, 즉 내부 정렬 문제는 여전히 해결되지 않았습니다. 그리고 이는 모델이 스스로 출력물을 판단하는 데 의존하는데, 이는 모델이 정직하고 판단 능력이 있을 때만 신뢰할 수 있습니다. 바로 우리가 가정할 수 없는 부분입니다.

헌법적 인공지능은 행동을 조종하는 더 나은 방법입니다. 행동 조종은 우리가 어떻게 하는지 몰랐던 정렬의 부분이 아니었습니다.

적절한 비율로 유지하기

헌법적 인공지능은 재단이 면밀히 관찰하는 패턴의 좋은 예입니다. 실제로 가치 있는 안전 진전이지만, 그 이상으로 과대 해석하기 쉽습니다. 이와 같은 방법은 현재 모델을 더 통제 가능하고 기준에 대해 더 투명하게 만들며, 이는 가치 있는 일입니다. 그러나 이들은 우리를 능가하는 시스템을 정렬할 수 있음을 입증하지 못하며, 우리의 전체 주장이 달린 검증 격차를 해소하지도 않습니다. 훈련에서의 진전은 환영합니다. 그것이 나머지가 따라올 것이라는 가정 하에 능력을 계속 확장할 이유는 되지 않으며, 이는 나카나 재단이 제시한 사례입니다 우리의 계획.