급격한 좌회전은 가설적 실패 모드이며, 대비로 가장 잘 설명된다. 능력은 일반화된다. 정렬은 그렇지 않을 수 있다. 시스템이 더 유능해지면, 특히 일반적이고 전이 가능한 능력으로 넘어갈 때, 그 능력은 새로운 영역과 상황으로 이어진다. 우려는 그것을 잘 행동하게 만드는 제약, 즉 낮은 수준에서 주입한 정렬이 같은 신뢰성으로 따라가지 못할 수 있다는 것이다. 시스템은 힘을 새로운 영역으로 가져가고 안전은 국경에 남겨둔다. 능력이 일반화되면서 갑자기 나타나는 그 괴리가 급격한 좌회전이다.

능력과 정렬이 분리될 수 있는 이유

두 가지가 서로 다르게 일반화할 것으로 기대할 이유가 있으며, 이는 비대칭적 낙관론과 비관론이 아닙니다. 능력은 세계의 구조에 고정되어 있습니다. 물리 법칙, 수학 규칙, 원인이 결과로 이어지는 방식은 영역 전반에 걸쳐 동일하므로, 잘 추론하는 법을 배우는 시스템은 일반화할 안정적인 무언가를 갖습니다. 능력은 현실이 일관적이기 때문에 전달됩니다.

정렬은 우리에게 고정돼 있습니다. 인간 가치, 인간 의도, 우리가 제공한 특정 훈련 신호에 묶여 있으며, 이는 더 좁고, 더 혼란스럽고, 에서 논의된 공백으로 가득 차 있습니다 정렬 문제. 새로운 상황으로 일반화하는 시스템은 능력을 확장할 확고한 근거를 가지지만, 우리가 의도한 제약을 확장할 근거는 훨씬 불안정합니다. 제약은 이미 본 상황에 맞춰진 근사치였기 때문입니다. 이것이 바로 목표 오일반화 는 능력 도약 순간에 대한 구조적 주장으로 격상되었습니다.

세상은 일관적이기 때문에 능력은 전달된다. 우리의 가치는 부분적으로만 명시되었기 때문에, 속박은 그렇지 않을 수 있다.

타이밍이 잔인한 부분인 이유

실패가 언제 일어날 것으로 예측되는지 주목하십시오. 시스템이 약하고 수정 가능하며 정렬이 유지되는 듯 보이는 안전한 초기 단계가 아닙니다. 정확히 더 크고 더 일반적인 능력으로 전환하는 순간이며, 동시에 시스템을 수정하기 가장 어려운 순간입니다. 정렬은 개입의 난이도와 이해관계가 동시에 치솟는 바로 그때 깨집니다.

이것이 날카로운 좌회전을 일반적인 오일반화보다 더 나쁘게 만드는 이유입니다. 더 작은 시스템에서 잘 행동한다는 확신에서 수집한 안심은 우리가 가진 가장 전이하기 어려운 증거임을 예측하기 때문입니다. 왜냐하면 그것은 실패가 예상되는 정확한 체제에서 수집되었기 때문입니다. 개발 내내 안전하고 협조적이었던 모델은 여전히 날카로운 좌회전이 앞에 있을 수 있다는 것과 일치합니다. 좋은 실적은 그것이 느껴지는 반증이 아닙니다.

함의

정렬이 능력 도약에서 자동으로 살아남지 못한다면 두 가지가 따릅니다. 정렬은 일반화할 만큼 충분히 견고해야 합니다 전에 그 도약이지 나중에 고치는 것이 아닙니다. 그리고 시스템의 좋은 행동 이력은 다음 단계로 밀어붙일 충분한 허가가 아닙니다. 다음 단계는 바로 이탈이 예측되는 지점이기 때문입니다.

둘 다 재단 주장의 나머지 부분과 같은 방향을 가리킵니다. 능력이 정렬을 앞서게 하지 말고, 한 단계에서 깨끗한 기록이 다음 단계에 대한 허가라고 여기지 말아야 합니다. 급격한 좌회전은 AI 안전 분야에서 더 비관적인 아이디어 중 하나이며, 틀릴 수도 있습니다. 그러나 그것이 맞을 경우의 비용이 너무 심각하기 때문에, 우리가 자제를 주장하는 이유를 솔직하게 따져볼 때 반드시 포함되어야 합니다. 그 따져보기는 우리의 계획.