Google와 다른 곳의 제이슨 웨이와 공동 저자들은 성능이 모델 규모가 임계점을 넘을 때까지 우연 수준 근처에 머물렀다가 급격히 상승한 작업들을 목록화했습니다. 다단계 산술, 전문 영역 질문, 훈련에 거의 존재하지 않는 언어로 된 지시, 추론 단계의 연쇄: 이 중 어느 것도 기능으로 설계된 것이 아닙니다. 그것들은 모델이 성장함에 따라 나타났습니다. 그 논문은 그것들을 창발 능력이라고 불렀습니다.
그 용법에서 창발 능력이란 더 작은 모델에는 없고 더 큰 모델에는 있는 능력으로, 전환이 부드러운 경사보다는 스위치처럼 보이는 경우를 말합니다. 특정 규모 이하에서는 모델이 과제를 수행할 수 없습니다. 그 규모를 넘으면 수행할 수 있습니다. 그 능력은 더 작은 시스템의 추세만으로는 읽어낼 수 없었습니다.
주목할 만한 진짜 논쟁
창발은 정착된 과학이 아닙니다. 일부 연구자는 보고된 도약의 일부가 부분적으로 측정 인공물이라고 주장합니다: 가혹한 전부 아니면 전무 지표는 안정적인 기저 진전을 갑작스럽게 보이게 만들고, 부드러운 지표는 점진적 개선을 보여줍니다. 그 비판은 특정 사례에 적용되며 공정한 청취를 받을 자격이 있습니다.
실제 문제를 해소하지는 않습니다. 능력이 진정한 불연속으로 도착하든, 문턱을 넘은 뒤에야 알아차리는 가파른 곡선으로 도착하든 거버넌스 상황은 동일합니다. 우리는 모델이 새로운 일을 할 수 있다는 사실을 할 수 있게 된 후에야 알게 됩니다. 다음 훈련 실행이 안전한지 결정해야 하는 정책 입안자에게 진정한 출현과 급격한 곡선의 구분은 학문적입니다. 어느 쪽이든 놀라움은 결정의 저편에 있습니다.
예측 불가능성이 핵심 문제인 이유
더 큰 모델을 훈련하기 전에 그것이 할 수 있는 일의 전체 목록을 신뢰할 수 있게 예측할 수는 없다. 스케일링 법칙은 손실과 같은 광범위한 성능 지표는 상당히 잘 예측한다. 그러나 특정 능력이 언제, 어떤 것이 나타날지는 말하지 않는다. 능력은 개별적으로보다는 전체적으로 더 예측 가능하다.
대부분의 능력에서는 그저 흥미로울 뿐입니다. 안전과 관련된 능력에서는 우려스럽습니다. 번역에서 놀라운 재능을 발휘하게 하는 바로 그 예측 불가능성이 위험한 능력 평가: 사이버 지원, 생물무기 도움, 대규모 조작. 누구도 예상하지 못한 능력은 누구도 검사하지 않았고 누구도 안전장치를 마련하지 않은 능력입니다.
다음 모델이 평균 지표에서 얼마나 좋을지는 대략 예측할 수 있다. 그 모델이 무엇을 할 수 있을지는 예측할 수 없다. 그 차이가 위험이 있는 지점이다.
우리가 확장하는 방식에 대한 의미
창발은 규모의 큰 도약마다 부분적 어둠 속으로 한 걸음 내딛게 만듭니다. 존재한 후에야 완전한 능력 프로필을 알게 되는 시스템을 만듭니다. 그때 위험한 능력이 함께 왔다면, 시스템은 이미 그 능력을 가지고 있습니다. 이는 미리 측정하고 완화할 수 있는 알려진 위험과는 다른 위험입니다.
나카다 재단의 주장은 직접 따릅니다. frontier 스케일링은 생성되는 것을 이해할 수 있는 능력보다 앞서 달려서는 안 됩니다. 부담은 크고 새로운 시스템이 안전하다는 것을 훈련하고 배포하기 전에 입증하는 데 있어야 하며, 위험을 나중에 발견하는 데 있지 않아야 합니다. 능력이 예고 없이 도착할 수 있을 때, 점프 전에 주의하는 것이 도움이 되는 유일한 주의입니다. 그 틀은 우리의 계획. 위험을 높이는 단축된 타임라인은 AGI 일정.