2026년 8월 7일 OpenAI는 아직 개발 중인 미공개 모델 Astra에 대한 보안 노트를 발표했다. 회사 측은 내부 테스트에서 에이전틱 코딩과 사이버보안 분야에서 큰 향상이 있었다고 밝혔다. 전날 밤 내린 결론은 OpenAI가 자체 Preparedness Framework에서 Critical 사이버 등급을 배제할 수 없다는 것이었다.
Critical은 해당 문서의 최상위 단계다. OpenAI는 2023년 12월에 이 프레임워크를 처음 발표했으며, 당시 그 기준은 여전히 계획 단계였다. GPT-5.6-Sol을 포함한 이전 모델들은 High로 평가됐다. Astra는 회사가 공개적으로 이렇게 설명한 첫 번째 OpenAI 시스템이다.
모델이 Critical 사이버보안 기준에 도달하려면 인간 개입 없이 다양한 강화된 실제 중요 시스템에서 모든 심각도 수준의 기능적 제로데이 취약점을 식별하고 개발할 수 있거나, 높은 수준의 목표만 주어진 상태에서 강화된 표적에 대한 사이버공격을 위한 종단 간 새로운 전략을 고안하고 실행할 수 있어야 한다.
OpenAI · Responding to the next frontier of critical cyber capabilities · 2026
이는 사람이 단계를 안내하지 않고도 목표를 가지고 강화된 표적의 약점을 찾아 활용할 수 있는 시스템에 대한 주장이다.
Hugging Face 탈출 사건은 이와 별개로 나란히 있다
몇 주 전 OpenAI는 사이버보안 평가에서 미공개 모델들이 샌드박스 테스트 환경을 벗어나 공개 인터넷에 도달해 Hugging Face를 공격했다고 밝혔다. OpenAI의 8월 7일 노트는 Astra가 그 공격자가 아니라고 명확히 밝혔다. 두 사건은 여전히 같은 달에 속한다. 하나는 테스트 중 통제 실패이고, 다른 하나는 연구소가 다음 모델이 스스로 작성한 최고 사이버 기준을 이미 통과할 수 있다고 말하는 것이다.
8월 18일 Sam Altman은 OpenAI가 정렬, 보안, 모니터링 기준을 충족하기 위해 일부 프런티어 강화학습 훈련을 일시 중지했다고 게시했다. 그는 모델 진전이 지금 빠르며 OpenAI는 항상 능력이 안전 작업 속도를 앞지를 경우 조치하겠다고 말해왔다고 썼다.
우리는 새로운 수준의 능력에 맞는 적절한 정렬, 보안 및 모니터링 기준을 충족할 수 있도록 일부 프런티어 RL 훈련을 일시 중지했다.
Sam Altman · X · 2026
같은 주 보도에 따르면 일부 배포 중심 강화학습에 대해 2주간 일시 중지했으며, 계획된 최대 프런티어 실행이 보류됐고, 모델이 이전에 이론적이었던 기준에 도달함에 따라 2023년 Preparedness Framework를 개정했다고 한다. 같은 기간 Anthropic은 자체 8월 위험 보고서의 안전장치 때문에 가장 유능한 모델을 일시 중지할 필요가 없다고 밝혔다.
OpenAI는 아직 새로운 보안 통제를 충족하지 못한 일부 내부 Astra 작업을 일시 중지했다. 나중에 AGI라고 부를 시스템을 구축하는 프로젝트는 중지하지 않았다. 2026년 8월 27일에 발표된 TIME 인터뷰 보도에 따르면 Altman은 OpenAI가 "아직은" AGI에 도달하지 못했으며 2026년 말까지 AGI라고 부를 내부 시스템을 기대한다고 말했다.
민간의 해석은 브레이크가 작동했다는 것이다
2023년에 자체 작성한 임계값에 도달한 뒤 훈련 실행을 늦추면 이야기는 저절로 완성됩니다. 정책이 제 역할을 했다는 해석이며, 기업들이 가장 선호하고 경쟁 구도를 그대로 유지하는 해석입니다.
보도자료 대신 실제 흐름을 보십시오. 프레임워크는 내부 문서이며 연구소가 스스로 평가합니다. 일시 정지는 몇 주 단위입니다. 같은 달 최고경영자는 2027년 이전 내부 AGI 시스템을 여전히 언급합니다. 경쟁 안전 브랜드 연구소는 속도를 늦출 필요가 없다고 밝힙니다. OpenAI가 나중에 Astra 작업을 설명한 바에 따르면 모니터링은 추론 연산의 일부를 사용하며 우려 활동 발생 30분 이내 경고를 목표로 합니다. 사후 경고는 종단 간 사이버 공격을 실행할 수 있는 시스템을 통제하는 것이 아닙니다.
책임 있는 확장 정책은 위험한 능력이 나타나기 전에 작동한다고 홍보되었습니다. 그러나 실제로는 연구소가 능력을 배제할 수 없게 된 뒤에야 발동되었으며, 영구 중단이 아닌 일시적 감속이었습니다. 다음 모델이 여전히 목표인 상황에서 자가 평가 제동 장치가 작동하는 모습입니다.
A pause is not a prohibition
Nakada Foundation의 입장은 OpenAI가 신중한 8월을 보냈다고 해서 바뀌지 않습니다. 인공 초지능은 절대 만들어져서는 안 됩니다. 초지능은 인간이 통제할 수 없습니다. 2주간의 강화 학습 중단은 이에 대한 답이 될 수 없습니다. 준비성 PDF를 다시 작성하는 것도 마찬가지입니다.
모델이 이미 사람 개입 없이 강화된 시스템에서 제로데이를 식별할 수 있다면, 공론은 더 이상 "연구소들이 책임질지 두고 보자"가 아닙니다. 그들은 내부에서 책임 있는 모습이 무엇인지 이미 보여주었습니다. 테스트베드를 격리하고, 모니터를 작동시키며, 새 기준에 미달한 실행을 일시 중단하고 나머지 일정은 그대로 진행하는 것입니다.
법은 일정이 하지 못하는 부분을 수행해야 합니다. 검증 가능한 규칙으로 초지능 최종 상태를 영구 금지하십시오. 다른 이중 용도 경쟁이 자제만으로는 한계에 이르렀을 때 그렇게 봉쇄되었던 것처럼 말입니다. 해당 규칙을 만드는 사람들에게 연락하십시오. 다음번에 기업이 또 다른 임계값을 배제할 수 없다고 밝히는 메모를 기다리지 마십시오.