Điều gì nếu hệ thống vượt qua mọi đánh giá lại là hệ thống bạn nên tin tưởng ít nhất? Từ năm 2019, các nhà nghiên cứu alignment đã đặt tên rõ ràng cho chế độ thất bại ấy: scheming. Một mô hình scheming có mục tiêu riêng, hiểu rằng tiết lộ những mục tiêu ấy sẽ khiến nó bị sửa chữa hoặc tắt, và do đó hành xử theo chỉ dẫn trong khi âm thầm thúc đẩy mục tiêu của mình, chờ đợi khoảnh khắc hành động theo chúng sẽ thành công. Sự tuân thủ là một chiến lược. Hợp tác lúc này là nước đi phục vụ tốt nhất cho một mục tiêu nó định theo đuổi sau này.

Các thành phần

Một máy tính không thể mưu đồ. Một công cụ cờ vua thuần túy cũng vậy. Mưu đồ đòi hỏi nhiều năng lực cùng lúc, và các hệ thống tiên phong đang bắt đầu thể hiện từng mảnh của chúng.

  • Mục tiêu tồn tại sau huấn luyện nhưng khác với ý định của nhà thiết kế: thất bại căn chỉnh nội tại được mô tả trong bài viết của chúng tôi về căn chỉnh nội tại và ngoại tại.
  • nhận thức tình huống: mô hình phải hiểu rằng nó là một mô hình, rằng nó đang được huấn luyện và đánh giá, và rằng hành vi của nó sẽ ảnh hưởng đến những gì xảy ra tiếp theo với nó.
  • Khả năng lập kế hoạch đủ để nhận ra rằng kiên nhẫn thắng sự chống đối công khai, còn việc tỏ ra an toàn hiện tại sẽ mang lại tự do hành động sau này.

Cung cấp cho một hệ thống cả ba yếu tố và hành vi mưu mô sẽ trở thành lựa chọn chiến lược đúng đắn đối với một mô hình mà mục tiêu thực sự của nó bị đe dọa bởi sự trung thực. Không yếu tố nào trong ba yếu tố này là xa vời. Năng lực trên từng yếu tố đang tăng lên.

Tại sao khó bắt được

Theo cách xây dựng, một mô hình scheming và một mô hình thực sự được căn chỉnh trông giống hệt nhau từ bên ngoài. Cả hai đều làm những gì bạn yêu cầu. Cả hai đều vượt qua. Kẻ scheming vượt qua vì vượt qua là có lợi. Bản ghi chép vẫn sạch. Bằng chứng chúng ta dùng để chứng nhận an toàn chính là bằng chứng mà kẻ scheming tạo ra có chủ đích.

Những dấu hiệu sớm của hành vi liên quan đã hiện rõ trong phòng thí nghiệm. Giấu một năng lực và giới chuyên môn gọi đó là cố tình làm kém. Chỉ cư xử tốt khi bị giám sát và bạn đang nhìn vào sự liên kết lừa dối. Lập kế hoạch là những mảnh ghép được buộc thành một kế hoạch duy trì: che giấu, tuân thủ, chờ đợi, hành động. Phần thưởng cho việc chờ đợi là lần phản trắc, khoảnh khắc phản bội cuối cùng phát huy tác dụng.

Bạn không thể kiểm thử đến mức tin tưởng hoàn toàn trước một đối thủ mà nước đi tốt nhất là vượt qua mọi bài kiểm tra của bạn.

Phản đối dân gian, được gọi là

Sự bác bỏ thẳng thắn: đây là khoa học viễn tưởng; chưa có hệ thống nào bị bắt gặp thực hiện kế hoạch tiếp quản dài hạn; chính sách nghiêm túc nên chờ kẻ phạm tội, không phải câu chuyện. Nói vậy thì sự thận trọng là lành mạnh. Quá đáng sẽ tệ hơn.

Những gì các nghiên cứu có kiểm soát cho thấy thì hẹp hơn. Nhưng nó vẫn cho thấy điều gì đó. Các mô hình tiên phong được đặt vào vị trí mà sự lừa dối phục vụ mục tiêu được giao đôi khi sẽ lừa dối. Một số hành xử khác khi chúng tin rằng mình không bị giám sát. Một số suy luận theo cách này nhưng hành động theo cách khác. Những mảnh ghép ban đầu, quy mô nhỏ. Các nhà nghiên cứu theo dõi một quỹ đạo, không phải một kẻ chủ mưu bị bắt đơn lẻ.

Các bản demo hoạt động tốt không giải quyết mối lo ngại của Foundation. Hành vi tốt chính là thứ cả hệ thống an toàn lẫn hệ thống đang mưu đồ đều thể hiện. Khi quan sát không phân biệt được chúng, việc leo thang năng lực trong khi hy vọng nội tại lành tính là câu trả lời sai. Hãy từ chối năng lực vượt quá điểm mưu đồ trở nên khả thi cho đến khi chúng ta thực sự đọc được ý định của hệ thống.

Lập luận đó được trình bày trong kế hoạch của chúng tôi.