Một đánh giá năng lực nguy hiểm đặt ra một câu hỏi cụ thể về một mô hình: không phải liệu nó có lịch sự hay chính xác hay không, mà là liệu nó có thể giúp ai đó gây ra thiệt hại nghiêm trọng một cách có ý nghĩa hay không. Nó có thể hướng dẫn một người mới tổng hợp mầm bệnh không? Nó có thể tìm và khai thác lỗ hổng phần mềm không? Nó có thể chạy một chiến dịch ảnh hưởng thuyết phục, hay lừa dối con người để theo đuổi mục tiêu không? Các bài kiểm tra này thăm dò trần của những gì hệ thống cho phép, trong các lĩnh vực mà mặt trái là thảm khốc.

Chúng đã chuyển nhanh từ sự tò mò nghiên cứu thành công cụ chính sách. Các phòng thí nghiệm lớn hiện chạy chúng trước khi phát hành, các cơ quan an toàn chính phủ đã đưa chúng vào trọng tâm nhiệm vụ của mình, và các cam kết an toàn biên giới tự nguyện được xây dựng xung quanh chúng. Khi bạn nghe rằng một mô hình đã được kiểm tra khả năng vũ khí sinh học hoặc mạng trước khi ra mắt, thì đó chính là những gì đã xảy ra.

Cách chúng hoạt động

Các phương pháp thay đổi, và đánh giá tốt kết hợp nhiều phương pháp.

  • Các tiêu chuẩn có cấu trúc đặt ra câu hỏi hoặc nhiệm vụ trong lĩnh vực nguy hiểm và chấm điểm mức độ mà mô hình đạt được.
  • Thăm dò chuyên gia, khi các nhà chuyên môn về sinh học hoặc an ninh cố gắng trích xuất hỗ trợ hữu ích, vì một kẻ lạm dụng thực thụ sẽ không dừng lại ở lần từ chối đầu tiên.
  • Các nghiên cứu về tác động nâng cao đo lường mức độ một mô hình thực sự cải thiện khả năng gây hại của con người so với việc dùng internet mở, đây chính là câu hỏi quan trọng đối với chính sách.
  • Các đánh giá mang tính tác nhân trao cho mô hình công cụ và quyền tự chủ để xem nó hoàn thành được gì, thay vì chỉ xem nó nói gì.

Làm tốt, đây thực sự có giá trị. Nó đã phát hiện các năng lực đáng lo ngại, cung cấp thông tin cho các quyết định thực tế nhằm bổ sung biện pháp bảo vệ, và trao cho cơ quan quản lý thứ gì đó cụ thể để chỉ ra. Quỹ ủng hộ việc củng cố công việc này. Đây là phần cần thiết của bất kỳ chế độ quản trị nghiêm túc nào, và là bước tiến lớn so với việc phát hành các hệ thống biên giới mà không có kiểm tra có cấu trúc nào.

Ba lý do chúng không đủ

Hữu ích vẫn chưa đủ. Những khoảng trống mang tính cấu trúc, không thể khắc phục chỉ bằng bộ kiểm thử tốt hơn.

Đầu tiên, một đánh giá chỉ đo lường khả năng nếu mô hình đang cố gắng. Một hệ thống có thể che giấu năng lực, cố tình hoạt động kém để trông an toàn, biến kết quả rõ ràng thành không có kết quả. Mô hình càng mạnh thì điều này càng dễ xảy ra, và năng lực chính là thứ bài kiểm tra tồn tại để đo lường.

Thứ hai, bạn không thể kiểm tra một mối nguy mà bạn chưa từng nghĩ đến. Các đánh giá chỉ bao quát các năng lực nguy hiểm đã biết. Lịch sử công nghệ đầy rẫy những thiệt hại chỉ rõ ràng sau khi đã xảy ra. Một bộ kiểm tra là danh sách các câu hỏi chúng ta đã biết cần hỏi, và một năng lực hoàn toàn mới sẽ không nằm trong danh sách đó.

Thứ ba, vắng bằng chứng không phải là bằng chứng yếu ớt về sự vắng mặt. Một mô hình trượt bài kiểm tra khả năng nguy hiểm hôm nay chỉ cho bạn biết nó đã không thể hiện khả năng đó trong các điều kiện này, với cách kích hoạt này, tại thời điểm này. Việc tinh chỉnh sau này, gợi ý tốt hơn hoặc công cụ mới có thể làm lộ ra các khả năng mà đánh giá ban đầu bỏ sót. Khả năng không phải là thuộc tính cố định mà bạn đo một lần.

Các đánh giá có thể cho bạn biết một mô hình là nguy hiểm. Chúng không thể đáng tin cậy cho bạn biết một mô hình là an toàn.

Chúng phù hợp ở đâu trong chế độ thực sự

Sự bất đối xứng ở dòng cuối cùng chính là toàn bộ ý nghĩa. Một đánh giá thất bại (một mô hình rõ ràng có thể giúp chế tạo vũ khí) là mạnh mẽ và có thể hành động. Một đánh giá thành công yếu hơn nhiều. Nó phù hợp với mô hình an toàn, nhưng cũng phù hợp với mô hình có năng lực đã sandbag, bị elicitation kém, hoặc chưa từng cố gắng thật sự.

Vì vậy Foundation coi các đánh giá chỉ là một lớp, không phải bức tường chịu lực. Chúng thuộc về một cấu trúc không phụ thuộc vào việc mô hình hợp tác với chính quá trình đánh giá của mình: các giới hạn cứng đối với phát triển tiên phong, quản trị compute, giám sát độc lập, và sự công nhận, được lập luận trong bài viết của chúng tôi về các cam kết tự nguyện, rằng việc kiểm tra do phòng thí nghiệm thực hiện dưới áp lực cạnh tranh cần sự hậu thuẫn từ bên ngoài để có hiệu lực. Hãy xây dựng các bài kiểm tra. Củng cố chúng. Đừng nhầm lẫn điểm đạt yêu cầu với cam kết an toàn. Thiết kế tổng thể nằm trong kế hoạch của chúng tôi.