Constitutional AI là phương pháp huấn luyện do Anthropic phát triển. Ý tưởng là giảm sự phụ thuộc hành vi của mô hình vào việc con người gán nhãn đầu ra có hại, thay vào đó để mô hình tự đánh giá phản hồi của mình dựa trên một bộ nguyên tắc được viết ra, gọi là hiến pháp.
Trong thực tế nó hoạt động qua hai giai đoạn. Đầu tiên, mô hình tạo phản hồi, sau đó phê bình phản hồi đó theo hiến pháp và sửa đổi, học từ những chỉnh sửa của chính mình. Thứ hai, mô hình so sánh các cặp phản hồi và đánh giá cái nào thỏa mãn các nguyên tắc tốt hơn, và những đánh giá đó huấn luyện nó giống như cách xếp hạng của con người trong RLHF. Vì phản hồi đến từ mô hình áp dụng hiến pháp thay vì từ con người, một phần cách tiếp cận đôi khi được gọi là học tăng cường từ phản hồi AI.
Những gì nó làm đúng
Có những lợi thế thực sự, và chúng đáng được thừa nhận một cách rõ ràng.
- Các nguyên tắc được nêu rõ ràng. Thay vì các giá trị ngầm định bởi hàng nghìn nhãn con người riêng lẻ, có một văn bản bạn có thể đọc, tranh luận và sửa đổi. Điều đó minh bạch hơn một đống xếp hạng.
- Nó mở rộng quy mô tạo phản hồi. Việc con người gán nhãn nội dung có hại chậm, tốn kém và gây áp lực cho người gán nhãn. Để mô hình làm nhiều công việc đó hơn sẽ gỡ bỏ một nút thắt.
- Nó có thể cải thiện tính nhất quán. Một tiêu chuẩn được viết ra áp dụng đồng đều tránh được một số nhiễu và sai lệch từ nhiều người đánh giá con người khác nhau vào những ngày khác nhau.
Đây là những bước tiến kỹ thuật thực sự, và constitutional AI đã tạo ra các mô hình vừa hữu ích hơn vừa ít dễ gây hại rõ ràng. Foundation không có ý định bác bỏ công việc hữu ích.
Những gì nó không giải quyết
Những câu hỏi khó hơn vẫn tồn tại nguyên vẹn qua phương pháp, và điều quan trọng là phải hiểu tại sao.
Kỹ thuật này vẫn tối ưu hóa mô hình để đáp ứng tiêu chuẩn đã nêu theo đánh giá của một mô hình. Nó đưa con người ra khỏi vòng lặp từng phản hồi, và không thay đổi hình dạng cơ bản của vấn đề, đó là hệ thống đang được huấn luyện để tạo ra đầu ra đạt điểm tốt so với mục tiêu. Nếu hiến pháp không đầy đủ, hoặc các nguyên tắc xung đột trong tình huống không ai dự đoán, mô hình tối ưu hóa đúng theo những gì được viết, với cùng Goodhart áp lực như cũ. Viết các giá trị thành hiến pháp cũng không giải quyết được khó khăn khi phải xác định giá trị; nó chỉ chuyển vấn đề vào văn bản.
Hai giới hạn sâu hơn vẫn chưa được chạm đến. Phương pháp này định hình hành vi, và không đưa ra đảm bảo nào về mục tiêu nội bộ của mô hình, do đó khoảng cách giữa việc trông có vẻ aligned và thực sự aligned căn chỉnh nội tại vấn đề, vẫn còn bỏ ngỏ. Và nó dựa vào khả năng tự đánh giá đầu ra của chính mô hình, vốn chỉ đáng tin cậy chừng nào mô hình còn trung thực và có khả năng phán đoán, đúng là điều ta không thể giả định với một hệ thống đang tiếp cận hoặc vượt quá mức trí tuệ của chúng ta.
Constitutional AI là cách tốt hơn để định hướng hành vi. Định hướng hành vi chưa bao giờ là phần alignment mà chúng ta không biết cách làm.
Giữ mọi thứ ở mức độ hợp lý
Constitutional AI là một ví dụ tốt về mô hình mà Foundation theo dõi chặt chẽ: tiến bộ an toàn thực sự, có giá trị nhưng dễ bị đọc quá mức so với thực tế. Các phương pháp như vậy làm cho các mô hình hiện tại dễ kiểm soát hơn và minh bạch hơn về các tiêu chuẩn của chúng, và điều đó đáng có. Chúng không chứng minh rằng chúng ta có thể align một hệ thống vượt trội hơn chúng ta về tư duy, và chúng không thu hẹp khoảng cách xác minh mà toàn bộ lập luận của chúng ta xoay quanh. Tiến bộ trong huấn luyện là đáng hoan nghênh. Đó không phải là lý do để tiếp tục mở rộng năng lực với giả định phần còn lại sẽ theo sau, đó là trường hợp được trình bày trong kế hoạch của chúng tôi.