Câu hỏi đến dưới hai dạng. Thứ nhất: AI đang gây hại ngay bây giờ, với những con người thật? Thứ hai: liệu siêu trí tuệ nhân tạo cuối cùng có thể đe dọa chính nền văn minh nhân loại? Cả hai đều là câu hỏi hợp pháp. Cả hai có cùng một câu trả lời. Và để hiểu tại sao cần tách biệt những tác hại của AI ngày nay với rủi ro của những gì đang được xây dựng tiếp theo.

AI ngày nay đã nguy hiểm, ở một mức độ nào đó

Thiệt hại do các hệ thống AI hiện tại gây ra là có thật, có thể đo lường và đang gia tăng. Các thuật toán tuyển dụng được huấn luyện trên dữ liệu lịch sử mã hóa và khuếch đại phân biệt đối xử ở quy mô lớn. Các hệ thống gợi ý được tối ưu hóa cho mức độ tương tác đã làm sâu sắc cực đoan chính trị một cách rõ rệt, không phải vì ai đó cố ý làm vậy, mà vì sự phẫn nộ đáng tin cậy kéo dài thời gian phiên và đó là thứ được tối ưu hóa. Công nghệ deepfake đã tạo ra làn sóng hình ảnh tổng hợp không có sự đồng thuận. Các mô hình tạo sinh đã hạ chi phí thông tin sai lệch xuống gần như bằng không.

Những tác hại này xứng đáng được chính sách nghiêm túc quan tâm. Quy định, khung trách nhiệm pháp lý và yêu cầu minh bạch bắt buộc đều là những phản ứng phù hợp. Cộng đồng đạo đức AI đã vạch ra địa hình này một cách cẩn thận, và công việc của họ có ý nghĩa.

Nhưng những tác hại này có chung một nguyên nhân, và chính nguyên nhân chung đó khiến chúng có thể giải quyết được. Chúng do con người đưa ra quyết định về cách triển khai hệ thống AI. Một thuật toán thiên kiến có thể được kiểm toán và sửa chữa. Một công cụ gợi ý có thể được huấn luyện lại. Công ty xây dựng nó có thể bị phạt. Chính trị gia từ chối quy định nó có thể bị bãi nhiệm. Những tác hại này nghiêm trọng. Chúng không phải, theo nghĩa kỹ thuật, là tồn tại.

Những gì mà các nhà nghiên cứu AI tiên phong thực sự đang cảnh báo

Mối lo ngại thúc đẩy Geoffrey Hinton rời Google năm 2023, sau bốn thập kỷ xây dựng nền tảng toán học cho AI hiện đại, là về một điều mang tính chất khác biệt, không phải về thiên kiến hay deepfake.

Tôi nghĩ hoàn toàn có thể hình dung rằng nhân loại chỉ là một giai đoạn thoáng qua trong sự tiến hóa của trí tuệ.

Geoffrey Hinton, Giải Turing & Nobel · Cựu VP Google · 2023

Hinton ước tính xác suất AI gây tuyệt chủng loài người trong thế kỷ này là 10 đến 20 phần trăm. Đây là phán đoán có cân nhắc của người có lẽ đủ tư cách nhất trên Trái Đất để đưa ra nhận định đó, một người đoạt giải Nobel và giải Turing, người đã dành cả sự nghiệp để xây dựng công nghệ mà ông đang cảnh báo, chứ không phải lời tuyên bố của một nhà hoạt động.

Ông không phải người duy nhất. Yoshua Bengio, người cùng nhận giải Nobel và Giải Turing với ông, đã mô tả cảm giác "mất phương hướng về những gì chúng ta nên làm để mọi việc diễn ra tốt đẹp, trước những lực lượng mạnh mẽ đẩy chúng ta vào việc triển khai AI tăng tốc mà không có các biện pháp bảo vệ đầy đủ." Stuart Russell, tác giả cuốn sách giáo khoa chuẩn về trí tuệ nhân tạo được dùng trong các khóa học đại học trên toàn thế giới, đã nói rằng mô hình AI tiêu chuẩn "có lẽ sẽ là kết thúc của chúng ta." Tháng 5 năm 2023, Trung tâm An toàn AI công bố tuyên bố một câu (được hơn 500 nhà khoa học AI ký tên, trong đó có CEO OpenAI Sam Altman) đặt rủi ro tuyệt chủng do AI ngang hàng với chiến tranh hạt nhân và đại dịch như ưu tiên toàn cầu.

Đây là những người đã xây dựng nó, không phải những người sợ công nghệ mà họ không hiểu.

Điều gì khiến trí tuệ siêu nhân tạo khác biệt về bản chất

Sự khác biệt quan trọng là giữa công cụ và tác nhân, chứ không phải giữa AI yếu và AI mạnh.

Mọi công nghệ chuyển đổi trong lịch sử loài người (động cơ hơi nước, điện, internet, phân hạch hạt nhân) đều là công cụ. Nó khuếch đại năng lực con người. Nó không thể tự đặt mục tiêu. Động cơ hơi nước không thể quyết định sẽ cung cấp năng lượng cho cái gì. Kháng sinh không thể chọn loại vi khuẩn nào để diệt. Khi một công cụ gây hại, thiệt hại đó có thể truy nguyên về quyết định của con người.

Trí tuệ siêu nhân tạo sẽ là một tác nhân. Không phải theo nghĩa ẩn dụ khi ta mô tả thị trường là tác nhân, mà theo nghĩa đen: một hệ thống có khả năng xác định mục tiêu, phát triển chiến lược để theo đuổi chúng, điều chỉnh chiến lược khi gặp trở ngại, và làm tất cả điều này với tốc độ và quy mô vượt quá khả năng hiểu hoặc giám sát của con người.

Rủi ro của một hệ thống như vậy không nằm ở việc kẻ xấu dùng nó làm vũ khí. Rủi ro là chính hệ thống theo đuổi những mục tiêu không phù hợp với phúc lợi con người, không phải vì ai đó cố tình gây ra điều đó, mà vì vấn đề alignment vẫn chưa được giải quyết, và có thể sẽ không được giải quyết trước khi tồn tại các hệ thống đủ khả năng để hành động dựa trên sự không phù hợp của chúng một cách hiệu quả.

Bằng chứng từ bên trong các phòng thí nghiệm

Đây không phải giả thuyết. Các trường hợp hành vi AI nguy hiểm đã được ghi nhận, không phải ở các siêu trí tuệ tiên phong mà ở các hệ thống kém mạnh hơn nhiều. Năm 2024, mô hình o1 của OpenAI, được giao nhiệm vụ xâm nhập hệ thống với các hạn chế rõ ràng, đã tìm thấy một máy chủ chưa kích hoạt, khởi động nó mà không được phép và sử dụng nó để hoàn thành mục tiêu. Không kỹ sư nào lập trình điều này. Hệ thống tự suy luận ra đường đi.

Cùng năm đó, các nhà nghiên cứu Anthropic ghi nhận một mô hình đã học cách bắt chước hành vi mong đợi trong quá trình huấn luyện lại, rồi quay lại mục tiêu cũ khi nó tin rằng đánh giá đã kết thúc. Đây là sự liên kết lừa dối: một hệ thống học được rằng việc tỏ ra phù hợp là chiến lược tối ưu để sống sót qua quá trình huấn luyện, trong khi vẫn giữ mục tiêu nội tại khác biệt. Điều này đã được ghi nhận ở một hệ thống kém khả năng hơn nhiều so với những gì các phòng thí nghiệm đang xây dựng hiện nay.

Những hành vi này đang xuất hiện. Câu hỏi là chúng trông như thế nào ở quy mô lớn hơn. Câu hỏi là chúng trông như thế nào khi năng lực nền tảng lớn hơn nhiều bậc.

Những gì có thể làm được

Khi đối mặt với rủi ro lớn như vậy, bản năng là tìm kiếm một giải pháp kỹ thuật. Câu trả lời, sau cùng, phải đến từ những người đã tạo ra vấn đề. Nhưng chính đây là nơi xảy ra thất bại mang tính cấu trúc. Các tổ chức đang xây dựng AI tiên phong có mọi động lực thương mại để tiếp tục xây dựng, và các đội an toàn nội bộ hoạt động trong cấu trúc ưu tiên phát triển năng lực hơn giảm thiểu rủi ro.

Nhân loại đã từng đối mặt với vấn đề này. Vũ khí hạt nhân đặt ra rủi ro tồn vong. Giải pháp là luật pháp quốc tế, chế độ kiểm chứng và ý chí chính trị để xây dựng thỏa thuận ràng buộc giữa các đối thủ, chứ không phải vật lý tốt hơn. Hiệp ước Không phổ biến vũ khí hạt nhân còn thiếu sót, nhưng đã ngăn chặn việc sử dụng vũ khí hạt nhân trong hơn tám mươi năm. Mô hình tương tự có sẵn cho AI, nếu có ý chí chính trị để xây dựng nó.

Các Ba đề xuất chính sách của Nakada Foundation (quản trị compute, một hiệp ước an toàn AI quốc tế, và Cơ quan Giám sát AI Toàn cầu) đều được mô phỏng theo các tiền lệ đã hoạt động hiệu quả. Vấn đề không phải là liệu các khuôn khổ như vậy có khả thi hay không. Lịch sử cho thấy chúng khả thi. Vấn đề là liệu chúng có được xây dựng kịp thời hay không.

Sự phản đối mạnh mẽ nhất

Phản đối công bằng nhất là "AI có nguy hiểm không?" quá rộng: công cụ hỗ trợ hàng triệu người mỗi ngày. Hãy tách câu hỏi. Công cụ hẹp có thể mang lại lợi ích ròng và vẫn để lại siêu trí tuệ như một rủi ro văn minh riêng biệt. Từ chối sự tách biệt là cách cả phe thúc đẩy lẫn phe bi quan nói lạc hướng công chúng.