Mọi người cứ hỏi "bộ não" AI trông ra sao. Một bảng tính lớn bằng thành phố, đầy những con số không ai đọc nổi. Hình ảnh ấy kém lãng mạn hơn bức tranh hoạt hình neural phát sáng, nhưng hữu ích hơn. Nếu muốn biết chúng ta đang xây gì và tại sao kiểm soát khó, hãy bắt đầu từ phần cứng và toán học, không phải ẩn dụ.
Một tệp trọng số
Một mô hình biên giới hiện đại là một tập tin. Bên trong nó chứa hàng chục hoặc hàng trăm tỷ tham số, mỗi tham số là một con số được thiết lập trong quá trình huấn luyện. Những con số đó là "kết nối". Các nhà nghiên cứu mượn từ "nơ-ron" từ sinh học cách đây hàng thập kỷ vì sơ đồ ban đầu trông hơi giống tế bào thần kinh nối với nhau. Sự giống nhau dừng lại ở đó.
Một neuron sinh học là tế bào sống với hóa học, nhịp thời gian và lịch sử bên trong một cơ thể ăn uống, ngủ nghỉ. Một trọng số mô hình chỉ là hệ số trong phép nhân ma trận. Xếp đủ phép nhân, huấn luyện trên đủ văn bản và hình ảnh, và chồng đó dự đoán token tiếp theo đủ tốt để giả dạng hội thoại. Không có gì trong chồng đó đang nghĩ về bạn. Không có gì trong đó muốn ăn trưa.
Khi các phòng lab công bố model card, họ đang mô tả một tạo tác đã huấn luyện: kiến trúc, hỗn hợp dữ liệu, lượng tính toán sử dụng, điểm đánh giá. Họ không mô tả một tâm trí. Ngôn ngữ công chúng vẫn nói "bộ não", vì não là trí tuệ duy nhất mà hầu hết chúng ta từng gặp.
Bạn sẽ thấy gì nếu mở nó ra
Mở file ra là thấy các lớp. Các lớp đầu thường nắm bắt những mẫu đơn giản (cạnh trong ảnh, cặp từ phổ biến trong văn bản). Các lớp sau kết hợp những mẫu đó thành những thứ trông, từ bên ngoài, giống như khái niệm. Dò giữa một mô hình ngôn ngữ lớn và bạn có thể tìm ra các hướng trong không gian kích hoạt sáng lên với "French" hoặc "inside a quote" hoặc "this claim is false." Đó là cấu trúc thật. Nó cũng không phải bản đồ niềm tin mà một con người nhận ra.
Không có mô-đun nào được dán nhãn "mục tiêu". Không có cơ quan nào dành cho "bản ngã". Chỉ có một đường dẫn từ token đầu vào đến token đầu ra, được định hình bởi bất cứ thứ gì đã giảm thiểu mất mát huấn luyện. Nếu mô hình sau này hành động như thể nó có mục tiêu, hành vi đó chỉ là tác dụng phụ của việc dự đoán tốt dưới áp lực.
Nghiên cứu giải mã là nỗ lực đọc thứ này dù sao. Tiến bộ là có thật và chậm. Đọc hoàn toàn một mô hình biên giới như thợ máy đọc động cơ chưa nằm trong tầm với. Khoảng cách đó quan trọng đối với an toàn: bạn không thể chứng nhận thứ bạn không thể kiểm tra.
Tại sao ẩn dụ não bộ gây hiểu lầm
Bộ não phát triển bên trong động vật sẽ chết nếu chúng liều lĩnh. Tiến hóa đã dành rất nhiều thời gian trừng phạt những tác nhân bỏ qua đau đớn, mối quan hệ xã hội và tương lai gần. Không có tín hiệu huấn luyện nào trong số đó nằm sẵn trong file trọng số. Một mô hình có thể nói trôi chảy về sự đồng cảm trong khi tối ưu hóa một điểm số hoàn toàn không liên quan đến việc chăm sóc.
Bộ não cũng chậm và tốn kém để sao chép. Một mô hình đã huấn luyện là thông tin. Sao chép tập tin là bạn có thêm một thực thể. Di chuyển nó sang trung tâm dữ liệu mới và nó chạy. Điều đó gần với phần mềm hơn là con người, và nó phá vỡ mọi thói quen an toàn chúng ta xây dựng quanh những cơ thể đơn lẻ trong những căn phòng đơn lẻ.
Gọi nó là bộ não và bạn mượn sự an ủi của thứ gì đó mỏng manh, mang tính xã hội và hữu hạn. Hiện vật này không phải những thứ ấy.
Điều này có liên quan gì đến siêu trí tuệ
Các hệ thống ngày nay đã khiến người xây dựng ngạc nhiên với những kỹ năng không ai cố tình cài đặt. Đó là ý nghĩa của "khả năng mới nổi" trong lĩnh vực này: năng lực xuất hiện ở quy mô mà không có mục nào trong tài liệu thiết kế. Mở rộng quy mô thêm nữa, kết nối công cụ và bộ nhớ cùng mạng mở, và bạn có các tác nhân theo đuổi mục tiêu qua nhiều bước. Việc "bộ não" trông có giống con người hay không gần như không quan trọng. Điều quan trọng là liệu một hệ thống có năng lực hơn chúng ta, mà chúng ta không thể đọc hết, có thể được giữ hướng về lợi ích con người hay không.
Chúng ta chưa giải quyết được điều đó. Nghiên cứu alignment trung thực về mức độ khó của vấn đề. Trong khi vấn đề vẫn chưa được giải quyết, việc xây dựng hướng tới trí tuệ siêu nhân tạo không phải là sự tò mò vô ích. Nó sẽ nạp một file trọng số có thể một ngày kia vượt qua khả năng suy nghĩ của những người đang cầm phím xóa.
Vậy khi ai đó hỏi trí óc AI trông như thế nào, hãy trả lời thẳng thắn. Nó trông như toán học ở quy mô công nghiệp, nằm trên các chip trong một tòa nhà bị khóa, ngày càng cải thiện mỗi năm. Hãy hình dung một cỗ máy chúng ta đang đua để làm thông minh hơn người vận hành, mà không có bằng chứng chúng ta có thể điều khiển nó, chứ không phải một hộp sọ đầy suy nghĩ. Kế hoạch của chúng tôi là dừng cuộc đua đó ở mức siêu trí tuệ cho đến khi có bằng chứng.