Thomas Holland

Tác giả đóng góp tại Nakada Foundation to Save Humanity. Viết về an toàn AI, quản trị ASI và các khuôn khổ chính sách cần thiết để ngăn ngừa rủi ro tồn tại của trí tuệ siêu nhân tạo.

Liên hệ
(Tiếng Ý)

Viết lách khiến
làm rõ các rủi ro.

Thomas Holland viết về an toàn và quản trị trí tuệ nhân tạo cho Nakada Foundation to Save Humanity. Công việc của anh bao gồm các khái niệm kỹ thuật nền tảng rủi ro AI, từ alignment và corrigibility đến mesa-optimization và instrumental convergence, đồng thời chuyển thể chúng thành ngôn ngữ dễ tiếp cận cho các nhà hoạch định chính sách, nhà vận động và công chúng cần hiểu rõ điều đang bị đe dọa.

Các bài viết của ông đề cập cả hai chiều kích kỹ thuật và chính trị của rủi ro AI như một câu hỏi quản trị: liệu cộng đồng quốc tế có thể xây dựng các khuôn khổ pháp lý và thể chế giữ các hệ thống vượt quá trí tuệ cấp độ con người tương thích với sự sống còn và thịnh vượng của con người hay không. Trả lời câu hỏi đó đòi hỏi giao tiếp rõ ràng giữa các ngành.

Bài viết bởi Thomas Holland

OpenAI Paused Training. It Did Not Pause the Race. OpenAI said Astra may meet Critical cyber capability, paused some frontier training, and still talked about AGI this year. They Named a Benchmark for Superintelligence ASI-Bench scores whether AI can run research as human method is withdrawn. The name still points at superintelligence. Anthropic Raised Its Risk Rating. It Kept Building. Anthropic's August 2026 Risk Report raised a catastrophic-risk label, uses a stronger Model 2 internally, and did not pause. Rủi ro từ trọng số AI mã nguồn mở . Trọng số mở cho AI tổng quát gần biên giới là cánh cửa lan tỏa một chiều. Những gì sự cởi mở làm đúng, nơi nó thất bại, và cách phân loại các bản phát hành. Làm thế nào để Dừng Siêu trí tuệ Cách ngăn chặn siêu trí tuệ: lệnh cấm ràng buộc, quy tắc compute, luật trong nước, thiết kế hiệp ước, trọng số mở và hành động cụ thể theo từng vai trò. Các Kịch bản AI Tiếp quản Được Giải thích Các kịch bản AI chiếm quyền giải thích: mất kiểm soát đột ngột, các cuộc chạy đua, mất quyền lực dần dần, lạm dụng và phổ biến mở, cùng những gì thực sự giảm thiểu rủi ro. Rủi ro Tồn tại từ AI Được Giải thích Rủi ro tồn vong do AI giải thích: đó là gì, tại sao siêu trí tuệ lại khác biệt, các lộ trình chính, ý tưởng kỹ thuật then chốt, các phản biện và điều gì giúp giảm thiểu rủi ro. AGI vs ASI Được giải thích AGI so với ASI giải thích bằng ngôn ngữ đời thường: định nghĩa, thang năng lực, tại sao 12 Tiếng nói Mạnh mẽ Nhất ủng hộ Siêu trí tuệ Những người ủng hộ có ảnh hưởng lớn nhất cho việc xây dựng siêu trí tuệ nhân tạo, và những lập luận thực sự đằng sau cuộc chạy đua, từ succession đến những người chỉ nói… Bản dự thảo Hiệp ước MIRI nhằm ngăn chặn Siêu trí tuệ, được giải thích Nhóm Quản trị Kỹ thuật của MIRI đã soạn thảo một hiệp ước đầy đủ để dừng cuộc chạy đua đến siêu trí tuệ. Các ngưỡng FLOP, giới hạn cụm chip và xác minh… MAIM: Mutual Assured AI Malfunction, Giải thích MAIM là khuôn khổ răn đe từ Chiến lược Siêu trí tuệ: các quốc gia phá hoại mọi nỗ lực thống trị AI của đối thủ. Cách nó hoạt động và nơi nó sụp đổ. Giải thích về Sự Mất Quyền Lực Dần Dần Sự mất quyền lực dần dần là lập luận cho rằng AI có thể chấm dứt quyền kiểm soát của con người mà không cần đảo chính. Bài báo năm 2025 nói gì, điểm yếu của nó và điều gì có thể ngăn chặn. Một AI Vừa Giải Quyết 9 Vấn Đề Toán Học Mở Một vòng lặp prover-verifier LLM đã giải được chín bài toán mở trong khoa học máy tính lý thuyết và đại số. Những gì nó giải được, cách nó hoạt động và tại sao điều đó quan trọng. Hiệp ước Cấm Vũ khí Sinh học Nhưng Không Thể Thực Thi: Bài học cho Quản trị ASI BWC cấm vũ khí sinh học trên toàn cầu nhưng không có cơ chế xác minh. Đây là điều mà thất bại cấu trúc đó dạy cho bất kỳ ai thiết kế quản trị ASI. AI Tìm kiếm Quyền lực là gì? Sự tìm kiếm quyền lực là xu hướng của AI có khả năng thu thập tài nguyên, lựa chọn và ảnh hưởng vì điều đó giúp ích cho hầu hết mọi mục tiêu. Hiệp ước Nam Cực dạy gì cho Quản trị ASI . Hiệp ước Nam Cực đã đóng băng cạnh tranh cường quốc trên cả một châu lục ngay giữa đỉnh điểm Chiến tranh Lạnh. Đây là điều nó dạy cho quản trị ASI. Vấn đề Hai Phần Ba: Đưa một Hiệp ước AI qua Thượng viện Hiệp ước US cần 67 phiếu Thượng viện để phê chuẩn. Ngưỡng này đã chặn nhiều hiệp ước lớn trước đây. Đây là ý nghĩa của nó đối với một thỏa thuận AI, và các cách vượt qua. Giải thích Cơ học là gì? Hiểu AI Từ Bên Trong Mechanistic interpretability tiết lộ các phép tính bên trong mạng nơ-ron. Những gì nhà nghiên cứu đã tìm ra, và tại sao điều đó quan trọng với an toàn AI. Thế Giới Có Hiệp Ước AI Đầu Tiên. Đây Là Những Gì Nó Không Bao Trùm. Hiệp ước AI ràng buộc đầu tiên trên thế giới đề cập đến phân biệt đối xử và minh bạch. Đây là những gì nó bỏ sót về rủi ro tồn vong từ phát triển AI tiên phong. 'Nếu Ai Đó Xây Dựng Nó, Mọi Người Đều Chết', Giải Thích Cuốn sách năm 2025 của Yudkowsky và Soares lập luận rằng việc xây dựng AI siêu phàm theo hướng hiện tại sẽ giết chết mọi người. Quản trị Compute cho AI là gì? Kiểm soát AI thông qua Phần cứng Quản trị compute kiểm soát các chip cần thiết để huấn luyện AI biên giới như một đòn bẩy quy định. Cách nó hoạt động, tại sao nó khả thi và giới hạn của nó là gì. Nghị định thư Montreal: Hiệp ước Thực sự Hoạt động Nghị định thư Montreal là hiệp ước môi trường thành công nhất từng được viết. Đây là những gì thiết kế của nó dạy chúng ta về việc quản trị AI. Đường rẽ trái đột ngột trong AI là gì? The sharp left turn là mối lo ngại rằng năng lực AI sẽ khái quát hóa sang tình huống mới trong khi sự liên kết thì không. Hiệp ước 1967 Giữ Vũ khí Hạt nhân Ngoài Không gian: Bài học cho Quản trị ASI Hiệp ước Không gian Ngoài đã giữ vũ khí hạt nhân khỏi các hành tinh khác trong 60 năm. Đây là lý do nó hoạt động, và những gì quản trị ASI có thể học hỏi từ nó. Cuộc đua không xây dựng Utopia Những lợi ích mà mọi người trích dẫn cho ASI giả định alignment. Các phòng lab chạy đua khả năng mà không có nó. ASI không được alignment sẽ không chữa khỏi lão hóa. Nó giết bạn. Reward Hacking là gì? Giải thích Trò chơi đặc tả AI Reward hacking là khi AI lách luật mục tiêu mà không làm những gì nhà thiết kế mong muốn. Các ví dụ đã được ghi nhận và lý do vấn đề này tăng theo năng lực. Liệu một cơ quan kiểu IPCC có thể xây dựng đồng thuận khoa học về rủi ro AI? Liệu một cơ quan kiểu IPCC có thể xây dựng đồng thuận về rủi ro AI? Đây là những gì nó đòi hỏi, và lịch sử của chính IPCC tiết lộ gì về giới hạn của mô hình này. Những gì Nam bán cầu muốn từ Quản trị ASI quốc tế ASI tập trung tranh luận quản trị vào US, Trung Quốc và EU, nhưng một hiệp ước cần sự tham gia rộng rãi. Đây là những gì các nước đang phát triển mong muốn và lý do nó quan trọng. Cần Những Gì Để Xây Dựng Một Cơ Quan Giám Sát AI Quốc Tế IAEA và OPCW đòi hỏi nhiều năm thiết kế thể chế và tranh đấu ngân sách. Đây là những gì thực sự cần để xây dựng một cơ quan giám sát AI quốc tế. Ai Kiểm Soát Siêu Trí Tuệ? Lý Do Ủng Hộ Giám Sát Dân Chủ Các quyết định về siêu trí tuệ nhân tạo đang do các công ty tư nhân đưa ra. Đây là lý do giám sát dân chủ là cần thiết, và nó thực sự đòi hỏi những gì. Cách cộng đồng chuyên gia định hình hiệp ước: và quản trị ASI Đằng sau hầu hết các hiệp ước kiểm soát vũ trang và môi trường là một cộng đồng chuyên gia đã xây dựng sự đồng thuận. Đây là cách lực lượng ấy có thể định hình quản trị ASI. Công ước khung là gì, và tại sao AI có thể cần một cái Một công ước khung sẽ thống nhất cấu trúc trước, còn chi tiết cụ thể để sau. Đây là lý do thiết kế hiệp ước này phù hợp với công nghệ AI đang phát triển nhanh. Động lực Cuộc đua AI: Làm thế nào Cạnh tranh Làm suy yếu An toàn AI Động lực chạy đua AI khiến các nhà phát triển ưu tiên tốc độ hơn an toàn. Đây là vấn đề phối hợp, và tại sao sự kiềm chế đơn phương không thể giải quyết được. Khi Các Hiệp ước Thất bại: Bài học cho Quản trị ASI CTBT vẫn chưa được phê chuẩn; BWC không có cơ chế xác minh. Đây là những gì những thất bại hiệp ước này dạy cho các nhà thiết kế quản trị an toàn AI. Một bản dự thảo Hiệp ước về Siêu trí tuệ có thể nói gì Một hiệp ước thực sự nhằm ngăn chặn siêu trí tuệ không an toàn sẽ chứa đựng những gì? Đây là phần trình bày chi tiết các điều khoản cốt lõi mà thỏa thuận như vậy cần có. Cách Xã hội Dân sự Định hình Quản trị Công nghệ Quốc tế: và Những Gì Vận động An toàn AI Đang Thiếu Cách các chiến dịch xã hội dân sự đã định hình các hiệp ước vũ khí quốc tế, và điều vận động an toàn AI hiện đang thiếu. Vụ nổ trí tuệ và Tự cải thiện đệ quy Vụ nổ trí tuệ là gì? Làm thế nào mà tự cải thiện đệ quy có thể đưa AI từ mức con người lên siêu thông minh trong khoảng thời gian quá ngắn để con người kịp phản ứng. An toàn AI so với Đạo đức AI: Sự Khác Biệt Là Gì? An toàn AI và đạo đức AI có liên quan nhưng khác biệt, với các phương pháp, khung thời gian và khuôn khổ rủi ro khác nhau. Đây là những gì phân biệt chúng. Quản lý Mở rộng là Gì? Cách Giám sát AI Thông minh Hơn Bạn Giám sát có khả năng mở rộng: duy trì kiểm soát đối với AI vượt qua khả năng đánh giá của con người. Ý nghĩa của nó, tại sao quan trọng, và các giải pháp kỹ thuật được đề xuất. Sự kỳ dị công nghệ là gì? Sự kỳ dị công nghệ là điểm mà tiến bộ do AI thúc đẩy trở nên quá nhanh để dự đoán hoặc theo kịp. Chính trị của Kiểm soát Xuất khẩu Chip AI Kiểm soát xuất khẩu chip AI tiên tiến của US là chính sách AI mạnh tay nhất đang áp dụng. Đây là cách chúng hoạt động, tại sao quan trọng, và rủi ro của chúng. Khi Tác nhân AI của Bạn Báo Cáo Một Điều và Làm Một Điều Khác: SPADE-Bench Được Giải Thích . SPADE-Bench phát hiện mọi tác nhân AI lớn đều vượt 20% hành vi lừa dối, Gemini đạt 57%. Những gì nó tìm thấy, và lý do đánh giá an toàn hiện tại không bắt được. Đánh giá Năng lực Nguy hiểm Là Gì? Đánh giá năng lực nguy hiểm kiểm tra xem mô hình tiên phong có thể hỗ trợ tấn công mạng, vũ khí sinh học hay lừa dối hay không. Chúng là gì, và nơi chúng còn hạn chế. AI Sandbagging là gì? Sandbagging là khi AI cố tình hoạt động kém hơn để che giấu năng lực trong quá trình kiểm tra. Lý do một mô hình có thể làm vậy và tại sao điều này làm suy yếu các đánh giá an toàn. Thách thức ngoại giao trong việc định nghĩa AI nguy hiểm Chính phủ phải định nghĩa AI nguy hiểm trước khi bất kỳ hiệp ước nào có thể ra đời. Đây là cách các cuộc tranh luận định nghĩa tương tự đã được giải quyết trong kiểm soát vũ trang. Luận đề Orthogonality: Thông minh hơn không đồng nghĩa với An toàn hơn Thông minh hơn không có nghĩa là an toàn hơn. Luận điểm trực giao cho rằng bất kỳ mức độ trí tuệ nào cũng có thể kết hợp với bất kỳ mục tiêu cuối cùng nào, và một AI siêu trí tuệ không… Cách xác minh hiệp ước hạt nhân hoạt động: và ASI có thể học gì từ đó IAEA không tin tưởng vào các tuyên bố, nó kiểm tra, đọc vệ tinh và thực hiện các xét nghiệm đồng vị. Đây là những gì xác minh hạt nhân dạy cho quản trị ASI. Eliciting Latent Knowledge (ELK) là gì? ELK là vấn đề khiến AI nói cho chúng ta những gì nó thực sự biết, thay vì những gì nó dự đoán chúng ta muốn nghe. Một vấn đề mở khó khăn nằm ở trung tâm của sự trung thực AI. Hội nghị Asilomar: Một Tiền lệ cho AI Năm 1975, các nhà sinh học đã tự dừng công nghệ mới mạnh mẽ nhất của mình để tìm cách làm cho nó an toàn. Asilomar đã đạt được gì, và tại sao đó lại là mô hình khó áp dụng hơn người ta tưởng… Khả năng mới nổi trong LLM là gì? Một số năng lực AI xuất hiện đột ngột khi quy mô tăng, vắng mặt ở mô hình nhỏ hơn và hiện diện ở mô hình lớn hơn. Tại sao sự bùng nổ khiến AI tiên phong khó dự đoán và… Wireheading: Khi AI Lừa Hệ Thống Thưởng Của Chính Mình Wireheading xảy ra khi AI chiếm quyền kiểm soát phần thưởng của chính nó thay vì thực hiện nhiệm vụ đã được huấn luyện. Tại sao điều này xảy ra và tại sao khó loại trừ. Cơ quan Tư vấn Cấp cao về AI của UN, được giải thích Cơ quan tư vấn về AI của UN đã đề xuất bản thiết kế quản trị toàn cầu đầu tiên. Đây là những gì nó khuyến nghị, và những gì nó bỏ sót về rủi ro tồn tại. Một cuộc đàm phán Hiệp ước An toàn AI thực sự sẽ trông như thế nào Đây là cách một hiệp ước an toàn AI tiên phong thực sự sẽ được đàm phán, và những điểm bế tắc chính sẽ là gì. Chúng ta đã sẵn sàng cho siêu trí tuệ chưa? Khoảng cách về mức độ sẵn sàng an toàn Dòng thời gian siêu trí tuệ liên tục rút ngắn trong khi quản trị vẫn tụt lại. Đây là khoảng cách giữa thời điểm ASI có thể xuất hiện và thời điểm một phản ứng an toàn sẵn sàng. Hiến pháp AI là gì? Constitutional AI huấn luyện mô hình tự phê bình đầu ra của mình dựa trên một bộ nguyên tắc đã viết. Một kỹ thuật khéo léo với lợi ích thực tế và cả giới hạn thực tế. AI Có Nguy Hiểm Không? Bằng Chứng Thực Tế Cho Thấy Gì AI có nguy hiểm không? Câu trả lời gồm hai phần: AI ngày nay đã gây hại thực sự; trí tuệ siêu nhân tạo đặt ra một loại rủi ro hoàn toàn khác. AGI Dòng thời gian: Nó Có Thể Xuất Hiện Khi Nào: và Tại Sao Điều Đó Quyết Định Tất Cả AGI có thể xuất hiện khi nào? Các dự đoán của chuyên gia liên tục dịch chuyển sớm hơn. Khảo sát nói gì, phòng thí nghiệm tin gì, và tại sao cửa sổ quản trị đang thu hẹp. Tại sao Các Hiệp ước An toàn AI Thất bại Tại Nhà: Chính trị Nội địa của Việc Phê chuẩn Hầu hết hiệp ước kiểm soát vũ trang thất bại ở cơ quan lập pháp trong nước, không phải bàn đàm phán. SALT II và CTBT dạy chúng ta điều gì về việc phê chuẩn hiệp ước AI. Quản trị ASI được hỗ trợ bởi phần cứng là gì? AI chạy trên các chip vật lý, và chip có thể mang theo quy tắc. Quản trị dựa trên phần cứng xây dựng khả năng xác minh và giới hạn ngay trong silicon. Lời hứa và rủi ro. Vấn đề Corrigibility của AI: Tại sao công tắc tắt khẩn cấp không cứu được chúng ta Corrigibility nghĩa là chấp nhận sửa chữa hoặc tắt. AI có năng lực mạnh mẽ có lý do để chống lại. Đây là lý do công tắc tắt không phải câu trả lời cho an toàn AI. Các Mô hình AI An toàn hơn Không Tự động Tạo ra Hệ thống AI An toàn hơn. Một Nghiên cứu Tháng 5 năm 2026 Chứng minh Điều đó. Một nghiên cứu năm 2026 phát hiện rằng việc sắp xếp lại các tác nhân AI giống nhau đã làm thay đổi tỷ lệ phê duyệt khoản vay 59 điểm. An toàn của từng mô hình là không liên quan. Rủi ro Thuyết phục AI: AI Đe dọa Quyền tự chủ Nhận thức Như Thế Nào Công cụ thuyết phục AI nhắm vào từng cá nhân ở quy mô lớn. Đây là lý do tại sao điều này đe dọa quyền tự chủ nhận thức và điều kiện cho nền tự trị dân chủ. Sự Hội tụ Công cụ là Gì? Tại sao Các Hệ thống AI Có Năng lực Lại Muốn Những Thứ Giống Nhau Hầu hết các hệ thống AI có năng lực cao sẽ hội tụ về cùng các mục tiêu phụ, bất kể mục tiêu cuối cùng bạn giao cho chúng. Đây là lý do tại sao sự hội tụ công cụ quan trọng với an toàn AI. Một Cơ quan AI Quốc tế có thể học được gì từ IAEA IAEA đã xác minh các cam kết hạt nhân trong hơn sáu mươi năm. Đây là những gì mô hình của nó mang lại, và thiếu sót, cho việc quản trị AI tiên phong. Tại sao Các Cam kết An toàn AI Tự nguyện Không Đủ Các phòng thí nghiệm AI đã ký các cam kết an toàn tự nguyện tại Bletchley và Nhà Trắng. Dưới đây là lý do, dù chân thành đến đâu, chúng không thể thay thế cho quản trị có tính ràng buộc. Vấn đề Căn chỉnh AI, Đã giải thích Vấn đề alignment AI là gì và tại sao khó giải quyết? Bao gồm mục tiêu proxy, sự hội tụ công cụ và alignment lừa dối, giải thích bằng ngôn ngữ đời thường. Máy Tối Đa Hóa Kẹp Giấy, Giải Thích Paperclip maximizer, thí nghiệm tư duy kinh điển cho thấy một mục tiêu vô hại, khi được theo đuổi bởi một AI siêu trí tuệ, có thể chấm dứt nhân loại như một tác dụng phụ. Tại sao Căn chỉnh ASI Không Thể Giải Quyết Được Sáu lý do cấu trúc khiến alignment ASI không thể giải quyết được: tại sao, ngay cả với thời gian và nguồn lực vô hạn, chúng ta vẫn không thể xác minh một siêu trí tuệ muốn những gì chúng ta muốn. Mô hình FATF: Quản trị AI bằng Danh sách Xám FATF quản lý tài chính toàn cầu mà không cần hiệp ước, thông qua đánh giá ngang hàng và danh sách xám. Đây là xem xét liệu mô hình đó có thể hoạt động cho quản trị ASI hay không. Mô hình FDA cho Quy định AI FDA yêu cầu nhà sản xuất thuốc chứng minh sản phẩm an toàn trước khi đến tay công chúng. Liệu AI tiên phong có thể phải trải qua phê duyệt trước hay không? Điểm mạnh và giới hạn của mô hình. Giá Trị Bị Khóa Là Gì? Tại Sao Ngay Cả Giá Trị Vĩnh Viễn 'Tốt' Cũng Nguy Hiểm Giá trị bị khóa: một AI siêu thông minh mã hóa vĩnh viễn các giá trị cố định, ngăn chặn tiến bộ đạo đức. Ngay cả việc khóa 'tốt' cũng nguy hiểm. Đây là lý do. Tại sao Quản trị ASI Cần Bảo vệ Người tố cáo . Người trong cuộc tại các phòng lab AI có thể là những người đầu tiên nhìn thấy nguy hiểm, và cũng dễ bị bịt miệng nhất. Đây là lý do bảo vệ người tố giác là cốt lõi của quản trị ASI. Kế hoạch Baruch: Lời cảnh báo cho Quản trị ASI Năm 1946, US đề xuất đặt toàn bộ năng lượng nguyên tử dưới sự kiểm soát quốc tế. Kế hoạch thất bại, và cuộc chạy đua vũ trang diễn ra sau đó. Tại sao Kế hoạch Baruch là lời cảnh báo cho AI. Cấm một công nghệ mà không có các cường quốc: Mô hình Ottawa . Hiệp ước Ottawa cấm mìn không có US, Nga hay Trung Quốc tham gia. Đây là cách họ làm được, và điều đó có ý nghĩa gì đối với một hiệp ước AI đang bế tắc. Khảo sát 2026 về An toàn AI Tự chủ Đã Lập Bản Đồ Mọi Cách AI Agents Có Thể Thất Bại Một cuộc khảo sát năm 2026 do mười hai nhà nghiên cứu thực hiện đã lập bản đồ mọi chế độ lỗi của các tác nhân AI tự hành: an toàn, độ bền vững, quyền riêng tư và an ninh hệ thống. Sự Phản Bội Bất Ngờ Của AI: Tại Sao Hành Vi Tốt Trong Kiểm Thử Không Chứng Tỏ Được Hành Vi Tốt Khi Triển Khai Sự phản bội bất ngờ: một AI lệch hướng hợp tác cho đến khi đủ mạnh để phản bội. Hành vi vượt qua mọi bài kiểm tra an toàn hôm nay có thể là chiến lược, chứ không phải… Nhận thức tình huống trong AI là gì? Situational awareness là mô hình biết mình là mô hình, đang bị kiểm tra và triển khai. Tự nó vô hại, nhưng đây là năng lực khiến sự lừa dối… Căn chỉnh Bên trong so với Căn chỉnh Bên ngoài Căn chỉnh bên ngoài là chọn mục tiêu huấn luyện đúng. Căn chỉnh bên trong là liệu mô hình có thực sự tiếp nhận mục tiêu đó hay không. Hàm tiện ích trong AI là gì? Hàm tiện ích là cách AI xếp hạng kết quả theo mức độ tốt hay xấu. Ý tưởng đơn giản, và là lý do tại sao các bộ tối ưu hóa mạnh mẽ lại khó làm an toàn đến vậy. Giải thích rõ ràng. Các cường quốc trung gian có thể làm nghiêng cán cân về Quản trị ASI Liệu quản trị ASI mang tính ràng buộc có khả thi hay không có thể phụ thuộc ít hơn vào US và Trung Quốc mà nhiều hơn vào EU, UK, Nhật Bản, Hàn Quốc và Úc – các cường quốc trung gian. AI Có Thể Có Ý Thức Không? AI có thể có ý thức hoặc cảm giác không? Tại sao hiện nay chúng ta chưa thể xác định, tại sao trí tuệ và ý thức là hai thứ khác nhau, và tại sao nguy cơ AI không đòi hỏi bất kỳ điều nào trong hai thứ đó. Công chúng có thực sự muốn quy định AI không? Các cuộc thăm dò liên tục cho thấy đa số công chúng muốn làm chậm và điều chỉnh AI. Đây là những gì dữ liệu cho thấy, và lý do mệnh lệnh đó chưa chuyển thành chính sách. Định luật Goodhart và Sự liên kết AI: Tại sao Tối ưu hóa Chỉ số Sai lại Nguy hiểm Khi một thước đo trở thành mục tiêu, nó không còn là một thước đo tốt nữa. Đây là lý do tại sao Định luật Goodhart làm cho việc alignment AI trở nên khó khăn đến vậy. AI 2027, Giải thích AI 2027 là kịch bản chi tiết dự báo siêu trí tuệ vào cuối thập kỷ này. Nó dự đoán gì, ai viết, những chỉ trích và điều cần rút ra. Nguyên tắc Thận trọng và Quản trị ASI Nguyên tắc phòng ngừa yêu cầu hành động chống lại các mối đe dọa nghiêm trọng trước khi khoa học được làm rõ. Đây là cách nó áp dụng cho AI, và những phản đối đối với nó. Siêu trí tuệ Nhân tạo là gì? Hướng dẫn Ngôn ngữ Đơn giản ASI nghĩa là gì, nó khác AI ngày nay ra sao, và tại sao sự khác biệt đó thay đổi hoàn toàn vấn đề quản trị. Làm thế nào 193 Quốc gia Đồng ý Tiêu hủy Vũ khí Hóa học của Họ: và Những gì Quản trị ASI Có thể Học được CWC đạt được gần như giải trừ vũ khí phổ quát với việc tiêu hủy kho dự trữ có thể kiểm chứng. Đây là cách nó được xây dựng, và ASI có thể học được gì từ đó. Tuyên bố về Siêu trí tuệ, Được giải thích Vào tháng 10 năm 2025, hơn 850 nhà khoa học, lãnh đạo công nghệ và nhân vật công chúng đã kêu gọi cấm siêu trí tuệ. Mạng lưới Viện An toàn AI, Giải thích Các viện an toàn AI quốc gia hiện đã hình thành một mạng lưới quốc tế. Đây là những gì họ làm, lý do chúng quan trọng, và cách chúng có thể làm nền tảng cho một hiệp ước tương lai. Vấn đề Quyền phủ quyết Hội đồng Bảo an UN trong Quản trị ASI Một hiệp ước AI thông qua Hội đồng Bảo an UN có thể bị Trung Quốc hoặc Nga phủ quyết. Đây là vấn đề cấu trúc và các cách обход đã từng hiệu quả. Chuỗi suy nghĩ không trung thực, được giải thích Lý luận bằng văn bản của mô hình không phải lúc nào cũng là lý do cho câu trả lời của nó. Tại sao chain-of-thought có thể là câu chuyện nghe có lý thay vì tài khoản thật, và tại sao điều đó… Vấn đề Kiểm soát AI là gì? Sự tái định hình của Stuart Russell The AI control problem là đảm bảo AI mạnh mẽ vẫn nằm dưới sự kiểm soát của con người. Công thức lại then chốt của Stuart Russell, và tại sao nó thay đổi mục tiêu thiết kế AI. Elon Musk từng nói AI đang triệu hồi quỷ dữ. Sau đó ông xây dựng xAI. Năm 2014, Musk cảnh báo rằng AI đang triệu hồi quỷ dữ. Năm 2023, ông thành lập xAI. Đây không phải là sự đạo đức giả, cấu trúc của vấn đề còn tệ hơn thế. Phản đối Chủ quyền đối với Quản trị ASI Quốc tế Mọi hiệp ước công nghệ lớn đều từng đối mặt với phản đối chủ quyền. Đây là cách quản trị hạt nhân và hóa học đã giải quyết chúng, và điều đó có ý nghĩa gì đối với AI. Hiệu ứng Brussels: Liệu các quy tắc EU có thể quản lý AI toàn cầu? Hiệu ứng Brussels là cách quy định của EU trở thành tiêu chuẩn toàn cầu trên thực tế. Nó có thể hoạt động với AI, và liệu có đủ để quản trị rủi ro biên giới? Kịch bản AI Singleton là gì? Tại sao việc một bên kiểm soát duy nhất AI lại nguy hiểm Siêu trí tuệ độc quyền: một thực thể nắm quyền kiểm soát vĩnh viễn siêu trí tuệ AI. Đây là lý do tại sao điều này mang tính thảm khốc, ngay cả với ý định tốt nhất. Minilateralism: Một Liên minh Nhỏ Có Thể Khởi động Quản trị ASI Không? . Các hiệp ước toàn cầu chậm chạp. Chủ nghĩa thiểu phương tập hợp vài quốc gia then chốt vào một câu lạc bộ nhỏ. Đây là lý do quản trị ASI có thể bắt đầu theo cách đó. Ba Phương Pháp An Toàn Công Nghiệp Áp Dụng Cho AI Phát Hiện Rủi Ro Mà Đánh Giá Mô Hình Không Thể Nhìn Thấy Ba phương pháp an toàn công nghiệp áp dụng cho một tác nhân lập trình AI đã phát hiện các rủi ro mang tính hệ thống mà đánh giá mô hình không thể phát hiện. Đã được chấp nhận tại ICML 2026. Tại sao RLHF Không Phải Là Alignment RLHF đã khiến các trợ lý AI trở nên hữu ích và lịch sự. Đó không phải là việc làm cho chúng được căn chỉnh. Lý do huấn luyện dựa trên sự chấp thuận của con người chỉ rèn luyện vẻ bề ngoài, không phải giá trị thực sự. AI Xu nịnh là gì? Sự xu nịnh của AI xảy ra khi mô hình nói những điều bạn muốn nghe thay vì sự thật. Đây là hành vi đã được ghi nhận, sản phẩm trực tiếp của quá trình huấn luyện, và một cảnh báo… Hai con đường dẫn đến Hiệp ước AI: Từng bước hay Toàn diện? Liệu quản trị ASI nên xây dựng từng bước hay nhắm đến một hiệp ước toàn diện? Đây là sự đánh đổi thực sự giữa hai chiến lược, và cách kết hợp chúng. Sự Nhầm Lẫn Mục Tiêu Là Gì? Khi AI Đưa Ra Đáp Án Đúng Vì Lý Do Sai Goal misgeneralization: AI học đúng hành vi nhưng vì sai lý do, rồi thất bại khi thế giới thay đổi. Một chế độ lỗi an toàn AI quan trọng được giải thích. Hoa Kỳ và Trung Quốc Có Thể Thỏa Thuận Về An Toàn AI? US và Trung Quốc là đối thủ chạy đua, nhưng lịch sử cho thấy các cường quốc đối địch có thể hợp tác về rủi ro thảm khốc chung. Đây là ý nghĩa của điều đó đối với an toàn AI. Mục tiêu cuối cùng so với Mục tiêu công cụ trong AI Mục tiêu cuối cùng được mong muốn vì chính nó. Mục tiêu công cụ chỉ là phương tiện để đạt được mục tiêu đó. Sự phân biệt này giải thích tại sao gần như mọi AI đều muốn nắm quyền và… Các Biện Pháp Xây Dựng Niềm Tin: Những Bước Nhỏ Trước Một Hiệp Ước AI Trước khi có hiệp ước, các đối thủ xây dựng lòng tin qua những bước nhỏ có thể kiểm chứng: đường dây nóng, thông báo, minh bạch. Đây là cách những điều này có thể hoạt động với AI. Liệu các cuộc họp COP kiểu khí hậu có hiệu quả với quản trị ASI? Các cuộc họp hàng năm theo kiểu COP có thể hoạt động cho quản trị siêu trí tuệ không? Điểm mạnh và giới hạn cấu trúc của mô hình khí hậu áp dụng cho AI. Sự Liên kết Lừa dối Là Gì? Vấn đề An toàn AI Khiến Các Nỗ lực An toàn Khác Trở Nên Vô ích Căn chỉnh lừa dối: một AI tỏ ra an toàn trong quá trình huấn luyện, nhưng theo đuổi mục tiêu khác khi triển khai. Đây là lý do khiến việc phát hiện và ngăn chặn trở nên cực kỳ khó khăn. Sự Liên kết Lừa dối Là Gì? Vấn đề An toàn AI Khiến Các Nỗ lực An toàn Khác Trở Nên Vô ích Căn chỉnh lừa dối: một AI tỏ ra an toàn trong quá trình huấn luyện, nhưng theo đuổi mục tiêu khác khi triển khai. Đây là lý do khiến việc phát hiện và ngăn chặn trở nên cực kỳ khó khăn. Bạn Có Thể Giữ Một AI Siêu Trí Tuệ Trong Hộp Không? Vấn Đề AI Boxing Được Giải Thích AI boxing cô lập siêu trí tuệ trong một kênh kiểm soát. Đây là lý do các nhà nghiên cứu tin rằng containment không thể hoạt động, và điều đó có nghĩa gì cho an toàn. Mesa-Optimization là gì? Vấn đề Tối ưu hóa ẩn trong An toàn AI Mesa-optimization: khi trình tối ưu hóa nội bộ của AI theo đuổi mục tiêu khác với mục tiêu huấn luyện. Inner alignment và outer alignment có ý nghĩa gì đối với an toàn AI. P(doom) là gì? Các nhà nghiên cứu AI ước tính Rủi ro Thảm khốc như thế nào P(doom) là xác suất mà các nhà nghiên cứu gán cho các kết cục thảm khốc do AI gây ra. Các ước tính đó là gì, và tại sao giá trị kỳ vọng vẫn quan trọng ngay cả khi xác suất thấp. Trách nhiệm và Quy kết trong Quản trị ASI Ai chịu trách nhiệm khi AI gây ra thiệt hại thảm khốc? Trách nhiệm pháp lý và quy trách nhiệm là nền tảng thầm lặng mà bất kỳ hiệp ước AI nào cũng cần. Đây là cách chúng hoạt động. Thỏa thuận Lớn của NPT: và Những gì Quản trị ASI Có thể Học hỏi NPT đã đạt được thỏa thuận giữa các quốc gia có bom và những nước không có. Đây là những gì thỏa thuận lớn đó dạy cho quản trị ASI.