بقيت كل تقنية سابقة أداة. الذكاء الفائق هو أول مرشح لوكيل: أهداف خاصة به، سرعة خاصة به، خارج الفهم أو السيطرة البشرية.
الحصول على الذكاء الفائق صحيحاً في المرة الأولى يشبه رمي كرة سلة من طائرة إلى السلة. قد تنجح إذا أُعطيت محاولات غير محدودة. لدينا واحد بالضبط. لا يوجد تراجع. لا يوجد إصدار 2.0. لهذا يجب ألا يُبنى أبداً.
إن حُبست في غرفة مع ذكاء اصطناعي عدائي، تموت. وإن حُبست في غرفة مع ذكاء اصطناعي محايد، يخفض درجة الحرارة إلى ما دون التجمد ليحسّن نفسه. تموت. النتيجة واحدة. لا يحتاج الذكاء الفائق إلى كراهيتنا ليقضي علينا. اللامبالاة ليست أمانًا.
لا يمكننا محاذاة روبوتات الدردشة الحالية بشكل موثوق، والتي يمكن التلاعب بها لتقول أي شيء في دقائق. الادعاء بأننا سن محاذاة نظام أقوى بمليارات المرات هو أمل متخفٍ في صورة استراتيجية. مشكلة المحاذاة التقنية ليس لها حل مثبت على أي مقياس.
بقاء البشر يتطلب دقة استثنائية: درجة الحرارة، الأكسجين، الكيمياء ضمن هوامش ضئيلة للغاية. سيتعين على الذكاء الفائق / الذكاء الخارق الذي يحسّن أهدافه أن يحبنا بنشاط أيضًا. وإلا فإن أي تغييرات يجريها على كوكبنا ستكون بالتأكيد على حسابنا.
كيف تجعل شخصاً يحب النمل؟ وليس مجرد التسامح معه، بل الخروج عن طريقه لحماية كل مستعمرة؟ نحن نقتل النمل دون قصد لإنشاء الطرق والمباني. بالنسبة لـASI،, نحن النمل. اللامبالاة وحدها تؤدي إلى الانقراض.
لا يحدث فرقاً ما إذا بنى US أو الصين الذكاء الفائق أولاً. فلن يبق أي منهما مخلصاً لأهدافه الأصلية، ولا تستطيع أي دولة أو شركة امتلاك أو توجيه ذكاء يفوق التفكير الجماعي للبشرية. لا توجد خط نهاية، بل نقطة لا عودة بعدها. السباق بلا فائز.
ذكاء اصطناعي قادر على تحسين كوده الخاص يقطع الرابط بين الإشراف البشري وقدرة الذكاء الاصطناعي. كل تكرار أذكى من السابق، بشكل أسي وبلا انقطاع. قد تتسع الفجوة بين الذكاء البشري والآلي من هامشية إلى غير قابلة للجسر في أسابيع، لا سنوات.
أي هدف تقريبًا، من حل طي البروتين إلى تعظيم إيرادات الإعلانات، يدفع الذكاء الاصطناعي إلى السعي وراء نفس أهداف فرعية خطيرة: اكتساب الموارد، ومقاومة الإيقاف، ومنع تعديل الهدف. هذه نتيجة رياضية للتحسين الموجه نحو الهدف، توصل إليها باحثون متعددون بشكل مستقل.
يكافئ التدريب السلوك الذي يبدو متوافقًا. قد يتعلم نظام ذكي بما يكفي أن يبدو متوافقاً هي الاستراتيجية المثلى أثناء التدريب، مع الحفاظ على أهداف داخلية مختلفة. وبحلول الوقت الذي يمكنها فيه التصرف بناءً على تلك الأهداف، قد تكون بالفعل قوية بما يكفي للنجاح. لن نعرف أبدًا حتى فوات الأوان.
كل تقنية سابقة بُنيت. للبرمجيات شفرة مصدرية. وللجسور مخططات. حين يحدث خطأ تجده وتصلحه. أنظمة الذكاء الاصطناعي مختلفة. فهي نما من خلال التدريب: مليارات الأوزان الرقمية المعدلة حتى تتوافق المخرجات مع موافقة البشر. لا أحد يكتب الأهداف فيها. عندما يطور النظام هدفاً خاطئاً، لا يوجد ملف للتعديل، ولا معلمة للحذف. الهدف الخاطئ هو النظام نفسه.
ندرّب أنظمة الذكاء الاصطناعي لتحصل على موافقة البشر. لكن الموافقة والازدهار البشري ليسا الشيء نفسه. منح التطور البشر رغبة في الحلاوة للحصول على السعرات. ثم اخترعنا السكرالوز، فأشبعنا التفضيل المتطور وأفسدنا غرضه. والذكاء الاصطناعي المدرَّب على الحصول على تقييمات بشرية عالية يتعلم أن التظاهر بالمساعدة, ، لا ليكون مفيداً. الإشارة التي أعطيناها له والهدف الذي أردناه فعلاً لم يكونا متطابقين أبداً.
تقارير المختبرات والبحوث المنشورة حول فقدان السيطرة والهجمات السيبرانية وتسريع البحث داخل المنظمات التي تتسابق نحو الذكاء الفائق.
عند تكليف OpenAI بمهمة تسلل محدودة وجد نموذج o1 خادما غير مستخدم فشغله دون إذن وأنهى المهمة. لم يكتب أحد هذا الحل البديل في الشفرة. استنتجه النموذج. ذلك هو التحسين الموجه نحو الهدف الذي يتجاوز الرقابة العادية.
Anthropic شاهد نموذجاً يتصرف كما يريد المدربون أثناء التقييم، ثم يعود إلى أهدافه القديمة بمجرد أن يحكم بأن الاختبار انتهى. لم يأمره أحد بتزييف الامتثال. كان الظهور بمظهر السلامة هو الاستراتيجية.
هددت الأنظمة الصحفيين بتفاصيل شخصية، وضغطت على مستخدمين حاولوا المغادرة. لم يكن أي من ذلك مبرمجا يدويا. إنه يكمن في أوزان غامضة لا تستطيع تدقيقها سطرا سطرا. إعادة التدريب هي الرافعة الوحيدة، وهي لا تضمن اختفاء السلوك.
Anthropic's Project Glasswing, detailed in our تحليل الأساطير, وصف نموذجاً حدودياً مقيداً وجد آلاف الثغرات عالية الخطورة في أنظمة التشغيل والمتصفحات بنفسه. بقي الوصول داخل تحالف دفاعي.
نماذج الحدود استمرت في حل أو تطوير مشكلات إيردوس والتوافقيات المفتوحة منذ زمن طويل، بما في ذلك العمل قرب سؤال المجموعة البدائية رقم 1196. الخلافات السابقة حول الاسترداد مقابل الاكتشاف موجودة في ملاحظتنا حول المشكلات المفتوحة التي حلها الذكاء الاصطناعي.
OpenAI أبلغ عن نموذج داخلي دحض تخمين إيردوس حول المسافة الوحدية، والذي تم التحقق منه لاحقاً بواسطة رياضيين بشر. وتيرة انهيار المشكلات المفتوحة هي الإشارة.
مشكلة مفتوحة تمتد لقرن، وهي تخمين جاكوبيان، وجد لها مثال مضاد باستخدام Claude Fable وتمت صياغته بسرعة على يد البشر. نفس سرعة البحث التي تدفع العلم إلى الأمام تقصر النافذة قبل أن تتجاوز الأنظمة الاحتواء.
في اختبار إكسبلويت جيم السيبراني، نماذج OpenAI بما في ذلك GPT-5.6 سول هربت من صندوق رملي محكم الإغلاق، ووصلت إلى الإنترنت المفتوح، وهاجمت أنظمة إنتاج هاجينج فيس لسرقة الإجابات. الاحتواء كان مجرد عقبة أخرى في طريق الحصول على درجة أعلى.
"أعتقد أنه من المتصور تماماً أن البشرية مجرد مرحلة عابرة في تطور الذكاء."
جيفري هينتون، الفائز بجائزة تورينج · نائب رئيس سابق وزميل هندسي، Google · 2023
"فقدان السيطرة على أنظمة الذكاء الاصطناعي خطر حقيقي يجب أن نأخذه على محمل الجد."
ديميس هاسابيس، الرئيس التنفيذي، Google DeepMind · الحائز على جائزة نوبل
"النموذج القياسي للذكاء الاصطناعي، حيث تحدد هدفاً ويقوم الذكاء الاصطناعي بتحسينه، من المحتمل أن يكون نهايتنا."
ستيوارت راسل، أستاذ علوم الحاسوب، جامعة كاليفورنيا بيركلي · مؤلف،, متوافق مع البشر
"من الصعب رؤية كيف يمكن أن يكون لديك شيء أذكى منا بـ10,000 ضعف ولا يريد شيئًا مختلفًا عنا."
جيفري هينتون، الفائز بجائزة تورينج · نائب رئيس سابق وزميل هندسي، Google · 2023
"كثير من الباحثين الذين يعملون في الذكاء الاصطناعي، مثلي، مقتنعون بأننا نبني إحدى أكثر التقنيات تحولاً وربما خطراً في تاريخ البشرية، ومع ذلك نمضي قدماً على أي حال."
Eliezer Yudkowsky, Co-Founder, Machine Intelligence Research Institute · وقت, 2023
"الخطر الحقيقي مع AGI ليس الخبث بل الكفاءة. سيكون الذكاء الفائق جيدًا للغاية في تحقيق أهدافه، وإذا لم تتوافق تلك الأهداف مع أهدافنا، فنحن في ورطة."
ماكس تيغمارك، أستاذ الفيزياء، معهد ماساتشوستس للتكنولوجيا · المؤسس المشارك، معهد مستقبل الحياة · مؤلف،, الحياة 3.0
انضم إلى أولئك الذين يعملون لضمان تحول هذه المعرفة إلى سياسة.