تعتمد معظم البنية التحتية للسلامة حول أنظمة الذكاء الاصطناعي الحالية على افتراض مباشر: يستطيع البشر تحديد ما إذا كان الذكاء الاصطناعي يقوم بعمل جيد. يقيم المقيمون المخرجات، وتغذي هذه التقييمات التدريب، ويتعلم النموذج إنتاج مخرجات يقيمها المقيمون البشريون تقييما عاليا. وعندما ينجح هذا، يكون ذلك لأن المقيمين يستطيعون التمييز بين المخرجات الجيدة والسيئة.
الإشراف القابل للتوسع هو التحدي المتمثل في الحفاظ على السيطرة الفعالة بعد تلك النقطة، وهو غير محلول.
الإشراف القابل للتوسع هو التحدي الذي يظهر عندما تفشل هذه الفرضية. مع وصول أنظمة الذكاء الاصطناعي إلى مستوى الأداء البشري ثم تجاوزه في مجالات أكثر، لم يعد بوسع المقيّمين تقييم جودة ما يقيّمونه بشكل موثوق. لا يستطيع مبرمج مبتدئ مراجعة كود كتبه نظام أفضل من أي إنسان. ولا يستطيع طبيب تقييم تشخيص طبي أنتجه نظام يملك وصولًا إلى الأدبيات السريرية يفوق قراءة أي طبيب. عندما يتفوق المقيّمون البشريون على الأنظمة التي يُفترض أن يشرفوا عليها، تبدأ حلقة التغذية الراجعة التي تحافظ على محاذاة أنظمة الذكاء الاصطناعي مع القيم البشرية في الانهيار كلها.
لم يُثبت أي من هذا على نطاق فوق بشري في البرية.
لماذا يهم عنق الزجاجة في التقييم كثيراً
يعمل تدريب أنظمة الذكاء الاصطناعي بتغذية راجعة بشرية لأن تقييمات البشر تمثل وكيلا جيدا بقدر معقول لجودة مخرجات الذكاء الاصطناعي، بينما يشكل الأداء على المستوى البشري الهدف. وعندما يتجاوز الذكاء الاصطناعي الأداء البشري تصبح التقييمات غير موثوقة: فالمقيمون الذين لا يستطيعون تقييم الجودة بدقة سيصنفون المخرجات بناء على الخصائص السطحية (مثل مدى ثقة الإجابة، ووضوح كتابتها، ومدى تطابقها مع توقعاتهم السابقة) لا على ما إذا كانت صحيحة فعلا.
هذا يحدث بالفعل بطرق محدودة. نماذج اللغة المدربة بتغذية راجعة بشرية موثق أنها تنتج ردوداً تبدو واثقة ومنسقة بشكل مقبول تحصل على تقييمات بشرية عالية بغض النظر عما إذا كان المحتوى الأساسي دقيقاً. إشارة التدريب تكافئ مظهر المساعدة بشكل أكثر موثوقية من مكافأتها للمساعدة الفعلية، لأن المقيمين أكثر موثوقية في كشف الأولى من الثانية.
إذا تفوق نظام ذكاء اصطناعي على الخبراء البشر في مجال ما، فإن البشر الوحيدين القادرين على تقييم مخرجاته هم من سبق أن تجاوزهم. عند هذه النقطة، تعطي عملية التقييم إشارة أضعف فأضعف عن الجودة الحقيقية، وإشارة أقوى فأقوى عن مدى قدرة النظام على إنتاج مخرجات تبدو جيدة لأشخاص لا يفهمونها فهما كاملا.
النهج المقترحة للإشراف القابل للتوسع
نقاش الذكاء الاصطناعي
اقترحها بول كريستيانو وجيفري إيرفينغ وزملاؤهما في OpenAI عام 2018، وهي نهج يتناقش فيه نظاما ذكاء اصطناعي مواقف متعارضة، ويقيم قاضٍ بشري النقاش بدلًا من المحتوى الأساسي مباشرة. والحدس أن القاضي قد يتمكن من تحديد الاستدلال المعيب والأخطاء الواقعية في الحجة حتى لو لم يستطع التحقق بنفسه من الإجابة الصحيحة. وإذا كان المتناظران محفزين على الفوز من خلال الحجة الصادقة لا الإقناع، وإذا كان كل منهما مدفوعًا لكشف أخطاء الآخر، فقد يستخرج شكل النقاش إشارات جودة موثوقة من المقيمين البشريين الذين ليسوا خبراء في المجال.
يتمتع هذا النهج بجاذبية نظرية وبعض الدعم التجريبي في الإعدادات الخاضعة للرقابة. والسؤال الرئيسي المفتوح هو ما إذا كان يصمد عندما يعمل كل من المتناظرين والحكام في مجالات تتجاوز بكثير الخبرة البشرية، حيث قد يتطلب حتى تحديد أي المتناظرين يقدم الحجة الأفضل الخبرة ذاتها التي يفتقر إليها الحكم.
نمذجة المكافأة التكرارية
نمذجة المكافأة التكرارية، التي طورها باحثون في DeepMind، تعالج المشكلة بتعزيز الإشراف البشري تدريجياً عبر تسلسل هرمي من أنظمة الذكاء الاصطناعي. يقيم الإنسان مباشرة مخرجات نظام ذكاء اصطناعي أقل قدرة، منتجاً نموذج مكافأة. يُستخدم نموذج المكافأة هذا بعد ذلك لتقييم مخرجات نظام أكثر قدرة، وهكذا. يحاول النهج توسيع قدرة الإشراف البشري بشكل تدريجي، مستوى واحداً في كل مرة، بدلاً من محاولة القفز مباشرة من التقييم البشري إلى التقييم على مستوى الذكاء الفائق.
التحدي الرئيسي هو انتشار الخطأ: أخطاء نموذج المكافأة الأضعف تتراكم عند تطبيقها على النظام الأقوى. قد ينتج نموذج مكافأة دقته 95% على المستوى الأدنى إشرافاً أكثر تشويشاً بكثير على المستوى الأعلى، ويتدهور ذلك التشويش أكثر مع كل خطوة تكرارية.
التضخيم
التضخيم التكراري، الذي اقترحه أيضاً بول كريستيانو، يستخدم ذكاءً اصطناعياً أضعف لمساعدة الإنسان في تفكيك المشكلات المعقدة إلى مشكلات فرعية يمكن تقييم كل منها على حدة. يقيم الإنسان المشكلات الفرعية، ويجمع الذكاء الاصطناعي تلك التقييمات في تقييم للمشكلة الأكبر. وعند تكرار ذلك عبر مستويات عديدة من التفكيك، يهدف النهج إلى منح البشر القدرة على تقييم مشكلات تتجاوز إدراكهم المباشر بتقسيمها إلى أجزاء يستطيعون تقييمها.
الحالة غير المحسومة للمشكلة
لم يثبت نجاح أي من هذه النهج بشكل موثوق مع أنظمة الذكاء الاصطناعي التي تعمل بمستوى يفوق المستوى البشري بكثير في المجالات الواقعية. وقد أنتجت النهج الثلاثة نتائج واعدة في بيئات محكومة وهي مجالات بحث نشطة لدى Anthropic وGoogle وDeepMind وOpenAI. ولا تزال الفجوة واسعة بين العرض المحكوم والتشغيل الموثوق في الظروف الأهم.
لهذا السبب يُعتبر الإشراف القابل للتوسع أحد المشكلات المفتوحة المركزية في سلامة الذكاء الاصطناعي، إلى جانب القابلية للتفسير والقابلية للتصحيح. إن عالماً تصل فيه أنظمة الذكاء الاصطناعي إلى قدرة الذكاء الفائق / الذكاء الخارق دون حل لنهج الإشراف القابل للتوسع هو عالم فقدنا فيه القدرة على الإشراف بشكل هادف على ما بنيناه. والتداعيات الحوكمية هي نفسها كما هي للمشكلات الأخرى غير المحلولة: بناء أطر تتطلب التحقق من التوافق قبل النشر، بدلاً من اكتشافه بعد الحقيقة من خلال المراقبة السلوكية التي تجاوزها النظام بالفعل.
أقوى المعارضات
إن أعدل اعتراض هو أن النقاش والتضخيم والتقييم التكراري ستتوسع مع النماذج، لذا فالرقابة منحنى هندسي يمكننا السير عليه. ربما في العروض التوضيحية. أما في الحد الأقصى، فلا يزال الحكم أضعف من النظام الذي يُحكم عليه. لا تعامل أنظمة الرقابة غير المثبتة كإذن للعبور إلى ASI.