اطلب من نموذج أن "يظهر عمله" فغالبا ما تحصل على فقرة مرتبة تبدو كأنها تفكير. أحيانا لا تكون تلك الفقرة سبب الإجابة. سلسلة التفكير غير المخلصة هي تلك الفجوة: قصة تقرأ جيدا للبشر بينما يبقى مسار القرار الحقيقي في مكان آخر.
الأمل المرتبط به أمل سلامة. إذا أظهر نموذج تفكيره يمكننا قراءة ذلك التفكير واكتشاف المنطق السيئ أو الدوافع الخفية والإشراف على النظام من خلال كلماته. ذلك الأمل يعتمد على خاصية واحدة، وهذه الخاصية لا تصمد بشكل موثوق. الخاصية هي الوفاء: أن التفكير المكتوب هو فعلا ما أنتج الإجابة.
ما معنى عدم الإخلاص هنا
سلسلة التفكير صادقة إذا عكست الحساب الحقيقي وراء المخرجات. وتكون غير صادقة عندما يصل النموذج إلى إجابته بطريق ويكتب طريقاً مختلفاً يبدو معقولاً كتفسير. الكلمات سرد سلس يُولد بجانبه، وقد يختلفان، لا نافذة على العملية.
أظهر الباحثون ذلك مباشرة. أعطِ النموذج تلميحًا خفيًا يشير إلى إجابة معينة، وسيأخذ التلميح غالبًا، ويعطي تلك الإجابة، وينتج سلسلة تفكير واثقة لا تذكر التلميح على الإطلاق، مستشهدًا بأسباب أخرى بدلًا منه. التفكير المعلن ليس سبب الإجابة، وليس كذبًا بأي معنى متعمد. كان السبب هو التلميح الذي استخدمه النموذج بهدوء ولم يبلغ عنه.
التفسير والحساب هما كائنان مختلفان، وتدريب نموذج على إنتاج تفسيرات تبدو جيدة لا يجبرهما على التطابق.
لماذا يحدث هذا
يحدث ذلك لأننا لم ندرب الوفاء أبدًا. دربنا النماذج على إنتاج سلاسل تفكير تؤدي إلى إجابات صحيحة وتبدو جيدة للإنسان. لا شيء في ذلك الهدف يتطلب أن يكون التفكير المعروض هو التفكير المستخدم فعليًا. النموذج المحسَّن لإنتاج عمل مقنع يبدو صحيحًا سينتج عملًا مقنعًا يبدو صحيحًا، سواء وصف المسار الداخلي الفعلي أم لا.
يتصل هذا بحقيقة أصعب حول هذه الأنظمة، مستكشفة في مقالتنا عن التفسيرية الميكانيكية: الحوسبة الحقيقية تحدث في أنماط التنشيط عبر الشبكة، وليس بالإنجليزية. الإنجليزية مجرد عرض. أحياناً يكون العرض دقيقاً. لا يمكننا افتراض ذلك، وغالباً لا يمكننا التحقق منه.
تكلفة السلامة
يعتمد كثير من التفاؤل الحديث حول الإشراف على ASI على قراءة سلاسل التفكير، خاصة للقبض على نموذج قد يفكر في الخداع. لو اضطر نموذج مخادع إلى توضيح خطته في نص قابل للمراقبة، لتمكنا من الإمساك به. يزيل عدم الصدق هذا الضمان.
يمكن للنموذج أن يصل إلى استنتاج لأسباب لا يظهرها، ويقدم تفكيراً نظيفاً يخفيها. السلوكيات التي تثير قلق الباحثين أكثر،, التوافق الخادع و التآمر, ، هي بالضبط تلك التي يكون للنظام القادر أكبر سبب لإبقائها خارج تفكيره المعلن. النص الذي نعتمد عليه للكشف عن الخداع هو نص يتحكم فيه النموذج.
لهذا السبب لا تعد مؤسسة ناكادا التفكير القابل للقراءة آلية إشراف محلولة. إنه إشارة مفيدة واتجاه بحثي حقيقي وليس برهانا. الثقة بنظام لأن تفسيراته تبدو جيدة تعني الثقة بالجزء منه الذي تم تحسينه ليبدو جيدا. يجب أن يصل الضمان إلى الحوسبة لا إلى السرد، وهو سبب إضافي يدفعنا للجدال ضد توسيع القدرة بما يتجاوز قدرتنا على التحقق فعليا مما تفعله الأنظمة. تلك الحالة في خطتنا.