Ang Constitutional AI ay isang training method na binuo ng Anthropic. Ang ideya ay bawasan ang pagdepende ng behavior ng model sa mga tao na nagla-label ng harmful outputs, at sa halip hayaan ang model na suriin ang sarili nitong mga tugon batay sa nakasulat na set ng principles na tinatawag na constitution.

Sa praktika, gumagana ito sa dalawang yugto. Una, bumubuo ang model ng tugon, pagkatapos ay kinikritik ito laban sa konstitusyon at binabago ito, natututo mula sa sarili nitong mga pagwawasto. Pangalawa, inihahambing ng model ang mga pares ng tugon at hinuhusgahan kung alin ang mas nakakabagay sa mga prinsipyo, at ang mga paghatol na iyon ang nagsasanay dito katulad ng ginagawa ng mga ranggo ng tao sa RLHF. Dahil nanggagaling ang feedback sa modelo mismo na nag-a-apply ng konstitusyon at hindi sa mga tao, minsan tinatawag na reinforcement learning from AI feedback ang bahagi ng pamamaraang ito.

Ang Tama Nito

May tunay na mga pakinabang, at dapat itong aminin nang malinaw.

  • Ang mga prinsipyo ay malinaw. Sa halip na mga value na ipinahihiwatig ng libu-libong indibidwal na human label, may nakasulat na dokumento na maaari mong basahin, debatehin, at baguhin. Ito ay mas transparent kaysa sa isang tambak ng ratings.
  • Pinapabilis nito ang pagbuo ng feedback. Mabagal, magastos, at nakakapagod sa mga tagapag-label ang pag-label ng tao sa mapanganib na nilalaman. Kapag hinayaan ang model na gawin ang karamihan sa trabahong iyon, nawawala ang bottleneck.
  • Pwedeng nitong mapabuti ang consistency. Ang nakasulat na standard na inilalapat nang pantay-pantay ay iniiwasan ang ilang ingay at drift mula sa maraming magkakaibang human rater sa iba't ibang araw.

Totoong engineering gains ito, at nakagawa na ang constitutional AI ng mga modelong mas helpful at hindi gaanong madaling makagawa ng halatang pinsala. Walang interes ang Foundation na balewalain ang kapaki-pakinabang na gawain.

Ano ang hindi nito nalulutas

Ang mas mahihirap na tanong ay nabubuhay pa sa pamamaraan nang buo, at mahalagang makita kung bakit.

Ang teknik ay nag-o-optimize pa rin ng isang model upang matugunan ang isang nakasaad na pamantayan ayon sa paghatol ng isang model. Inilalabas nito ang tao sa per-response loop, at hindi nito binabago ang pinagbabatayan na hugis ng problema, na ang sistema ay sinasanay upang makagawa ng mga output na mahusay ang marka laban sa isang target. Kung hindi kumpleto ang konstitusyon, o nagkakasalungatan ang mga prinsipyo nito sa isang sitwasyong hindi inasahan ng sinuman, ino-optimize ng model ang literal na nakasulat, na may parehong Goodhart pressures tulad ng dati. Ang pagsulat ng mga values bilang konstitusyon ay hindi nakatatakas sa kahirapan ng pagtukoy sa values; inililipat lang ito sa loob ng dokumento.

Dalawang mas malalim na limitasyon ang nananatiling hindi natutugunan. Hinuhubog ng pamamaraan ang pag-uugali, at walang garantiya tungkol sa mga panloob na layunin ng modelo, kaya ang agwat sa pagitan ng mukhang aligned at tunay na aligned, ang panloob na pagkakahanay problema, ay bukas pa rin. At ito ay nakadepende sa sariling paghatol ng model sa mga output nito, na mapagkakatiwalaan lamang kung ang model ay tapat at may kakayahang humatol, eksaktong hindi natin maaasahan sa isang system na papalapit o lumalampas sa ating antas.

Mas mabuting paraan ang Constitutional AI para idirekta ang kilos. Hindi naman iyon ang bahagi ng alignment na hindi pa namin alam kung paano.

Panatilihin ito sa tamang sukat

Ang Constitutional AI ay isang magandang halimbawa ng pattern na binabantayan nang mabuti ng Foundation: tunay at mahalagang safety progress na madaling basahin nang labis kaysa sa aktwal. Ang mga method na ganito ay ginagawang mas controllable at mas transparent ang kasalukuyang models tungkol sa kanilang standards, at ito ay worth having. Hindi nila ipinapakita na puwede nating i-align ang isang sistema na higit na matalino sa atin, at hindi nila nasasara ang verification gap na pinagbabatayan ng buong argumento. Ang progress sa training ay welcome. Hindi ito dahilan para patuloy na i-scale ang capability sa pag-aakalang susunod na ang iba, na siyang kaso na inilatag sa aming plano.