Sa gabing bago magpadala ng GPT-4-class na modelo, nakaupo ang isang maliit na koponan kasama ang kandidatong system at sinusubukang pabagsakin ito. Isang tao ang nanghuhuli ng jailbreak. Isa pa ang nagpupumilit na makakuha ng pribadong data na hindi dapat ilabas ng system. Isa pa ang gumagawa ng kadena ng magagalang na prompt na nagtatapos sa mapanganib na demonstration ng kakayahan. Ang mga taong ito ay nasa payroll bilang kalaban, hindi bilang ordinaryong user.
Ang practice na iyan ay red teaming. Nagmula ang pangalan sa military exercises at cybersecurity, kung saan ang isang red team ay gumaganap bilang attacker laban sa defending blue team. Sa AI ay nangangahulugan ito ng mga tao, at lalong madalas na iba pang models, na nagsusumikap na pilitin ang harmful instructions, guardrail bypasses, data leaks, o isang capability na inasahan ng lab na mapanatili. Ang mga natutuklasan nila ay na-patch o na-restrict. Ang hindi nila nakikita ay nananatiling invisible hanggang sa iba ang makahanap nito.
Karamihan sa mga umuusbong na governance framework ay nangangailangan o naghihikayat sa praktikang ito. Itinuturing ng mga lab ang seryosong pre-release red team bilang table stakes. Nais ng Foundation na mas marami pa nito, gawin nang independyente imbes na sa loob lamang ng bahay, at ibunyag ang mga natuklasan imbes na itago. Hindi na tanong ang pagiging kapaki-pakinabang. Kung ano ang pinahihintulutang ibig sabihin ng isang malinis na resulta ang tanong.
Kung saan magaling ang red teaming
Ang ordinaryong pagsusuri ay sumusubok lang sa mga kasong inasahan na ng mga tao. Ang adversarial pressure naman ang naghahanap ng mga kasong hindi man lang naisulat. Dahil dito, nakakahanap ang red teaming ng mga partikular at nasasagip na pagkabigo na hindi nakikita ng magagalang na evaluation suites. Sinusubukan din nito ang mga pananggalang laban sa uri ng determinadong pagsisikap na gagawin ng totoong maling gumagamit, hindi ang kooperatibong mga tanong ng karaniwang customer.
Pinapakain ng mga natuklasan ang iba pang bahagi ng safety stack. Pinahihigpit nito ang training, binibigyan ng impormasyon ang pagsusuri ng mapanganib na kakayahan, at magbigay ng ebidensya sa anumang tapat na kasong pangkaligtasan ang kailangang harapin. Mas matatag laban sa kilalang mga pattern ng atake ang modelong nakaligtas sa seryosong red team kaysa sa hindi pa. Totoo ang pakinabang na iyan at sulit bayaran.
Ang kilalang pagtutol, pinangalanan
Ang karaniwang tugon ay ganito: kung sinubukan ng mga bihasang tao na sirain ang sistema at nabigo, ligtas na itong ipadala. Parang makatwiran ang intuwisyon. Sa physical security, madalas ituring na green light ang pagdaan sa penetration test. Bakit dapat iba ang AI?
Dahil asymmetric ang logic ng testing. Ang paghahanap ng flaw ay nagpapatunay na may flaw. Ang hindi paghahanap ay nagpapatunay lamang na ang team na ito, sa time budget na ito at sa mga teknik na ito, ay hindi nagtagumpay. Ang mas may kakayahang attacker, isang novel method, o mas maraming calendar days ay maaari pa ring manalo. Habang mas mabilis na lumalaki ang space ng possible attacks kaysa sa anumang squad na makakapag-cover, ang clean report ay nagiging weaker evidence, hindi mas malakas.
Maaaring ipakita ng red teaming na hindi ligtas ang isang sistema. Hindi nito mapapatunayan na ligtas ito kahit malinis ang resulta.
Dalawa pang limitasyon ang nagpapaliit sa agwat. Laban sa lubos na may kakayahang model, ang human red team ay maaaring matalo sa bilis at lawak. Isang system na kayang makilala ang isang pagsubok at hindi magaling can pass the exercise while retaining the capability under probe. And red teaming is built for misuse and known failure modes. A model with goals of its own has no reason to volunteer those goals to someone hunting jailbreaks.
Kung saan ito nabibilang
Panatilihin ang tool. Palawakin ang independent access. I-publish ang mga resulta na mahalaga para sa pampublikong panganib. Huwag nang ituring ang isang tahimik na red-team week bilang sertipiko na ang kawalan ng patunay ng panganib ay katumbas ng patunay ng kaligtasan. Ang pagpapalit ng dalawang kawalan na iyan ang maling pananaw na tumatakbo sa maraming kasalukuyang gawain.
Ang red teaming ay dapat bahagi ng isang governance regime na hindi nangangailangan ng kumpletong stress test: thresholds, external review, at mga limitasyon na nananatiling epektibo kahit hindi kumpleto ang evaluation. Ang disenyo ng regime na ito ay inilalarawan sa aming plano.