Turvarajat
Tunnetaan myös: guardrails, AI guardrails
Mikä on Turvarajat?
Tekniset kontrollit, jotka pitävät tekoälyjärjestelmän käytöksen sovituissa rajoissa: ne tarkistavat syötteet ja tuotokset ja pysäyttävät vaarallisen sisällön ennen kuin se tavoittaa käyttäjän, olipa kyse vuotaneesta salaisuudesta, haitallisesta vastauksesta tai aiheen ohi menevästä rönsystä. Säännöt voi määritellä koodina valmiilla kehyksillä. Turvarajat valvovat sääntöjä ajon aikana. Tekoälyn käyttösäännöt kirjaavat ne paperille.
Miksi tällä on väliä
Turvarajat on helppo lisätä ja vaikea saada oikein, ja vaikeus on tasapainoilua, jolta kukaan ei välty. Löysät rajat päästävät vaarallisen tuotoksen läpi, eli juuri sen, jolta oltiin suojautumassa. Tiukat rajat alkavat estää asiallista käyttöä, jolloin ihmiset törmäävät umpikujiin järkevillä pyynnöillä ja leimaavat työkalun rikkinäiseksi. Kumpikaan vika ei näy ennen kuin joku mittaa sen. Lisäksi on ylläpitokustannus, joka unohtuu helposti. Tilanteet, joita malli kohtaa, muuttuvat jatkuvasti, uusia väärinkäyttötapoja ilmestyy, ja kerran kirjoitettu ja sikseen jätetty turvaraja lakkaa hiljalleen vastaamasta todellisuutta.
Käytännössä
Asiakkaille näkyvä avustaja kieltäytyy tavallisesta kysymyksestä, koska leveä suodatin tarttui viattomaan sanaan, ja asiakas lähtee tyhjin käsin. Samaan aikaan huolellisesti muotoiltu haitallinen pyyntö menee samasta suodattimesta läpi. Varsinainen työ on jatkuvaa viritystä oikeaa liikennettä vasten: seurataan, mitä turvaraja estää ja mitä se päästää ohi, ja säädetään molempia sen sijaan, että julkaistaisiin yksi sääntösetti ja oletettaisiin sen pitävän.