Transformer
Mikä on Transformer?
Neuroverkkoarkkitehtuuri lähes jokaisen modernin kielimallin takana. Se esiteltiin käänteentekevässä vuoden 2017 tutkimusartikkelissa, ja sen ydinidea, self-attention, antaa mallin punnita kerralla, kuinka vahvasti jokainen sana liittyy jokaiseen muuhun sanaan tekstikatkelmassa. Tämä teki valtavilla tekstikokoelmilla kouluttamisesta käytännöllistä, mikä käynnisti koko LLM-aikakauden.
Miksi tällä on väliä
Se, että juuri transformer eikä sitä edeltäneet ideat käynnisti tekoälyn viime vuosikymmenen, johtuu enimmäkseen koulutusnopeudesta. Aiemmat arkkitehtuurit lukivat tekstiä järjestyksessä, sana kerrallaan, mikä teki niistä hitaita kouluttaa ja vaikeita skaalata. Transformer katsoo koko katkelmaa kerralla, joten koulutuksen saattoi hajauttaa monelle suorittimelle ja ajaa paljon aiempaa suuremmilla tekstikokoelmilla. Tuo yksi tehokkuusharppaus teki nykyisten suurten mallien rakentamisesta käytännöllistä. Samassa rakenteessa on kuitenkin sisäänrakennettu kustannus: työ, jossa jokainen sana suhteutetaan jokaiseen muuhun, kasvaa jyrkästi tekstin pidetessä, ja tämä on iso osa syytä siihen, miksi hyvin pitkät syötteet pysyvät hitaina ja kalliina käsitellä.
Käytännössä
Jokainen, joka on katsonut kustannusten kipuamista syöttäessään mallille hyvin pitkiä dokumentteja, on kohdannut tämän rajan omakohtaisesti. Koska transformer vertaa jokaista sanaa jokaiseen muuhun, syötteen tuplaaminen enemmän kuin tuplaa työn, joten järjestelmä, joka käsittelee sivun halvalla, voi muuttua kalliiksi kokonaisella sopimuksella. Tiimit kiertävät rajan hakemalla vain olennaiset katkelmat sen sijaan, että kaataisivat kaiken sisään, mikä on usein sekä halvempaa että tarkempaa kuin yhä pidempään kontekstiin nojaaminen.