Multimodaalinen tekoäly
Tunnetaan myös: multimodal AI
Mikä on Multimodaalinen tekoäly?
Malli, joka toimii useammalla kuin yhdellä datatyypillä: tekstillä, kuvilla, äänellä ja videolla. Se voi ottaa valokuvan ja kuvailla sen sanoin tai lukea kuvauksen ja tuottaa kuvan. Valtaosa nykyisistä kärkimalleista on multimodaalisia, ja siksi chatbottiin voi liittää kuvakaappauksen.
Miksi tällä on väliä
Varhaiset kielimallit käsittelivät vain tekstiä. Multimodaalinen malli toimii usealla datatyypillä yhtä aikaa: tekstillä, kuvilla, äänellä ja videolla. Se laajentaa sitä, mitä voi rakentaa ilman erillisten työkalujen ompelemista yhteen. Yksi malli voi katsoa valokuvaa ja kuvailla sen, lukea kaavion ja poimia luvut tai ottaa puhutun kysymyksen ja vastata kirjallisesti. Näin tekoäly kohtaa ihmiset siellä, missä heidän tietonsa jo on, ja harvoin se on pelkkää tekstiä. Valtaosa nykyisistä kärkimalleista on multimodaalisia, joten kuvakaappauksen pudottaminen chatbottiin ja siitä kysyminen yksinkertaisesti toimii.
Käytännössä
Vakuutusyhtiö antaa asiakkaan valokuvata auton vauriot, ja malli luonnostelee kuvasta ensiarvion. Kliinikon työkalu lukee kuvantamistutkimuksen kirjattujen merkintöjen rinnalla. Kenttäasentaja ottaa kuvan rikkoutuneesta osasta ja saa oikean käsikirjan. Yhdessäkään näistä syöte ei ole siisti tekstikehote vaan se, mitä ihmisellä sattui olemaan käsillä, ja malli työskentelee siitä.