Siirry sisältöön

Multimodaalinen tekoäly

Tunnetaan myös: multimodal AI

Päivitetty 14.7.2026 Tarkistanut Teemu Malinen

Mikä on Multimodaalinen tekoäly?

Malli, joka toimii useammalla kuin yhdellä datatyypillä: tekstillä, kuvilla, äänellä ja videolla. Se voi ottaa valokuvan ja kuvailla sen sanoin tai lukea kuvauksen ja tuottaa kuvan. Valtaosa nykyisistä kärkimalleista on multimodaalisia, ja siksi chatbottiin voi liittää kuvakaappauksen.

Miksi tällä on väliä

Varhaiset kielimallit käsittelivät vain tekstiä. Multimodaalinen malli toimii usealla datatyypillä yhtä aikaa: tekstillä, kuvilla, äänellä ja videolla. Se laajentaa sitä, mitä voi rakentaa ilman erillisten työkalujen ompelemista yhteen. Yksi malli voi katsoa valokuvaa ja kuvailla sen, lukea kaavion ja poimia luvut tai ottaa puhutun kysymyksen ja vastata kirjallisesti. Näin tekoäly kohtaa ihmiset siellä, missä heidän tietonsa jo on, ja harvoin se on pelkkää tekstiä. Valtaosa nykyisistä kärkimalleista on multimodaalisia, joten kuvakaappauksen pudottaminen chatbottiin ja siitä kysyminen yksinkertaisesti toimii.

Käytännössä

Vakuutusyhtiö antaa asiakkaan valokuvata auton vauriot, ja malli luonnostelee kuvasta ensiarvion. Kliinikon työkalu lukee kuvantamistutkimuksen kirjattujen merkintöjen rinnalla. Kenttäasentaja ottaa kuvan rikkoutuneesta osasta ja saa oikean käsikirjan. Yhdessäkään näistä syöte ei ole siisti tekstikehote vaan se, mitä ihmisellä sattui olemaan käsillä, ja malli työskentelee siitä.

Otto Sunnari, Sales and partnerships at Sofokus

Valmiina hyödyntämään tekoälyä?

Soita, laita viestiä tai varaa aika suoraan kalenteristani.

Otto Sunnari

Myynti ja kumppanuudet