Vektoritietokanta
Tunnetaan myös: vector database
Mikä on Vektoritietokanta?
Tietokanta, joka on rakennettu tallentamaan upotuksia ja löytämään lähimmät osumat nopeasti sen sijaan, että se etsisi tarkkoja avainsanaosumia. Kun siltä pyytää kyselyä merkitykseltään lähimmät kohteet, se palauttaa ne miljoonien joukosta millisekunneissa. Se on hakukerros useimpien semanttisen haun ja RAG-järjestelmien alla.
Miksi tällä on väliä
Vektoritietokantaa markkinoidaan nopeudella suuressa mittakaavassa, mutta useimmille yrityksille tärkeämpää on kysyä, tarvitsevatko ne erillistä kantaa lainkaan. Muutaman tuhannen dokumentin samankaltaisuushaku pyörii jo käytössä olevan tietokannan sisällä, ja erikoisjärjestelmän lisääminen antaa vain yhden asian lisää ylläpidettäväksi, suojattavaksi ja synkronoituna pidettäväksi. Perusteet omalle kannalle kasvavat volyymin mukana: miljoonia kohteita, raskas kyselyliikenne, tarve suodattaa metadatalla ja hakea merkityksellä yhtä aikaa. Jos arvion tekee väärin kumpaan suuntaan tahansa, joko kasvu pysähtyy kapasiteettikattoon tai maksat infrastruktuurista, jota oma data ei koskaan edellyttänyt.
Käytännössä
Chatbot kytketään tukiartikkeleihin, joita on aluksi muutama sata, niin vähän, että nykyisen tietokannan lisäosa hoitaa haun. Kun arkisto kasvaa kymmeniin tuhansiin ja vastaukset hidastuvat, tiimi siirtyy sille kuormalle rakennettuun omaan vektorikantaan. Vaihdon laukaisi mitattu volyymi, ei oletus, että vakava tekoäly vaatii erikoistietokannan ensimmäisestä päivästä.