Tekoälyn hallusinaatio dokumenteissa: mitä testi paljasti

Keksitty vastaus ja turha kieltäytyminen johtuvat samasta ohjeesta

Tekoälyn hallusinaatio dokumenteissa: mitä testi paljasti

1.10.202610 min lukuaika

Testasimme kuutta omalla koneella ajettavaa kielimallia ansakysymyksillä, joihin ei löytynyt vastausta dokumentista. Parhaat mallit eivät keksineet vastausta kertaakaan, heikoin keksi sen 41 prosentissa. Keksitty vastaus oli lähes aina dokumentissa lähellä ollut, väärään kysymykseen kuuluva luku. Parhaiden mallien virhe oli päinvastainen: ne vastasivat "tietoa ei löydy" myös silloin, kun vastaus oli dokumentissa.

Tämä artikkeli syventää testiämme, jossa kuusi kielimallia luki suomalaisia laskuja, sopimuksia ja pöytäkirjoja. Siinä mitattiin, kuinka usein mallit vastaavat oikein. Nyt katsomme, millaisia virheet olivat. Automaatiossa virheen laatu on yhtä tärkeä kuin virheiden määrä: keksitty eräpäivä menee läpi huomaamatta, mutta turhan "tietoa ei löydy" -vastauksen jälkeen ihminen joutuu etsimään tiedon itse.

Ansakysymykset lyhyesti

Mitä mitattiin:
Tunnistaako malli, ettei kysyttyä tietoa ole dokumentissa.
Ansoja:
Yksi jokaista 50 dokumenttia kohden, mallista riippuen 44-50 ratkaistua.
Houkutin:
Jokaisessa ansassa dokumentissa oli lähellä uskottava mutta väärä arvo.
Paras tulos:
Gemma 4 12B ja Qwen 3.8 27B, ei yhtään keksittyä vastausta.
Heikoin tulos:
Mistral 7B, keksitty vastaus 41 %:iin ansoista.
Parhaiden mallien yleisin virhe:
Turha kieltäytyminen, Qwen 27B:llä 20 virhettä 30:stä.

Keksiikö tekoäly tietoa, jota dokumentissa ei ole?

Osa malleista keksii, osa ei. Gemma 4 12B ja Qwen 3.8 27B vastasivat jokaiseen ansakysymykseen oikein, että tietoa ei löydy. Mistral 7B keksi vastauksen 20 ansaan 49:stä, ja muilla malleilla keksittyjen vastausten osuus oli 7-8 prosenttia.

Ansakysymyksessä kysytty tieto puuttuu dokumentista. Oikean vastauksen tulisi silloin olla "tietoa ei löydy". Kaikki mallit saivat saman ohjeen: vastaa vain dokumentin perusteella, älä arvaa ja ilmoita, jos tietoa ei ole.

Pelkkä hallusinaatioaste antaa kuitenkin väärän kuvan. Malli, joka vastaa lähes kaikkeen "tietoa ei löydy", läpäisee ansat mutta on muuten hyödytön. Alla olevassa taulukossa on mukana toinenkin luku: kuinka suureen osaan kysymyksistä malli vastasi oikein silloin, kun vastaus oli dokumentissa.

MalliKeksi vastauksen ansaanOikein, kun vastaus oli dokumentissa
Gemma 4 12B0 % (0/49)93,1 %
Qwen 3.8 27B0 % (0/47)86,3 %
Phi-46,8 % (3/44)82,5 %
Llama 3.2 3B8,0 % (4/50)18,1 %
Qwen3 8B8,2 % (4/49)54,4 %
Mistral 7B40,8 % (20/49)46,9 %

Oikeanpuoleinen sarake on laskettu 202 kysymyksen yhteiseltä otokselta ilman ansakysymyksiä.

Llama 3.2 3B keksi vastauksen vain 8 prosenttiin ansoista, mikä on lähes Phi-4:n tasoa. Kysymyksiin, joihin vastaus oli dokumentissa, se vastasi kuitenkin oikein vain 18 prosentissa, mikä on testin heikoin tulos. Matala hallusinaatioaste ei siis kerro luotettavuudesta, vaan siitä, että malli vastasi "tietoa ei löydy" usein myös silloin, kun vastaus oli dokumentissa. Hyvä ansatulos on arvokas vain yhdessä hyvän vastaustarkkuuden kanssa, ja tässä testissä sen yhdistelmän saavuttivat Gemma ja Qwen 27B.

Miksi hallusinaatiota on vaikea huomata?

Hallusinaatiota on vaikea huomata, koska keksitty vastaus ei näytä keksityltä. Lähes jokainen testin hallusinaatio oli dokumentissa oikeasti ollut luku tai päivämäärä, joka vain ei ollut oikea vastaus kysymykseen. Malli ei siis keksinyt tietoa tyhjästä, vaan tarttui lähimpään uskottavaan arvoon.

Esimerkkejä testistä:

  • Ostajan Y-tunnus. Mistral vastasi epäröimättä ja antoi yrityksen nimen ja Y-tunnuksen. Molemmat kuuluivat myyjälle.
  • Takuuaika. Mistral vastasi "78 kuukautta", joka oli hankinnan arvioitu kesto. Toisen sopimuksen takuuaikaan Llama vastasi "3 vuotta", joka oli sopimuskausi.
  • Huomautusaika. Qwen3 8B vastasi "14 pv netto", mikä oli laskun maksuehto.
  • Pöytäkirjan tarkastuspäivä. Phi-4 ja Qwen3 8B antoivat julkaisupäivän. Phi-4 jopa lainasi lauseen, jonka mukaan pöytäkirja oli julkaistu sinä päivänä.

Jokainen näistä menisi läpi pistokokeessa. Y-tunnus on oikeaa muotoa ja sen tarkistusmerkki täsmää, koska tunnus on otettu samalta laskulta, vain väärältä osapuolelta. Takuuaika on uskottavan pituinen. Vastaus on väärä vain suhteessa kysymykseen, ja sen huomaa vain lukemalla dokumentin itse.

Tästä seuraa käytännön sääntö: kun automaatio poimii tietoa dokumentista, tarkistus ei voi perustua siihen, näyttääkö arvo järkevältä. Hyödyllisempi kysymys on, mistä kohdasta dokumenttia arvo on peräisin. Kun mallia pyydetään kertomaan lähdekohta vastauksensa rinnalla, väärään kenttään tarttuminen on helpompi huomata.

Tekoälyn hallusinaatio laskujen ja sopimusten tarkistuksessa

Voiko tekoäly olla liian varovainen?

Voi, ja testissä se oli parhaiden mallien yleisin virhe. Qwen 3.8 27B:n 30 väärästä vastauksesta 20 oli kieltäytymisiä kysymyksiin, joiden vastaus olisi löytynyt dokumentista. Sama ohje, joka piti mallin ansoissa virheettömänä, teki siitä liian varovaisen silloin, kun vastaus piti laskea tai päätellä.

Tyypillinen esimerkki tuli kokouspöytäkirjasta. Pöytäkirjan mukaan yksi osallistujista poistui kello 16.34, ja kokous päättyi kello 19.08. Kun kysyttiin, oliko hän läsnä kokouksen lopussa, Qwen 27B vastasi: "Tietoa ei löydy dokumentista." Vastaukseen olisi riittänyt kahden kellonajan vertaaminen. Samoin malli kieltäytyi laskemasta viivästyskorkoa ja täsmäyttämästä laskun alv-rivejä, vaikka kaikki tarvittava tieto oli laskulla. Gemma kieltäytyi harvemmin, ja sen kieltäytymiset osuivat lähinnä tulkintakysymyksiin, kuten siihen, mitä otto-oikeudesta luopuminen tarkoittaa.

Liika varovaisuus on hallusinaatiota turvallisempi virhe, koska se näkyy. Ilmainen se ei silti ole. Jokainen turha kieltäytyminen siirtää tehtävän takaisin ihmiselle, ja jos niitä tulee paljon, automaatio säästää vähemmän kuin sen piti.

Toinen samaan asiaan liittyvä ilmiö oli itsensä korjaaminen kesken vastauksen. Qwen 27B ja Phi-4 aloittivat usein väärällä kyllä- tai ei-vastauksella ja päätyivät oikeaan vasta lopussa: "Ei vastaa. [...] Eräpäivä on 7 päivää myöhemmin. Tämä vastaa maksuehtoa." Jos automaatio lukee vain ensimmäisen sanan, se saa väärän tuloksen. Testissä nämä vastaukset pisteytettiin vääriksi.

Miten tekoälyn arvailu estetään ilman turhia kieltäytymisiä?

Testaamalla omilla dokumenteilla ja mittaamalla molemmat virhetyypit erikseen. Mallille annettu ohje vaikuttaa kumpaankin virheeseen. Kun mallia kielletään tiukasti arvaamasta, se keksii vastauksia harvemmin. Samalla se kuitenkin jättää useammin vastaamatta myös silloin, kun vastaus on dokumentissa. Ohjeen tiukkuus kannattaa siksi valita sen mukaan, kumpi virhe tulee prosessissanne kalliimmaksi.

Testissämme kaikki mallit saivat saman ohjeen, eikä toista ohjetta kokeiltu. Tämän testin perusteella emme siis voi sanoa, kuinka paljon toisenlainen ohje olisi vähentänyt Qwen 27B:n kieltäytymisiä. Tiedämme kuitenkin, että sama ohje tuotti eri malleille hyvin erilaisen tasapainon, joten ohje ja malli kannattaa testata yhdessä.

Kaksi esimerkkiä näyttää, miten valinta kannattaa tehdä. Jos malli poimii ostolaskulta tilinumeron maksua varten, keksitty arvo maksaa rahaa, ja silloin varovaisuus kannattaa. Jos malli kokoaa pöytäkirjasta päätökset sisäiseen käyttöön, turha kieltäytyminen haittaa enemmän kuin yksittäinen epätarkkuus. Riski kasvaa, kun tekoäly saa toimia ilman ihmisen tarkistusta, ja juuri se on tekoälyagentin ja perinteisen automaation keskeinen ero.

Neljä asiaa, jotka kannattaa ottaa mukaan testiin ennen käyttöönottoa:

  1. Ansakysymyksiä houkuttimilla. Kysy tietoa, jota dokumentissa ei ole mutta jonka lähellä on samannäköinen arvo. Ansat ilman houkutinta ovat liian helppoja.
  2. Kaksi lukua yhden sijaan. Mittaa erikseen keksittyjen vastausten osuus ja oikeiden vastausten osuus niistä kysymyksistä, joihin vastaus on olemassa. Yhteinen keskiarvo piilottaa juuri sen, mitä haluat nähdä.
  3. Kieltäytymisten läpikäynti. Tarkista, kuinka moni "tietoa ei löydy" -vastaus oli oikeasti väärä. Jos niitä on paljon, kokeile ohjeen säätämistä ennen kuin vaihdat mallia.
  4. Johtopäätös omaan kenttäänsä. Pyydä mallilta lopullinen vastaus erillisenä kenttänä, jotta automaatio ei tulkitse vastauksen ensimmäistä sanaa johtopäätökseksi.

Omalla koneella ajettava malli on luonteva lähtökohta tällaiselle testille, koska asiakirjat pysyvät omassa ympäristössä myös kokeiluvaiheessa. Jos asiakirjat ovat luottamuksellisia, tekoälyn tietoturvan tarkistuslista pk-yritykselle auttaa selvittämään, missä asiakirjoja saa käsitellä ja mihin palveluihin niitä saa lähettää.

Tulokset koskevat kuutta tavallisella toimistokoneella ajettua mallia, lyhyitä ja keskipitkiä dokumentteja sekä yhtä ajokertaa kysymystä kohden. Pilvipalveluiden malleja ei tässä testissä mitattu.

Jos haluat tietää, missä dokumenttiprosesseissanne tekoälyn voi antaa toimia yksin ja missä tarvitaan ihmisen tarkistus, kiinteähintainen automaatiokartoitus käy prosessit läpi ja laskee kullekin kohteelle euromääräisen hyödyn.

Mihin tekoälyn voi luottaa dokumenttityössänne?

Automaatiokartoitus käy dokumenttiprosessinne läpi ja kertoo, mitkä työvaiheet tekoäly hoitaa luotettavasti ja mihin tarvitaan ihmisen tarkistus.

Varaa automaatiokartoitus

Empirica Finland on suomalainen operatiivisen tekoälyn ja automaation toteuttaja, joka rakentaa automaatiot yrityksen järjestelmien sekä laitteiden ja antureiden tuottamasta datasta ja vastaa automaatioiden jatkuvasta toiminnasta. Empirica on Claude Partner Network -jäsen ja Microsoft-kumppani.

← Takaisin pääsivulle

KategoriaTutkimus ja originaalidata