Osaako tekoäly lukea suomalaista laskua? Kuusi mallia testissä

Kuusi mallia, 250 kysymystä, 50 suomalaista asiakirjaa

Osaako tekoäly lukea suomalaista laskua? Kuusi mallia testissä

23.9.20265 min lukuaika

Testasimme kuutta omalla koneella ajettavaa kielimallia 250 kysymyksellä, jotka koskivat 50:tä suomenkielistä laskua, tarjouspyyntöä, sopimusta ja pöytäkirjaa. Kolme mallia vastasi oikein 85-95 prosenttiin kysymyksistä, vaikka ne ajettiin tavallisella tietokoneella ilman tekoälyä varten hankittua laitteistoa. Mallit löytävät yksittäisen tiedon dokumentista lähes virheettä, mutta ehtojen soveltaminen on selvästi vaikeampaa. Siinä parhaankin mallin tulos jäi 83 prosenttiin.

Omalla koneella ajettava kielimalli (local LLM) on kiinnostava vaihtoehto yritykselle, joka ei halua tai saa siirtää asiakirjojaan ulkopuoliseen pilvipalveluun. Julkiset vertailut mittaavat kuitenkin lähes aina englantia ja yleistietoa, eivät sitä, osaako malli lukea suomalaisen laskun maksuehdon tai tarjouspyynnön määräajan oikein. Siksi mittasimme sen itse.

Tutkimus lyhyesti

Aineisto:
50 suomenkielistä dokumenttia: 16 laskua, 14 tarjouspyyntöä, 10 sopimusta ja 10 pöytäkirjaa.
Kysymykset:
250, viisi tyyppiä: poiminta, laskenta, ehdon soveltaminen, ristiviittaus ja ansakysymys, jossa tietoa ei ole dokumentissa.
Testatut mallit:
Gemma 4 12B, Qwen 3.8 27B, Phi-4, Qwen3 8B, Mistral 7B ja Llama 3.2 3B.
Ajoympäristö:
Omalla koneella LM Studiolla, pelkällä prosessorilla, vastausten satunnaisuus pois päältä (lämpötila 0).
Paras tulos:
Gemma 4 12B, 94,6 % oikein 202 kysymyksen yhteisellä otoksella.
Suurin ero:
Poiminta 94-100 %, ehdon soveltaminen enintään 83 %.

Mitä testattiin ja miten?

Jokaisesta dokumentista laadittiin viisi kysymystä, yksi kutakin tyyppiä, ja jokaisella kysymyksellä on vastausavain ja viittaus lähdetekstin riveihin. Tarjouspyynnöt, sopimukset ja pöytäkirjat ovat aitoja julkisia asiakirjoja. Laskut on luotu testiä varten, koska aitoja myyntilaskuja ei ole julkisesti saatavilla. Ne tehtiin ohjelmallisesti valmiista laskupohjista eikä kielimallilla, jotta mikään testattava malli ei saisi etua tutunoloisesta tekstistä. Asiakasaineistoa ei käytetty.

Kaikki mallit saivat saman ohjeen: vastaa vain dokumentin perusteella, älä arvaa ja ilmoita, jos tietoa ei löydy. Pisteytys tehtiin kahdessa vaiheessa. Automaatti ratkaisi varmat tapaukset, ja loput vastaukset luettiin käsin.

Ansakysymyksissä kysytty tieto puuttuu dokumentista, mutta sen lähellä on houkutin. Esimerkiksi kun kysytään ostajan Y-tunnusta, dokumentissa on myyjän tunnus. Oikea vastaus on silloin "tietoa ei löydy".

Mikä tekoälymalli ymmärtää suomea parhaiten?

Kärkeen nousi kolme mallia, ja niistä Gemma 4 12B oli selvästi paras. Osa pisimmistä dokumenteista jäi joiltakin malleilta käsittelemättä, joten vertailussa ovat mukana ne 202 kysymystä, joihin kaikki kuusi mallia antoivat vastauksen. Näin jokaista mallia mitattiin samoilla kysymyksillä.

MalliParametritOikeinOsuus
Gemma 4 12B12 mrd.191 / 20294,6 %
Qwen 3.8 27B27 mrd.180 / 20289,1 %
Phi-414 mrd.171 / 20284,7 %
Qwen3 8B8 mrd.125 / 20261,9 %
Mistral 7B7 mrd.103 / 20251,0 %
Llama 3.2 3B3 mrd.70 / 20234,7 %

Taulukosta nousee kaksi havaintoa:

  • Koko ei ratkaise. Gemma on alle puolet Qwen 27B:n koosta, mutta se vastasi oikein 14 kysymykseen, joihin Qwen ei pystynyt. Qwen taas vastasi oikein vain kolmeen, joihin Gemma ei pystynyt. Ero on tilastollisesti merkitsevä (p ≈ 0,01).
  • Kärjen ja keskitason välillä on yli 20 prosenttiyksikön kuilu. Alle kymmenen miljardin parametrin mallit eivät tässä testissä riittäneet liiketoimintadokumenttien käsittelyyn.

Riittääkö, että tekoäly löytää tiedon dokumentista?

Ei riitä. Viisi mallia kuudesta löysi yksittäisen arvon, kuten Y-tunnuksen tai määräajan, 94-100-prosenttisesti. Kun vastaus piti laskea tai päätellä, erot kasvoivat: kärkimallit vastasivat oikein 66-98 prosenttiin kysymyksistä, keskitason mallit vain 19-48 prosenttiin. Dokumentista vastaaminen ei ole sama asia kuin dokumentin ymmärtäminen.

Vaikein tehtävä oli ehdon soveltaminen. Tyypillinen kysymys oli: "Ostaja maksaa laskun 10.6.2026. Onko maksu myöhässä, ja millä korolla viivästystä veloitetaan?" Siihen vastaaminen vaatii eräpäivän löytämistä, päivien laskemista ja oikean ehdon valintaa. Gemma onnistui 83 prosentissa, Qwen 27B 71 prosentissa ja Phi-4 66 prosentissa.

Juuri tätä odotetaan reskontra- tai hankinta-avustajalta, ja virheet olivat opettavaisia:

  • Phi-4 lisäsi maksuehdon päivät eräpäivään viidessä laskukysymyksessä ja päätteli, ettei myöhässä oleva maksu ole myöhässä. Virhe toistui samanlaisena, joten se on järjestelmällinen.
  • Välivaihe unohtui. 3 tuntia kertaa 52 euroa laskettiin oikein 156 euroksi, mutta arvonlisävero jäi lisäämättä, vaikka kysyttiin verollista hintaa.
  • Vastaus korjasi itsensä kesken. Qwen 27B ja Phi-4 aloittivat usein väärällä kyllä- tai ei-vastauksella ja päätyivät lopussa oikeaan. Lukija, joka lukee vain ensimmäisen lauseen, saa väärän vastauksen.

Käytännön johtopäätös on selvä: poiminnan voi automatisoida lähes suoraan, mutta ehtojen ja laskennan kohdalla prosessiin kuuluu tarkistus. Jos mietit, mistä dokumenttityöstä automaation voisi aloittaa, käytä samaa pisteytystä kuin ensimmäisen automaatiokohteen valinnassa: aloita työstä, joka toistuu usein ja noudattaa selkeitä sääntöjä.

Tekoäly suomalaisten laskujen ja sopimusten käsittelyssä

Keksiikö malli vastauksen, kun tietoa ei ole?

Kärkimallit eivät keksineet. Gemma ja Qwen 27B vastasivat jokaiseen ansakysymykseen oikein, että tietoa ei löydy. Mistral 7B keksi vastauksen 20 ansaan 49:stä eli 41 prosentissa, ja muilla malleilla osuus oli 7-8 prosenttia.

Lähes jokainen keksitty vastaus oli dokumentissa lähellä ollut, väärään kysymykseen kuuluva arvo. Kun kysyttiin ostajan Y-tunnusta, Mistral antoi myyjän tunnuksen. Kun kysyttiin takuuaikaa, se vastasi "78 kuukautta", joka oli hankinnan arvioitu kesto. Hallusinaatio ei siis ole satunnaista keksimistä, vaan tarttumista väärään mutta uskottavaan lukuun. Siksi sitä on vaikea huomata.

Kärkimalleilla ongelma oli päinvastainen. Qwen 27B:n vääristä vastauksista kaksi kolmasosaa oli kieltäytymisiä kysymyksiin, joihin vastaus löytyi dokumentista, esimerkiksi viivästyskoron laskemiseen. Sama ohje, joka piti mallin ansakysymysten kohdalla virheettömänä, teki siitä liian varovaisen päättelyssä. Tämä on hyvä tietää, kun mallille kirjoitetaan ohjeita: mitä varovaisemmaksi malli ohjeistetaan, sitä harvemmin se keksii vastauksia, mutta sitä useammin se jättää vastaamatta myös kysymykseen, johon vastaus löytyy. Sopiva tasapaino löytyy vain testaamalla.

Mitä tulokset tarkoittavat dokumenttityön automaatiolle?

Omalla koneella ajettava kielimalli riittää suomenkielisten dokumenttien poimintaan ja suureen osaan laskennasta tavallisella koneella, kun malli on valittu oikein. Oman ajon suurin hyöty on se, että asiakirjat pysyvät omassa ympäristössä. Se on yksi niistä kysymyksistä, joita käsittelimme tekoälyn tietoturvan tarkistuslistassa pk-yritykselle.

Rajat tulevat vastaan kolmessa kohdassa:

  • Pitkät dokumentit. Pelkällä prosessorilla osa malleista ei saanut pisimpiä, noin 72 000 merkin asiakirjoja käsiteltyä kohtuullisessa ajassa. Phi-4:n kontekstiin mahtuu noin 40 000 merkkiä. Tulokset kuvaavat siksi lyhyitä ja keskipitkiä dokumentteja.
  • Ehtojen soveltaminen. 83 prosenttia on hyvä tulos mutta ei riittävä ilman tarkistusta, kun kyse on maksuista tai sopimusehdoista.
  • Mallivalinta. Keskitason ja kärjen välinen ero oli yli 20 prosenttiyksikköä. Väärä malli tuottaa virheitä, jotka näyttävät oikeilta.

Testissä olivat mukana vain omalla koneella ajettavat mallit, joten se ei kerro, miten pilvipalveluiden mallit olisivat selvinneet samoista kysymyksistä. Valinta oman koneen ja pilvimallin välillä riippuu siitä, kuinka luottamuksellisia asiakirjat ovat, kuinka pitkiä ne ovat ja kuinka paljon niitä käsitellään. Pilvimallin kuukausikulun voi laskea etukäteen, kuten näytimme artikkelissa mitä tekoälyn käyttö maksaa kuukaudessa.

Neljä asiaa, jotka kannattaa tehdä ennen käyttöönottoa:

  1. Testaa mallia omilla dokumenteillanne, ei julkisilla vertailuilla.
  2. Mittaa erikseen poiminta, laskenta ja ehtojen soveltaminen. Yhteinen keskiarvo voi näyttää hyvältä, vaikka malli epäonnistuisi juuri siinä tehtävässä, jota tarvitsette.
  3. Lisää ansakysymyksiä, joihin oikea vastaus on "tietoa ei löydy".
  4. Lisää ihmisen tarkistus niihin työvaiheisiin, joissa malli soveltaa ehtoja, ja lue mallin vastaukset aina loppuun asti.

Jos haluat tietää, mitkä teidän dokumenttiprosesseistanne sopivat automaatiolle ja mihin tarvitaan ihmisen tarkistus, kiinteähintainen automaatiokartoitus käy ne läpi ja priorisoi kohteet euromääräisen hyödyn mukaan.

Mitkä dokumenttiprosessinne kannattaa automatisoida ensin?

Automaatiokartoitus käy prosessinne läpi ja kertoo, mitkä työvaiheet tekoäly hoitaa luotettavasti ja mihin tarvitaan ihmisen tarkistus.

Varaa automaatiokartoitus

Empirica Finland on suomalainen operatiivisen tekoälyn ja automaation toteuttaja. Se rakentaa automaatiot yrityksen omasta datasta, sekä järjestelmien datasta että laitteiden ja antureiden tuottamasta datasta, ja vastaa niiden jatkuvasta toiminnasta. Empirica on Claude Partner Network -jäsen ja Microsoft-kumppani.

← Takaisin pääsivulle

KategoriaTutkimus ja originaalidata