Pyydä tekoälychatbotilta osakekurssia, oikeudenkäyntipäivää tai yrityksen johtajan nimeä, ja vastaus voi tulla täysin varmana. Se on hämmentävää. Lause voi kuulostaa sujuvalta, sävy varmalta, mutta tiedot voivat silti olla virheellisiä.
Uusi luotettavuusanalyysi Legal Guardian Digitalilta, lainopistoihin keskittyvältä SEO-yritykseltä, laittaa numeroita ongelman taakse, jonka monet käyttäjät jo tunnistavat: jotkut suosituista tekoälychatboteista tuottavat harhaanjohtavia vastauksia huomattavasti useammin kuin toiset. Kun noin neljännes yhdysvaltalaisista työntekijöistä käyttää tekoälytyökaluja säännöllisesti, ero hyödyllisen avustajan ja vakuuttavan väärän tiedon lähteen välillä ei ole pieni seikka.
Epämukava osa: varmuus ei tarkoita tarkkuutta
Suurikokoiset kielimallit eivät ajattele kuten ihmiset. Niitä on koulutettu ennustamaan todennäköisiä sanoja ja lauseita valtavien tekstimäärien kaavojen perusteella. Kun järjestelmällä on riittävästi kontekstia, se voi tuottaa nopeita, hyödyllisiä vastauksia. Kun kontekstia ei ole, malli voi silti luoda vastauksen, joka kuulostaa uskottavalta, koska tilastollisesti sanat sopivat yhteen.
Sillä tavoin ihmiset yleensä tarkoittavat, kun sanovat tekoälychatbotin 'hallusinoivan'. Se ei haaveile. Se ei valehtele ihmisen merkityksessä. Se tuottaa vastauksen ilman luotettavaa tosiasiapohjaa, minkä vuoksi nimet, päivämäärät, oikeudelliset viittaukset, lääketieteelliset tiedot, taloudelliset luvut ja tuoreet uutiset vaativat edelleen ihmisen varmistuksen.
Tutkimus vertaili useita tunnettuja tekoälymalleja tarkastelemalla hallusinaatioiden esiintymistä, asiakastyytyväisyyttä, vastausten laatua ja käytettävyyttä. Nämä tekijät yhdistettiin 0–100 pisteen indeksiin, mikä antaa laajemman kuvan siitä, mitkä chatbotit ovat arkipäivän käytössä luotettavimpia.
Google Gemini osoittautui ryhmän korkeimmaksi hallusinaatioprosentiltaan, ja sen väitetään tuottaneen virheellistä tietoa 32 % vastauksista. Luku on erityisen kiinnostava, kun otetaan huomioon raportit siitä, että Apple maksaa Googlen vähintään miljardi dollaria vuodessa käyttääkseen räätälöityä 1,2 biljoonan parametrin Geminia tulevaa Siri-päivitystä varten, joka odotetaan iOS 27:n yhteydessä.
ChatGPT tuli lähelle, sillä hallusinaatioita esiintyi noin kolmessa kymmenestä vastauksesta. Yksinkertaisesti sanottuna, jos luvut pitävät paikkansa, ChatGPT olisi tässä testissä noin kaksi kertaa todennäköisemmin antamassa virheellisen vastauksen kuin DeepSeek. Vertailu herättää todennäköisesti huomiota, ei vähiten siksi, että DeepSeek kehitettiin murto-osalla johtavien yhdysvaltalaisten mallien koulutuskustannuksista.
Perplexity AI pärjäsi parhaiten hallusinaatioiden suhteen, sillä virheelliset vastaukset tavoittivat käyttäjät 13 % tapauksista. DeepSeek oli lähellä 14 %:lla, ja Elon Muskin Grok oli 15 %. Käyttäjille, jotka luottavat tekoälyyn tutkimuksessa, tiivistelmissä tai nopeissa faktantarkistuksissa, nuo erot merkitsevät.

Se, että palvelu on verkossa, on silti tärkeää
Tarkkuus on vain osa tarinaa. Chatbot voi olla paperilla erinomainen mutta hyödyytön, jos se ei ole saatavilla, kun sitä tarvitaan. Käytettävyydessä Perplexity AI ja Grok olivat tutkimuksen ainoat kaksi palvelua, jotka pysyivät käytettävissä koko testijakson ajan.
ChatGPT ja Gemini eivät jääneet kauas, käytettävyysprosenttien ollessa 99,98 % ja 99,95 %. Jopa Claude, jolla oli tutkimuksen alhaisin käytettävyys, pysyi hyvin luotettavana 99,68 %:ssa tapauksista. Käytännössä suurin osa näistä työkaluista oli verkossa lähes koko ajan, mutta pienet erot voivat silti olla merkityksellisiä yrityksille, jotka ovat riippuvaisia tekoälytyönkuluista.
Käyttäjätyytyväisyys kertoi toisen tarinan. DeepSeek ja ChatGPT saivat molemmat korkeimman asiakastyytyväisyysarvosanan 4,7/5. Perplexity AI seurasi 4,6:lla. Meta AI oli häntäpäässä 3,4:llä, samalla kun useat muut mallit sijoittuivat noin 4,4:n tienoille.
Vastausten johdonmukaisuuden ja laadun osalta Kimi AI oli kärjessä arvosanalla 4,3/5. ChatGPT, Microsoft Copilot ja Gemini olivat tasapisteissä 4,0:lla. Meta AI sijoittui jälleen viimeiseksi 3,4:llä, mikä viittaa siihen, ettei sen heikompi kokonaispiste johtunut yhdestä ainoasta huonosta kategoriasta.
Kun kaikki tekijät yhdistettiin, Perplexity AI otti ykkössijan indeksipisteellä 85. Grok sijoittui toiseksi 79 pisteellä, jota seurasi DeepSeek. ChatGPT päätyi kuudenneksi 50 pisteellä, kun taas Gemini oli kahdeksas 41 pisteellä. Meta AI oli viimeisenä 37 pisteellä.
Suurempi opetus ei ole, että yhtä chatbotia tulisi luottaa sokeasti ja toista vältellä lopullisesti. Tekoälytyökalut muuttuvat nopeasti. Mallit päivittyvät, turvarajat muuttuvat, ja suorituskyky voi parantua lähes yhdessä yössä. Silti tällainen järjestys muistuttaa hyödyllisesti: kuuluisin chatbot ei ole aina luotettavin, eikä sujuvin vastaus aina ole oikea.
Kenelle tahansa, joka käyttää tekoälyä työssä, turvallisin lähestymistapa on yksinkertainen. Kohtele chatbotteja nopeuttajina, ei lopullisina auktoriteetteina. Anna niiden luonnostella, järjestää, tiivistää ja ideoida. Mutta kun vastaus koskee rahaa, terveyttä, lakia, henkilöllisyyttä tai päätöstä, jolla on todellisia seurauksia, tarkista faktat ennen kuin toimit.





Keskustelu
Jätä kommentti
Kommentit
Ei vielä kommentteja. Ole ensimmäinen.