Tiedon laatu nousee strategiseksi tekoälyriskiksi – Unstructured Data & AI Governance Survey 2026
Organisaatioihin on vuosien aikana kertynyt valtavia määriä rakenteetonta tietoa tiedostopalvelimille, SharePointiin, Teamsiin, OneDriveen, sähköposteihin ja erilaisiin pilvipalveluihin.
Pitkään suuri osa tästä tiedosta on voinut jäädä ilman suurempaa huomiota. Tekoäly muuttaa tilannetta.
Kun Copilotit, älykkäät avustajat ja analytiikkaratkaisut saavat pääsyn organisaation päivittäisiin tietoympäristöihin, tiedon laatu, ajantasaisuus, elinkaari, omistajuus, arkaluonteisuus ja käyttöoikeudet korostuvat. Tekoäly voi hyödyntää vain sitä tietoa, johon sillä on pääsy. Jos taustalla oleva tieto on vanhentunutta, hajanaista, huonosti hallittua tai liian laajasti saatavilla, myös nämä ongelmat voivat siirtyä osaksi tekoälyä hyödyntäviä prosesseja.
GDPR Tech toteutti yhdessä Tutkimusvoiman kanssa Unstructured Data & AI Governance Survey 2026 -tutkimuksen selvittääkseen, miten organisaatiot tällä hetkellä hallitsevat rakenteetonta tietoa ja millaisia riskejä, haasteita ja kehitystarpeita siihen liittyy.
Kansainväliseen asiantuntijakyselyyn vastasi 86 ammattilaista Euroopasta, Pohjois-Amerikasta ja Aasian ja Tyynenmeren alueelta sekä globaalisti toimivista organisaatioista. Vastaajat työskentelivät muun muassa tietosuojan, tiedonhallinnan, compliancen, teknologian, liiketoiminnan ja johdon tehtävissä.
Keskeiset havainnot
- Vain 18 prosenttia vastaajista arvioi organisaatiollaan olevan hyvä tai tarkka näkyvyys rakenteettoman tiedon kokonaismäärään.
- Useimmin valittu riski oli arkaluonteinen tieto tai henkilötiedot hallitsemattomissa tallennuspaikoissa. Sen valitsi 73 prosenttia vastaajista.
- 53 prosenttia vastaajista valitsi riskiksi vanhentuneen tiedon ja 53 prosenttia virheellisen tai heikkolaatuisen tiedon.
- Noin 65 prosenttia arvioi organisaationsa rakenteettoman tiedon hallinnan puuttuvan kokonaan tai olevan vasta alkuvaiheessa.
- Vain 7 prosenttia ilmoitti, että säilytysajat ja poistokäytännöt on sekä toteutettu että niiden noudattamista seurataan.
Näkyvyys rakenteettomaan tietoon on edelleen heikko
Yksi tutkimuksen selkeimmistä havainnoista liittyy perustavanlaatuiseen kysymykseen: kuinka hyvin organisaatiot ylipäätään tietävät, mitä rakenteetonta tietoa niillä on.
Vain 18 prosenttia vastaajista arvioi organisaatiollaan olevan hyvä tai tarkka näkyvyys rakenteettoman tiedon kokonaismäärään. Useimmilla oli käytössään vain karkea arvio, ja osalla ei ollut näkyvyyttä lainkaan.
Tämä on merkittävää, koska organisaatioiden pitäisi pystyä määrittämään, mitä tietoa tekoäly saa käyttää, mitä sen ei pitäisi käyttää ja millä ehdoilla.
Jos tietoympäristöä ei tunneta riittävästi, myös tekoälyn käyttötapauksen luotettavan tietopohjan määrittely vaikeutuu.
Arkaluonteinen tieto ja henkilötiedot ovat suurin riski
Useimmin valittu riski oli arkaluonteinen tieto tai henkilötiedot hallitsemattomissa tallennuspaikoissa. Tämän valitsi 73 prosenttia vastaajista.
Muita usein tunnistettuja riskejä olivat:
- vanhentunut tieto, 53 %
- virheellinen tai heikkolaatuinen tieto, 53 %
- arkaluonteisen tiedon vuotaminen tekoälyn kautta, 52 %
- tekoälyn pääsy tietoon ilman asianmukaista valvontaa, 52 %
- liian laajat käyttöoikeudet, 49 %
Tulokset osoittavat, ettei tekoälyn hallintaa voida erottaa olemassa olevista tiedonhallinnan, tietosuojan ja käyttöoikeuksien hallinnan käytännöistä.
Riski ei liity vain siihen, että tekoäly voi tuottaa virheellisiä vastauksia. Ongelmat voivat olla olemassa jo siinä tiedossa, johon tekoäly pääsee käsiksi.
Tiedon laatu ansaitsee enemmän huomiota
Tiedon laatu nousi tutkimuksessa erityisen kiinnostavaksi teemaksi.
Yli puolet vastaajista tunnisti vanhentuneen tiedon merkittäväksi riskiksi, ja yhtä moni virheellisen tai heikkolaatuisen tiedon. Lähes puolet vastaajista mainitsi myös päällekkäisen tai hajanaisen tiedon.
Tämä ei tarkoita, että tiedon laatu olisi tutkimuksessa noussut yksittäiseksi suurimmaksi riskiksi. Arkaluonteinen tieto ja henkilötiedot hallitsemattomissa tallennuspaikoissa nousivat selvästi korkeammalle.
Tulokset kuitenkin viittaavat siihen, että tiedon laadulla pitäisi olla nykyistä vahvempi rooli tekoälyyn liittyvässä strategisessa riskienhallinnassa.
Organisaatioissa huomio kohdistuu usein ensin tekoälymalleihin, toimittajiin, tietoturvaan ja käyttöpolitiikkoihin. Ne ovat tarpeellisia, mutta ne eivät ratkaise taustalla olevan tiedon ongelmia.
Hallintamallit ovat vielä kypsymättömiä
Tutkimus osoittaa myös merkittävän kypsyyskuilun.
Noin 65 prosenttia vastaajista arvioi organisaationsa rakenteettoman tiedon hallinnan joko puuttuvan kokonaan tai olevan vasta alkuvaiheessa ja tapauskohtaista (ad hoc).
Vain 7 prosenttia ilmoitti, että rakenteettoman tiedon säilytysajat ja poistokäytännöt on sekä toteutettu että niiden noudattamista seurataan.
Samaan aikaan rakenteetonta tietoa käytetään jo tekoäly- ja analytiikkaratkaisuissa. Lähes puolet vastaajista ilmoitti jonkinasteisesta tuotantokäytöstä.
Tilanne on hallinnan kannalta tuttu: teknologian käyttöönotto voi edetä nopeammin kuin sen tarvitsema tiedonhallinta.
Tekoälyn hallinta alkaa tiedonhallinnasta
Tutkimuksen tulokset johtavat varsin käytännölliseen johtopäätökseen.
Ennen kuin tekoälyratkaisu yhdistetään laajoihin tietoympäristöihin, organisaation pitäisi ainakin ymmärtää:
- mitä tietoa sillä on
- missä tieto sijaitsee
- kuka siitä vastaa
- kenellä siihen on pääsy
- onko tieto edelleen ajantasaista ja tarpeellista
- kuinka arkaluonteista tieto on
- kuinka kauan sitä pitäisi säilyttää
- soveltuuko tieto kyseiseen tekoälyn käyttötarkoitukseen
Teknologia voi auttaa tiedon löytämisessä, metatietojen ja käyttöoikeuksien analysoinnissa sekä sisällön luokittelussa suuressa mittakaavassa. Tulosten tulkinta, riskien arviointi ja hallintapäätökset edellyttävät kuitenkin edelleen ihmisen harkintaa.
Tavoitteena ei ole siivota jokaista tiedostoa ennen tekoälyn käyttöönottoa. Sillä tavalla tekoälyprojekti saataisiin kätevästi siirrettyä seuraavalle vuosikymmenelle.
Käytännöllisempi tapa on aloittaa niistä tietolähteistä ja ympäristöistä, joita tietty liiketoiminnan käyttötapaus tarvitsee, arvioida ne kunnolla ja laajentaa hallintaa vaiheittain
Lataa Executive Insight Report
Unstructured Data & AI Governance Survey 2026 – Executive Insight Report kokoaa tutkimuksen keskeiset havainnot, valittuja avoimia vastauksia sekä käytännön johtopäätöksiä tekoälyä ja analytiikkaa hyödyntäville organisaatioille.
Lataa Executive Insight Report (PDF, englanniksi)
Tutkimuksen toteutti GDPR Tech yhteistyössä Tutkimusvoiman kanssa. Tulokset raportoidaan anonymisoidussa muodossa.