VAKE Donate Speech -palvelu kerää suomenkielistä puhedataa puheentunnistuksen ja äänipohjaisten tekoälysovellusten kehittämiseen. Aineisto tukee suomen kielen puheteknologian tutkimusta ja kehitystä.
1. Yrityksen kuvaus
- Lahjoita puhetta -hanke on valtakunnallinen suomalainen aloite, jonka tavoitteena on kerätä suomenkielistä puhedataa tekoälytutkimuksen ja -kehityksen edistämiseksi.
- Hankkeen käynnisti valtion kehitysyhtiö Vake Oy (nykyisin Ilmastorahasto Oy), yhteistyössä Yleisradion (Yle), Helsingin yliopiston (Suomen kielipankki / FIN-CLARIN) sekä teknologiakonsultti Solitan kanssa.
2. Mikä ongelma tekoälyn oli tarkoitus ratkaista?
- Suomi on monimutkainen, vähän resursseja omaava kieli, jolle on ominaista rikas morfologia, murteelliset vaihtelut, slangi ja ainutlaatuiset foneettiset piirteet.
- Suuret kansainväliset kaupalliset puheentunnistusteknologiat (kuten Apple tai Google) eivät kykene tarkasti litteroimaan puhekielistä, luonnollista suomea.
- Hankkeen tavoitteena oli rakentaa laaja ja erittäin monipuolinen puhedatasetti (kattaen eri alueet, ikäryhmät, sukupuolet ja ei-äidinkieliset puhujat) tekoäly-/koneoppimispohjaisten automaattisten puheentunnistusmallien (ASR) koulutukseen, jotta paremmat digitaaliset palvelut mahdollistuisivat esimerkiksi terveydenhuollossa, opetuksessa ja vanhustenhoidossa.
3. Miten ongelma ratkaistiin ja millä työkaluilla?
- Solita suunnitteli ja toteutti verkkopalvelualustan (lahjoitapuhetta.fi) sekä mobiilisovellusalustan, joiden avulla kansalaiset eri puolilta Suomea voivat lahjoittaa ääninäytteitä helposti, turvallisesti ja osallistavasti ohjattujen keskustelukehotteiden ja pelillistettyjen vuorovaikutusten kautta.
- Alusta rakennettiin modulaarisella, erittäin tietoturvallisella pilviarkkitehtuurilla, joka varmistaa täyden GDPR-vaatimustenmukaisuuden ja anonymisoinnin.
- Kerätyt ääninäytteet käsiteltiin ja siirrettiin Helsingin yliopiston Suomen kielipankkiin (Kielipankki) jäsenneltyä jakelua varten akateemisille tutkijoille ja kaupallisille kehittäjille.
4. Mitä tuloksia saavutettiin?
- Kampanjassa onnistuttiin keräämään yli 4 000 tuntia luonnollista suomenkielistä puhedataa yli 20 000–25 000 yksittäiseltä osallistujalta, kattaen kaikki Suomen maantieteelliset alueet.
- Tämä loi vahvan perustan kielitieteelliselle tutkimukselle sekä avoimen lähdekoodin ja kaupallisten suomenkielisten puhetekoälymallien kehitykselle.
- Lisäksi taustalla oleva teknologia-alusta rakennettiin skaalautuvaksi ja modulaariseksi ratkaisuksi, joka voidaan paketoida ja monistaa myös muiden kansainvälisten kielimarkkinoiden käyttöön.
5. Mitä ongelmia ilmeni?
- Keskeisiä haasteita olivat otosjoukon monipuolisuuden varmistaminen aliedustetuissa ryhmissä (esim. alueelliset murteet kuten Turun puhe, kaupunkislangi, iäkkäät puhujat, lapset ja suomea opiskelevat) sekä käyttäjien jatkuvan osallistumisen ylläpito.
- Lisäksi julkisten äänitallenteiden täydellisen anonymisoinnin takaavan tiukan oikeudellisen ja tietosuojakehyksen rakentaminen oli monitieteinen haaste, joka vaati tiivistä yhteistyötä juridisten, tietoturva- ja kieliasiantuntijoiden välillä.
6. Aika- ja rahainvestoinnit
- Julkaistu tapaustutkimus ei paljasta tarkkoja taloudellisia investointeja tai kehitysbudjetteja.
- Ajallisesti projektiin sisältyi 6 kuukauden alkuvaiheen suunnittelujakso, joka käynnistyi syksyllä 2019 ja jossa määriteltiin konsepti, tekninen arkkitehtuuri ja oikeudellinen kehys.
- Julkinen puhekeruukampanja käynnistyi kesäkuussa 2020 ja jatkui usean vuoden ajan aina maaliskuuhun 2024 saakka.
7. Millaista osaamista tarvittiin ja mitä yhteistyökumppaneita käytettiin?
- Projekti vaati poikkitieteellistä osaamista, kuten UX/UI-suunnittelua, mobiili- ja verkkosovelluskehitystä, pilviarkkitehtuuria, MLOps-osaamista, tietosuojan ja GDPR:n hallintaa, kielitiedettä sekä julkisen tietoisuuskampanjan toteutusta.
- Keskeisiä kumppaniorganisaatioita olivat Vake Oy (aloittaja ja rahoittaja), Solita (tekninen suunnittelu ja toteutus), Yle (mediakampanja ja sisällöntuotanto), Helsingin yliopisto / Kielipankki (kielitiede ja datanhallinta) sekä 1001 Lakes Oy (tiedonhallinnan konsultointi).
8. Liiketoimintafunktion luokitus
- Tämä projekti sijoittuu tekoälyn/koneoppimisen dataomaisuuden rakentamiseen, luonnollisen kielen käsittelyyn ja puheentunnistukseen (NLP & ASR), digitaaliseen julkiseen infrastruktuuriin sekä joukkoistetun datankeruun alustoihin.






Vastaa