Lyhyt kuvaus: VAKE Donate Speech -palvelu kerää suomenkielistä puhedataa puheentunnistuksen ja äänipohjaisten tekoälysovellusten kehittämiseen. Aineisto tukee suomen kielen puheteknologian tutkimusta ja kehitystä.
1. Yrityksen kuvaus
Lahjoita puhetta -hanke on valtakunnallinen suomalainen aloite, jonka tavoitteena on kerätä suomenkielistä puhedataa tekoälytutkimuksen ja -kehityksen edistämiseksi. Hankkeen käynnisti valtion kehitysyhtiö Vake Oy (nykyisin Ilmastorahasto Oy), yhteistyössä Yleisradion (Yle), Helsingin yliopiston (Suomen kielipankki / FIN-CLARIN) sekä teknologiakonsultti Solitan kanssa.
2. Mikä ongelma tekoälyn oli tarkoitus ratkaista?
- Suomi on monimutkainen, vähän resursseja omaava kieli, jolle on ominaista rikas morfologia, murteelliset vaihtelut, slangi ja ainutlaatuiset foneettiset piirteet. Suuret kansainväliset kaupalliset puheentunnistusteknologiat (kuten Apple tai Google) eivät kykene tarkasti litteroimaan puhekielistä, luonnollista suomea. Hankkeen tavoitteena oli rakentaa laaja ja erittäin monipuolinen puhedatasetti (kattaen eri alueet, ikäryhmät, sukupuolet ja ei-äidinkieliset puhujat) tekoäly-/koneoppimispohjaisten automaattisten puheentunnistusmallien (ASR) koulutukseen, jotta paremmat digitaaliset palvelut mahdollistuisivat esimerkiksi terveydenhuollossa, opetuksessa ja vanhustenhoidossa.
3. Miten ongelma ratkaistiin ja millä työkaluilla?
- Solita suunnitteli ja toteutti verkkopalvelualustan (lahjoitapuhetta.fi) sekä mobiilisovellusalustan, joiden avulla kansalaiset eri puolilta Suomea voivat lahjoittaa ääninäytteitä helposti, turvallisesti ja osallistavasti ohjattujen keskustelukehotteiden ja pelillistettyjen vuorovaikutusten kautta. Alusta rakennettiin modulaarisella, erittäin tietoturvallisella pilviarkkitehtuurilla, joka varmistaa täyden GDPR-vaatimustenmukaisuuden ja anonymisoinnin. Kerätyt ääninäytteet käsiteltiin ja siirrettiin Helsingin yliopiston Suomen kielipankkiin (Kielipankki) jäsenneltyä jakelua varten akateemisille tutkijoille ja kaupallisille kehittäjille.
4. Mitä tuloksia saavutettiin?
- Kampanjassa onnistuttiin keräämään yli 4 000 tuntia luonnollista suomenkielistä puhedataa yli 20 000–25 000 yksittäiseltä osallistujalta, kattaen kaikki Suomen maantieteelliset alueet. Tämä loi vahvan perustan kielitieteelliselle tutkimukselle sekä avoimen lähdekoodin ja kaupallisten suomenkielisten puhetekoälymallien kehitykselle. Lisäksi taustalla oleva teknologia-alusta rakennettiin skaalautuvaksi ja modulaariseksi ratkaisuksi, joka voidaan paketoida ja monistaa myös muiden kansainvälisten kielimarkkinoiden käyttöön.
5. Mitä ongelmia ilmeni?
Keskeisiä haasteita olivat otosjoukon monipuolisuuden varmistaminen aliedustetuissa ryhmissä (esim. alueelliset murteet kuten Turun puhe, kaupunkislangi, iäkkäät puhujat, lapset ja suomea opiskelevat) sekä käyttäjien jatkuvan osallistumisen ylläpito. Lisäksi julkisten äänitallenteiden täydellisen anonymisoinnin takaavan tiukan oikeudellisen ja tietosuojakehyksen rakentaminen oli monitieteinen haaste, joka vaati tiivistä yhteistyötä juridisten, tietoturva- ja kieliasiantuntijoiden välillä.
6. Aika- ja rahainvestoinnit
Julkaistu tapaustutkimus ei paljasta tarkkoja taloudellisia investointeja tai kehitysbudjetteja. Ajallisesti projektiin sisältyi 6 kuukauden alkuvaiheen suunnittelujakso, joka käynnistyi syksyllä 2019 ja jossa määriteltiin konsepti, tekninen arkkitehtuuri ja oikeudellinen kehys. Julkinen puhekeruukampanja käynnistyi kesäkuussa 2020 ja jatkui usean vuoden ajan aina maaliskuuhun 2024 saakka.
7. Millaista osaamista tarvittiin ja mitä yhteistyökumppaneita käytettiin?
- Projekti vaati poikkitieteellistä osaamista, kuten UX/UI-suunnittelua, mobiili- ja verkkosovelluskehitystä, pilviarkkitehtuuria, MLOps-osaamista, tietosuojan ja GDPR:n hallintaa, kielitiedettä sekä julkisen tietoisuuskampanjan toteutusta. Keskeisiä kumppaniorganisaatioita olivat Vake Oy (aloittaja ja rahoittaja), Solita (tekninen suunnittelu ja toteutus), Yle (mediakampanja ja sisällöntuotanto), Helsingin yliopisto / Kielipankki (kielitiede ja datanhallinta) sekä 1001 Lakes Oy (tiedonhallinnan konsultointi).
8. Liiketoimintafunktion luokitus
Tämä projekti sijoittuu tekoälyn/koneoppimisen dataomaisuuden rakentamiseen, luonnollisen kielen käsittelyyn ja puheentunnistukseen (NLP & ASR), digitaaliseen julkiseen infrastruktuuriin sekä joukkoistetun datankeruun alustoihin.
9. Lähde
Avainsanat:
koneoppiminen, luonnollisen kielen käsittely, puheentunnistus, tietoturva, terveydenhuolto, puheaineisto, kieliteknologia, Solita






Vastaa