Vuosi ei ole vielä pitkällä, mutta koneäänistä on kuulunut jo nyt muutamakin mielenkiintoinen uutinen. Tässä lisää niistä:
VALL-E, koneääni kolmen sekunnin ääninäytteestä
Sisällön luominen tekoälyä käyttäen tuli viime vuonna ihmisille tutuksi. Vuoden 2022 puolivälissä kokeiltiin DALL-E:tä ja vuoden lopussa puhututti ChatGPT. DALL-E on tekoälypohjainen ohjelma, joka luo kuvia sille syötetyn tekstin perusteella. ChatGPT taas on ihmiskeskustelijaa jäljittelevä chatbot. Sille syötettyjen avainsanojen tai aiheiden perusteella se voi luoda pyynnöstä niin laulun sanat, tiivistelmän, esseen kuin runonkin. Sisällöntuotannossa ChatGPT toimii esimerkiksi hyvänä inspiraation lähteenä. DALL-E ja ChatGPT ovat molemmat OpenAI:n kehittämiä.
Microsoft esitteli edellä mainittujen kanssa samantyyppisen VALL-E -tekoälymallin heti vuoden 2023 alkuun. VALL-E on tekstistä puheeksi -työkalu, joka pystyy jäljittelemään kenen tahansa puheääntä pelkästään kolmen sekunnin ääninäytteen perusteella. Pystyt siis luomaan esimerkiksi omasta äänestäsi koneäänen ja tämän jälkeen muuttaa tekstisisältöjä puheeksi sinulta kuulostavan äänen lukemina, vain kolmen sekunnin ääninäytteellä. Yleensä koneäänet luodaan useamman kymmenen tunnin ääninäytteen pohjalta.
VALL-E pystyy myös säilyttämään puhujan tunnetilan ja akustiikkaympäristön, jotka osaltaan lisäävät tuotetun koneäänen realistisuutta. Sen kouluttamiseen on käytetty yhteensä 60 000 tuntia englanninkielistä puhetta yli 7000 puhujalta. Aikaisemmissa järjestelmissä puhetta on käytetty noin 600 tuntia.
VALL-E ei ole ainakaan toistaiseksi saatavissa julkiseen käyttöön. Microsoftin antaman eettisen lausunnon mukaan puhujan identiteetin säilyttävään syntetisoituun puheeseen liittyy mahdollisia riskejä mallin väärinkäytöstä. Näitä ovat esimerkiksi äänentunnistuksen huijaaminen ja toisena henkilönä esiintyminen. Jos mallia käytetään, puhujan täytyykin vahvistaa hyväksyvänsä äänensä käytön koneääneksi. Yllä mainittuja riskejä minimoimaan voidaan Microsoftin mukaan kehittää esimerkiksi tunnistusmalli, joka pystyy erottamaan äänen VALL-E:n syntetisoimaksi. VALL-E on erittäin mielenkiintoinen työkalu, ja tuo hienoja mahdollisuuksia esimerkiksi heille, jotka ovat menettäneet äänensä vaikkapa onnettomuuden seurauksena.
Apple julkaisee koneäänen lukemia äänikirjoja
Apple Books kirjapalvelu on tuonut markkinoille uuden mahdollisuuden julkaista kirjoja koneäänen lukemana. Apple kertoo täten tekevänsä äänikirjojen luomisesta helppoa myös yksittäisille kirjailijoille ja pienille kustantamoille. Palvelun kautta pienet toimijat voivat näin tavoittaa lisää yleisöä äänikirjakuuntelijoista. Sloganina onkin: Jokainen kirja ansaitsee tulla kuulluksi.
Ihmislukijoita ei koneäänellä olla korvaamassa ja Apple vakuuttaa jatkavansa edelleen ääninäyttelijöiden lukeman äänikirjavalikoiman kasvattamista. Koneäänellä luetut äänikirjat ovat kuitenkin pienemmille toimijoille tilaisuus päästä äänikirjamarkkinoille, sillä ne tulevat edullisemmaksi kuin studion ja ääninäyttelijän käyttäminen. Koneäänien käyttö nähdään siis mahdollisuutena kasvattaa äänikirjamarkkinoita entisestään.
Äänikirjan lukijaksi voi valita sopivan koneäänen muutamasta vaihtoehdosta. Valittavissa olevat koneäänet ovat hyvin luonnollisen kuuloisia ja niiden kehityksessä on ollut myös yhteistyötä kustantamoiden, kirjailijoiden ja ääninäyttelijöiden kanssa. Toistaiseksi on mahdollista julkaista vain englanninkielisiä äänikirjoja. Luultavasti palvelu kuitenkin laajenee ajan myötä ja uusia vaihtoehtoja tulee käytettäville. Mielenkiintoista nähdä vaikuttaako Applen uusi käytäntö myös muihin äänikirjapalveluihin; esimerkiksi Amazon on kirjannut ohjeisiinsa, että se hyväksyy Audible-palveluunsa vain ihmisen lukemat äänikirjat.