Alkuvuoden koneääni-uutiset maailmalta

13.01.2023

Vuosi ei ole vielä pitkällä, mutta koneäänistä on kuulunut jo nyt muutamakin mielenkiintoinen uutinen. Tässä lisää niistä:

VALL-E, koneääni kolmen sekunnin ääninäytteestä

Sisällön luominen tekoälyä käyttäen tuli viime vuonna ihmisille tutuksi. Vuoden 2022 puolivälissä kokeiltiin DALL-E:tä ja vuoden lopussa puhututti ChatGPT. DALL-E on tekoälypohjainen ohjelma, joka luo kuvia sille syötetyn tekstin perusteella. ChatGPT taas on ihmiskeskustelijaa jäljittelevä chatbot. Sille syötettyjen avainsanojen tai aiheiden perusteella se voi luoda pyynnöstä niin laulun sanat, tiivistelmän, esseen kuin runonkin. Sisällöntuotannossa ChatGPT toimii esimerkiksi hyvänä inspiraation lähteenä. DALL-E ja ChatGPT ovat molemmat OpenAI:n kehittämiä.

Microsoft esitteli edellä mainittujen kanssa samantyyppisen VALL-E -tekoälymallin heti vuoden 2023 alkuun. VALL-E on tekstistä puheeksi -työkalu, joka pystyy jäljittelemään kenen tahansa puheääntä pelkästään kolmen sekunnin ääninäytteen perusteella. Pystyt siis luomaan esimerkiksi omasta äänestäsi koneäänen ja tämän jälkeen muuttaa tekstisisältöjä puheeksi sinulta kuulostavan äänen lukemina, vain kolmen sekunnin ääninäytteellä. Yleensä koneäänet luodaan useamman kymmenen tunnin ääninäytteen pohjalta.

VALL-E pystyy myös säilyttämään puhujan tunnetilan ja akustiikkaympäristön, jotka osaltaan lisäävät tuotetun koneäänen realistisuutta. Sen kouluttamiseen on käytetty yhteensä 60 000 tuntia englanninkielistä puhetta yli 7000 puhujalta. Aikaisemmissa järjestelmissä puhetta on käytetty noin 600 tuntia.

VALL-E ei ole ainakaan toistaiseksi saatavissa julkiseen käyttöön. Microsoftin antaman eettisen lausunnon mukaan puhujan identiteetin säilyttävään syntetisoituun puheeseen liittyy mahdollisia riskejä mallin väärinkäytöstä. Näitä ovat esimerkiksi äänentunnistuksen huijaaminen ja toisena henkilönä esiintyminen. Jos mallia käytetään, puhujan täytyykin vahvistaa hyväksyvänsä äänensä käytön koneääneksi. Yllä mainittuja riskejä minimoimaan voidaan Microsoftin mukaan kehittää esimerkiksi tunnistusmalli, joka pystyy erottamaan äänen VALL-E:n syntetisoimaksi. VALL-E on erittäin mielenkiintoinen työkalu, ja tuo hienoja mahdollisuuksia esimerkiksi heille, jotka ovat menettäneet äänensä vaikkapa onnettomuuden seurauksena.

Apple julkaisee koneäänen lukemia äänikirjoja

Apple Books kirjapalvelu on tuonut markkinoille uuden mahdollisuuden julkaista kirjoja koneäänen lukemana. Apple kertoo täten tekevänsä äänikirjojen luomisesta helppoa myös yksittäisille kirjailijoille ja pienille kustantamoille. Palvelun kautta pienet toimijat voivat näin tavoittaa lisää yleisöä äänikirjakuuntelijoista. Sloganina onkin: Jokainen kirja ansaitsee tulla kuulluksi.

Ihmislukijoita ei koneäänellä olla korvaamassa ja Apple vakuuttaa jatkavansa edelleen ääninäyttelijöiden lukeman äänikirjavalikoiman kasvattamista. Koneäänellä luetut äänikirjat ovat kuitenkin pienemmille toimijoille tilaisuus päästä äänikirjamarkkinoille, sillä ne tulevat edullisemmaksi kuin studion ja ääninäyttelijän käyttäminen. Koneäänien käyttö nähdään siis mahdollisuutena kasvattaa äänikirjamarkkinoita entisestään.

Äänikirjan lukijaksi voi valita sopivan koneäänen muutamasta vaihtoehdosta. Valittavissa olevat koneäänet ovat hyvin luonnollisen kuuloisia ja niiden kehityksessä on ollut myös yhteistyötä kustantamoiden, kirjailijoiden ja ääninäyttelijöiden kanssa. Toistaiseksi on mahdollista julkaista vain englanninkielisiä äänikirjoja. Luultavasti palvelu kuitenkin laajenee ajan myötä ja uusia vaihtoehtoja tulee käytettäville. Mielenkiintoista nähdä vaikuttaako Applen uusi käytäntö myös muihin äänikirjapalveluihin; esimerkiksi Amazon on kirjannut ohjeisiinsa, että se hyväksyy Audible-palveluunsa vain ihmisen lukemat äänikirjat.

Vielä toistaiseksi koneäänet sopivat parhaiten faktapohjaisten äänikirjojen lukemiseen. Kehitys kuitenkin kehittyy ja koneääniin tullaan saamaan vielä paremmin tunnetiloja mukaan. Kun VALL-E:n kaltaiset mallit edistyvät, tulevaisuudessa esimerkiksi ääninäyttelijät saattavat tuottaa äänistään luonnollisen kuuloisia koneääniä ja saada sivutuloja äänensä monipuolisemmasta hyödyntämisestä.

Sinua saattaisi kiinnostaa myös seuraavat artikkelit:

Helmikuun ääniuutiset

Äänen kloonaus – mahdollisuudet ja väärinkäytökset

Räätälöity koneääni osana yrityksesi audiobrändiä

Kuuntele koneääni-Ilonan lukema äänikirja

Anatomian oppikirjasta toteutettiin Editalle äänikirja

Kysymyksiä, ajatuksia tai mahdollinen yhteistyö?

13.6.2024

Miten puheteknologia näkyy tulevaisuuden arkielämässä?

Käsittelyssä kielimuurien häviäminen, henkilökohtaisemmat ääniassistentit, älykodit, äänikloonit, tekoälyllä tuotettava musiikki, median kulutus, terveyssovellukset, asiakaspalvelu, biometrinen tunnistautuminen ja smart city -ajatus.

16.5.2024

Ruudunlukuohjelmien toiminta ja vertailu verkkosivulukijaan

Sekä ruudunlukuohjelma että verkkosivulukija lukee verkkosivuja ääneen. Oleellisen ero on, että ruudunlukijat on tarkoitettu henkilöille, joilla on näkemisen tai motorisen tai kognitiivisen puolen kanssa rajoitteita, kun taas verkkosivulukija sopii paljon

23.4.2024

Alkuvuoden koneääni-uutiset maailmalta

VALL-E, koneääni kolmen sekunnin ääninäytteestä

Apple julkaisee koneäänen lukemia äänikirjoja

Kysymyksiä, ajatuksia tai mahdollinen yhteistyö?

Miten puheteknologia näkyy tulevaisuuden arkielämässä?

Ruudunlukuohjelmien toiminta ja vertailu verkkosivulukijaan

Ääni vai teksti? Tiedon kuluttamisen monimuotoisuus

a.i.mater tuottaa ePress®-näköislehtipalvelun kuunneltavat artikkelit

Yle.fi-verkkosivujen ja -sovelluksen uutisartikkelit nyt kuunneltavissa

Miten saada verkkosivujen tekstisisällöt kuunneltavaan muotoon?

Kiinnostuitko?

On sinulla sitten valmis tarve tai kaipaat ideallesi vasta sparrailua, saamme sitä varmasti yhdessä eteenpäin. Ota yhteyttä, kuulemme mielellämme sinusta!

Sounds better