Informaatio- ja tietoliikennetekniikan laitos

Puhesynteesi

Puhesynteesin tutkimusryhmä tutkii syviä generatiivisia malleja ja differentioituvia signaalinkäsittelymenetelmiä sovellettuna puheeseen ja ääneen. Lisäksi tutkimusintresseihin kuuluvat äänikloonaus, deepfake-tunnistus ja generoidun puheen vesileimaaminen.
graph

Puhesynteesin tutkimusryhmä tutkii syviä generatiivisia malleja ja differentioituvia signaalinkäsittelymenetelmiä sovellettuna puheeseen ja ääneen. Lisäksi tutkimusintresseihin kuuluvat äänikloonaus, deepfake-tunnistus ja generoidun puheen vesileimaaminen.

Puhuvat koneet ovat pitkään olleet puheenkäsittelyn ja koneoppimisen keskeisiä tutkimusaiheita. Puhesynteesiä käyttäviä teknologita ovat esimerkiksi henkilökohtaiset digitaaliset avustajat (kuten Siri ja Alexa), äänikirjat, sekä apuvälineet, kuten  näytönlukuohjelmat ja ääniproteesit. Nykyaikaiset puhesynteesimenetelmät kuulostavat lähes yhtä luonnollisilta kuin ihmispuhujat. Tämä saavutetaan käyttämällä syviä generatiivisia malleja, kuten WaveNet, GANit, diffuusiomallit ja Transformer-kielimallit.

Nykyiset tekniset haasteet puheen synteesissä liittyvät tehokkuuteen, hallittavuuteen ja tulkittavuuteen. Parhaat nykymenetelmät käyttävät suuria neuroverkkomalleja, jotka ovat laskennallisesti kalliita mustia laatikoita. Aalto-yliopiston puhesynteesiryhmän tutkimus rakentaa tehokasta ja tulkittavaa puhesynteesiä yhdistämällä perinteisiä digitaalisen signaalinkäsittelyn menetelmiä differentioituvan laskennan kanssa.

Äänikloonaus on hiljattain paljon huomiota saanut puhesynteesin sovellus. Äänikloonauksessa uusi ääni voidaan luoda vain muutaman sekunnin äänitallenteesta, mikä mahdollistaa monia sovelluksia, mutta luo samalla kasvavan tarpeen synteettisen puheen tunnistukselle. Aallon puhesynteesin tutkimusryhmä pyrkii rakentamaan vastuullista puhesynteesiä ja tutkii generoidun puheen vesileimaamista osana synteesiprosessia. 

Lue lisää aiheesta YLE:n artikkelista: https://yle.fi/a/74-20027151

Aalto-yliopiston puhesynteesin tutkimusryhmä tekee aktiivisesti yhteistyötä kansainvälisesti, yheistyökumppaneihin lukeutuvat mm. KTH Royal Institute of Technology, Tukholmassa; ja National Institute of Informatics (NII), Tokiossa

Tutkimusaiheita

  • Puhesynteesin generatiiviset mallit: GANit, WaveNet, diffuusiomallit, representaatio-oppiminen ja kielimallit äänelle
  • Differentioituva DSP: digitaalinen signaalinkasittely rakennusaineena tehokkaille teköälypohjaisille puhesynteesijärjestelmille
  • Generatiivisten mallien vesileimaus; Deepfake-tunnistus puheessa, vastatoimet ja yleinen tietoisuus aiheesta

Puhesynteesin tutkimusryhmää johtaa professori Lauri Juvela

Ryhmän jäsenet

Viimeisimmät julkaisut

Aliasing-Free Neural Audio Synthesis

Yicheng Gu, Junan Zhang, Chaoren Wang, Jerry Li, Zhizheng Wu, Lauri Juvela 2026 IEEE Transactions on Audio, Speech and Language Processing

Neurodyne: Neural Pitch Manipulation with Representation Learning and Cycle-Consistency GAN

Yicheng Gu, Chaoren Wang, Zhizheng Wu, Lauri Juvela 2025 Proceedings of the Interspeech

SOLID STATE BUS-COMP: A LARGE-SCALE AND DIVERSE DATASET FOR DYNAMIC RANGE COMPRESSOR VIRTUAL ANALOG MODELING

Yicheng Gu, Runsong Zhang, Lauri Juvela, Zhizheng Wu 2025 Proceedings of the 28th International Conference on Digital Audio Effects

Audio Codec Augmentation for Robust Collaborative Watermarking of Speech Synthesis

Lauri Juvela, Xin Wang 2025 2025 IEEE International Conference on Acoustics, Speech, and Signal Processing, ICASSP 2025 - Proceedings

Pronunciation Editing for Finnish Speech using Phonetic Posteriorgrams

Zirui Li, Lauri Juvela, Mikko Kurimo 2025 13th edition of the Speech Synthesis Workshop

Unsupervised Estimation of Nonlinear Audio Effects: Comparing Diffusion-based and Adversarial Approaches

Eloi Moliner Juanpere, Michal Švento, Alec Wright, Lauri Juvela, Pavel Rajmic, Vesa Välimäki 2025 Proceedings of the 28th International Conference on Digital Audio Effects

Estimation and Restoration of Unknown Nonlinear Distortion Using Diffusion

Michal Švento, Eloi Moliner Juanpere, Lauri Juvela, Alec Wright, Vesa Välimäki 2025 Journal of the Audio Engineering Society

Open-Amp: Synthetic Data Framework for Audio Effect Foundation Models

Alec Wright, Alistair Carson, Lauri Juvela 2025 2025 IEEE International Conference on Acoustics, Speech, and Signal Processing, ICASSP 2025 - Proceedings

KLANN: Linearising Long-Term Dynamics in Nonlinear Audio Effects Using Koopman Networks

Ville Huhtala, Lauri Juvela, Sebastian J. Schlecht 2024 IEEE Signal Processing Letters

DDSP-based Neural Waveform Synthesis of Polyphinic Guitar Performance From String-Wise Midi Input

Nicolas Jonason, Xin Wang, Erica Cooper, Lauri Juvela, Bob L.T. Sturm, Junichi Yamagishi 2024 Proceedings of the 27th International Conference on Digital Audio Effects (DAFx24)
Lisää tietoa tutkimuksestamme löytyy Aallon tutkimusportaalista.
Tutkimusportaali
  • Päivitetty:
  • Julkaistu:
Jaa
URL kopioitu