← Glossar
Glossar · AI

Was ist Voice Synthesis?

Dabei handelt es sich um die Technologie, geschriebene Texte durch einen Computer mit einer natürlichen und fließenden menschlichen Stimme vorzutragen.

Definition

Es nimmt textbasierte Daten auf und wandelt sie in Schallwellen um, die menschliche Merkmale wie Betonung und Intonation enthalten. Heute ähneln diese Stimmen dank künstlicher Intelligenz eher der Sprache einer echten Person als einem Roboterton. Es ist möglich, Lesegeschwindigkeit, Emotion und Akzent anzupassen.

Analogie: Es ist, als würde ein professioneller Sprecher ein Buch eines Autors laut vorlesen, als ob jemand vor ihm stünde.

So funktioniert es

KI-Modelle werden anhand von Tausenden Stunden menschlicher Sprachdaten trainiert. Wenn Sie Text eingeben, berechnet das Modell anhand dieser Daten, welcher Buchstabe oder welches Wort mit welcher Frequenz gesprochen werden soll und erstellt eine digitale Audiodatei.

Wo es eingesetzt wird

Es wird in Hörbuchanwendungen, Bildschirmleseprogrammen für Menschen mit Behinderungen und auf künstlicher Intelligenz basierenden virtuellen Assistenten verwendet.

Häufig verwechselt mit

Kann mit Voice Cloning verwechselt werden; Bei der Sprachsynthese handelt es sich um eine allgemeine Stimmerzeugung, während beim Voice Cloning die Stimme einer bestimmten Person nachgeahmt wird.

Häufige Fragen

Sind Sprachsynthese und Text-to-Speech dasselbe?

Ja, technisch gesehen drücken sie dasselbe Konzept aus; Einer definiert den allgemeinen Prozess, der andere den technologischen Namen dieses Prozesses.

Verwandte Begriffe

Diese Erklärung wurde für TreScout in einfacher Sprache verfasst und maschinell übersetzt aus dem türkischen Original · maßgeblich ist die türkische Fassung. Wenn etwas falsch oder unvollständig wirkt, schreiben Sie an hello@trescout.com. Auf Türkisch lesen →