Was ist Voice to Text?
Technologie, die gesprochene Wörter durch Analyse von Schallwellen in digitalen Text umwandelt.
Definition
Diese Technologie nimmt die Audiosignale Ihres Mikrofons auf und wandelt sie zunächst in kleine Tonschnipsel und dann in Wörter und Sätze um. Dank Deep-Learning-Modellen ist es heute in der Lage, Akzente, Intonationen und sogar Hintergrundgeräusche zu unterscheiden.
So funktioniert es
Sprachdaten gelangen in das System, das Modell der künstlichen Intelligenz findet durch Wahrscheinlichkeitsberechnungen heraus, welchem Wort diese Stimme entspricht und präsentiert es Ihnen als Text.
Wo es eingesetzt wird
Es wird zum automatischen Extrahieren von Besprechungsnotizen, Sprachassistenten und Untertitelungstools verwendet.
Häufig verwechselt mit
Es wird mit Text-to-Speech (Konvertieren von Text in Sprache) gemischt. Dies ist der genau gegenteilige Vorgang.
Häufige Fragen
Gibt es eine Fehlerquote?
Ja, er wählt möglicherweise die falschen Wörter, insbesondere in sehr lauter Umgebung oder wenn zu schnell gesprochen wird.
Funktioniert es in allen Sprachen?
Moderne Modelle unterstützen die meisten Sprachen, allerdings ist die Erfolgsquote in Sprachen mit wenigen Trainingsdaten geringer.
Verwandte Begriffe
Verwandte Werkzeuge
Diese Erklärung wurde für TreScout in einfacher Sprache verfasst und maschinell übersetzt aus dem türkischen Original · maßgeblich ist die türkische Fassung. Wenn etwas falsch oder unvollständig wirkt, schreiben Sie an hello@trescout.com. Auf Türkisch lesen →