← Glossar
Glossar · AI

Was ist Voice to Text?

Technologie, die gesprochene Wörter durch Analyse von Schallwellen in digitalen Text umwandelt.

Definition

Diese Technologie nimmt die Audiosignale Ihres Mikrofons auf und wandelt sie zunächst in kleine Tonschnipsel und dann in Wörter und Sätze um. Dank Deep-Learning-Modellen ist es heute in der Lage, Akzente, Intonationen und sogar Hintergrundgeräusche zu unterscheiden.

Analogie: Stellen Sie sich vor, Sie hätten eine sehr schnelle Sekretärin an Ihrer Seite, die sich während des Gesprächs schnell Notizen macht, nie müde wird und alles, was sie hört, zu Papier bringt.

So funktioniert es

Sprachdaten gelangen in das System, das Modell der künstlichen Intelligenz findet durch Wahrscheinlichkeitsberechnungen heraus, welchem ​​Wort diese Stimme entspricht und präsentiert es Ihnen als Text.

Wo es eingesetzt wird

Es wird zum automatischen Extrahieren von Besprechungsnotizen, Sprachassistenten und Untertitelungstools verwendet.

Häufig verwechselt mit

Es wird mit Text-to-Speech (Konvertieren von Text in Sprache) gemischt. Dies ist der genau gegenteilige Vorgang.

Häufige Fragen

Gibt es eine Fehlerquote?

Ja, er wählt möglicherweise die falschen Wörter, insbesondere in sehr lauter Umgebung oder wenn zu schnell gesprochen wird.

Funktioniert es in allen Sprachen?

Moderne Modelle unterstützen die meisten Sprachen, allerdings ist die Erfolgsquote in Sprachen mit wenigen Trainingsdaten geringer.

Verwandte Begriffe

Verwandte Werkzeuge

Diese Erklärung wurde für TreScout in einfacher Sprache verfasst und maschinell übersetzt aus dem türkischen Original · maßgeblich ist die türkische Fassung. Wenn etwas falsch oder unvollständig wirkt, schreiben Sie an hello@trescout.com. Auf Türkisch lesen →