O que é Voice to Text?
Tecnologia que converte palavras faladas em texto digital por meio da análise de ondas sonoras.
Definição
Essa tecnologia pega os sinais de áudio do seu microfone e os converte primeiro em pequenos trechos de som e depois em palavras e frases. Hoje, graças aos modelos de aprendizagem profunda, tornou-se capaz de distinguir sotaques, entonações e até ruídos de fundo.
Como funciona
Os dados de voz entram no sistema, o modelo de inteligência artificial descobre a qual palavra essa voz corresponde por meio de cálculos de probabilidade e os apresenta como texto.
Onde é usado
É usado na extração automática de notas de reuniões, assistentes de voz e ferramentas de legenda.
Costuma ser confundido com
É misturado com Text-to-Speech (conversão de texto em fala); Este é exatamente o processo oposto.
Perguntas frequentes
Existe alguma margem de erro?
Sim, ele pode escolher as palavras erradas, especialmente em ambientes muito barulhentos ou quando faladas muito rapidamente.
Funciona em todos os idiomas?
Os modelos modernos suportam a maioria dos idiomas, mas a taxa de sucesso é menor em idiomas com poucos dados de treinamento.
Termos relacionados
Ferramentas relacionadas
Esta explicação foi escrita em linguagem simples para a TreScout e traduzida automaticamente do original em turco · a versão turca é a que vale. Se algo parecer errado ou faltando, escreva para hello@trescout.com. Ler em turco →