# O que é Data Pipeline?

É o processo de retirar dados de um local, processá-los e movê-los para outro local.

## Definição
Pipeline de dados é o processo de retirar dados de uma fonte, processá-los e movê-los para outro local. É a fábrica que transforma dados brutos em informações significativas e utilizáveis.

## Como funciona
Os dados são primeiro coletados, as peças defeituosas são limpas, organizadas no formato necessário e finalmente transferidas para o banco de dados ou modelo de inteligência artificial.

## Onde é usado
É utilizado para preparar grandes quantidades de dados para treinar inteligência artificial ou para gerar relatórios diários de vendas.

## Costuma ser confundido com
É confundido com banco de dados, mas pipeline é o processo de movimentação e alteração de dados, enquanto banco de dados é apenas espaço de armazenamento.

## Perguntas frequentes
**Por que isso é tão importante?**
Se os modelos de inteligência artificial forem treinados com dados sujos, eles darão resultados incorretos, o pipeline fornece essa limpeza.

**Funciona automaticamente?**
Sim, o processo é acionado automaticamente à medida que os dados chegam e fluem sem intervenção humana.


## Termos relacionados
- [Data Pipeline](/pt/dictionary/data-pipeline/)
- [Document Parsing](/pt/dictionary/document-parsing/)
- [RAG](/pt/dictionary/rag/)
- [Embedding](/pt/dictionary/embedding/)

---
Fonte: TreScout Glossário · https://trescout.com/pt/dictionary/data-pipeline/
