Termos de dados e automação, explicados.
Definições curtas e diretas para os termos que aparecem ao escopar um projeto de web scraping, pipeline de dados, IA ou automação — cada uma linkada ao serviço que a implementa.
Web scraping
Extração automatizada de dados de sites — transformando listagens, preços ou registros públicos que só existem como páginas web em dados estruturados e utilizáveis (JSON, CSV ou um banco de dados).
ETL (Extract, Transform, Load)
Um pipeline que extrai dados de uma fonte (uma API, um banco de dados, um scraper), limpa e transforma, e carrega em um destino como um data warehouse ou banco operacional — geralmente de forma agendada.
Reverse ETL
O sentido oposto de um fluxo ETL normal: sincronizar dados limpos e modelados de um warehouse de volta para ferramentas operacionais (CRM, plataformas de anúncio, suporte) para que times de negócio possam agir sobre eles.
RAG (Retrieval-Augmented Generation)
Um padrão de IA em que um modelo de linguagem busca trechos relevantes dos seus próprios documentos ou dados antes de responder a uma pergunta, de forma que a resposta seja baseada no seu conteúdo real, não só no treinamento geral do modelo.
OCR (Reconhecimento Óptico de Caracteres)
Tecnologia que converte documentos escaneados, PDFs ou imagens de texto em texto legível por máquina — o primeiro passo antes de extrair dados estruturados de contratos, faturas ou processos judiciais.
Detecção anti-bot
Sistemas que sites usam para identificar e bloquear tráfego automatizado — fingerprinting de navegador, limitação de taxa, CAPTCHAs e análise comportamental. Scraping em produção precisa ser projetado em torno dessas defesas.
Dados de MLS
Dados de listagem de imóveis de um Multiple Listing Service — as bases que corretores usam para compartilhar anúncios. Acessar isso programaticamente em escala normalmente exige raspar sites públicos de listagem, não o sistema MLS fechado em si.
Scoring de churn
Um modelo de machine learning que ranqueia clientes pela probabilidade de cancelar ou parar de comprar, com base em sinais comportamentais — para times priorizarem esforços de retenção onde mais importa.
Pipeline de dados
Termo geral para qualquer sistema automatizado que move dados de um lugar para outro, aplicando transformações no caminho — scrapers, jobs de ETL e sistemas de streaming são todos tipos de pipeline de dados.
Banco de dados vetorial
Um banco de dados otimizado para armazenar e buscar embeddings — representações numéricas de texto ou dados usadas para busca semântica e sistemas RAG, encontrando resultados por significado, não por correspondência exata de palavra-chave.