Glossário

Termos de dados e automação, explicados.

Definições curtas e diretas para os termos que aparecem ao escopar um projeto de web scraping, pipeline de dados, IA ou automação — cada uma linkada ao serviço que a implementa.

Web scraping

Extração automatizada de dados de sites — transformando listagens, preços ou registros públicos que só existem como páginas web em dados estruturados e utilizáveis (JSON, CSV ou um banco de dados).

Ver o serviço →

ETL (Extract, Transform, Load)

Um pipeline que extrai dados de uma fonte (uma API, um banco de dados, um scraper), limpa e transforma, e carrega em um destino como um data warehouse ou banco operacional — geralmente de forma agendada.

Ver o serviço →

Reverse ETL

O sentido oposto de um fluxo ETL normal: sincronizar dados limpos e modelados de um warehouse de volta para ferramentas operacionais (CRM, plataformas de anúncio, suporte) para que times de negócio possam agir sobre eles.

Ver o serviço →

RAG (Retrieval-Augmented Generation)

Um padrão de IA em que um modelo de linguagem busca trechos relevantes dos seus próprios documentos ou dados antes de responder a uma pergunta, de forma que a resposta seja baseada no seu conteúdo real, não só no treinamento geral do modelo.

Ver o serviço →

OCR (Reconhecimento Óptico de Caracteres)

Tecnologia que converte documentos escaneados, PDFs ou imagens de texto em texto legível por máquina — o primeiro passo antes de extrair dados estruturados de contratos, faturas ou processos judiciais.

Ver o serviço →

Detecção anti-bot

Sistemas que sites usam para identificar e bloquear tráfego automatizado — fingerprinting de navegador, limitação de taxa, CAPTCHAs e análise comportamental. Scraping em produção precisa ser projetado em torno dessas defesas.

Ver o serviço →

Dados de MLS

Dados de listagem de imóveis de um Multiple Listing Service — as bases que corretores usam para compartilhar anúncios. Acessar isso programaticamente em escala normalmente exige raspar sites públicos de listagem, não o sistema MLS fechado em si.

Ver o serviço →

Scoring de churn

Um modelo de machine learning que ranqueia clientes pela probabilidade de cancelar ou parar de comprar, com base em sinais comportamentais — para times priorizarem esforços de retenção onde mais importa.

Ver o serviço →

Pipeline de dados

Termo geral para qualquer sistema automatizado que move dados de um lugar para outro, aplicando transformações no caminho — scrapers, jobs de ETL e sistemas de streaming são todos tipos de pipeline de dados.

Ver o serviço →

Banco de dados vetorial

Um banco de dados otimizado para armazenar e buscar embeddings — representações numéricas de texto ou dados usadas para busca semântica e sistemas RAG, encontrando resultados por significado, não por correspondência exata de palavra-chave.

Ver o serviço →