gabriel greco / engenheiro de dados

Eu sou de dados, não designer.

Sim, este site foi gerado por IA.

Construo sistemas que fazem a internet bagunçada virar dado confiável: crawlers em alta escala, orquestração, modelos bronze → silver → gold e produtos de inteligência regulatória.

30B+requisições de produção operadas em um anoZyte · contexto de produção ↗
2B+requisições executadas nos pipelines de produção do RTIRTI · aquisição e pipelines ↗
300M+pontos de dados regulatórios estruturadosRTI · dados estruturados ↗
4.500htrabalho manual automatizado todo mês na LummaLumma · automação de processos ↗

↳ Números sem contexto são decoração. O contexto está logo abaixo.

01 / experiência

Produção deixa rastros.

Não é lista de responsabilidades. São os sistemas, a escala, as decisões e os modos de falha que realmente passaram por mim.

01

Labrynth AI

Data Engineer · Data Acquisition & Ingestion

fev 2026 — atual

Califórnia, EUA · remoto

Construo os dois lados da inteligência regulatória: a ingestão que transforma documentos em conhecimento estruturado e os produtos de dados do RTI que convertem evidência pública em índices defensáveis.

2B+ requests no RTI300M+ pontos estruturadosdados · cloud · produto
1.1

Labrynth / IA regulatória

Construindo a camada de ingestão por trás do GraphRAG

Meu foco principal é uma plataforma de ingestão capaz de receber documentos regulatórios heterogêneos e transformá-los em conhecimento estruturado e rastreável para busca e raciocínio.

  • Desenhei o pipeline de ingestão ponta a ponta que converte qualquer material de origem em grafos de conhecimento estruturados, com proveniência para GraphRAG e respostas regulatórias auditáveis.
  • Atuei em toda a stack do produto — APIs Django, workflows assíncronos com Celery, PostgreSQL/Supabase, Neo4j, integração com frontend, autenticação e contratos de dados — levando a ingestão do pipeline até a experiência do usuário.
  • Construí estágios de validação e QA ao redor da extração assistida por IA para manter documentos, entidades, relações e citações inspecionáveis, em vez de virar um depósito opaco de embeddings.
  • Dei suporte à infraestrutura e entrega em produção com Docker, Kubernetes, Redis, object storage, monitoramento e as interfaces usadas por times internos e clientes.
1.2

Red Tape Index / índices como serviço

Responsável pelo caminho da fonte pública ao índice publicado

Ajudei a construir o RTI como produto de dados ponta a ponta: aquisição global, infraestrutura cloud, metodologia estatística, APIs, autenticação, dashboards e a camada visual usada para explicar os resultados.

  • Implementei a fundação cloud em Terraform e AWS: orquestração Prefect em ECS/Fargate, armazenamento no S3, limites de IAM, workers containerizados, Postgres/Supabase, retries, monitoramento e deployments reproduzíveis.
  • Operei mais de 2 bilhões de requisições de produção adquirindo dados governamentais e setoriais nas Américas, Europa e Oceania a partir de APIs, PDFs, planilhas, dashboards e portais renderizados no navegador.
  • Criei metodologias de índices em conjunto com data scientists, aplicando normalização estatística, pesos, agregação, análise de sensibilidade e scoring bronze → silver → gold reproduzível, com proveniência completa.
  • Construí superfícies de produto no backend e frontend: APIs de dados, autenticação AWS Cognito/SES, account gates, rankings, dashboards analíticos e visualizações interativas para estudos de data centers, permissões, patentes, mídia e regulação.
  • Transformei registros públicos heterogêneos em produtos de dados versionados, com fontes, transformações, scores e afirmações publicadas testáveis de ponta a ponta.

O crawler dorme. É quando a fonte muda de schema.

02

Zyte

Software Engineer

fev 2025 — fev 2026

Irlanda · remoto

Engenharia de web data em contato direto com clientes: diagnosticar, corrigir e operar crawlers de produção que entregavam bilhões de registros a partir de sites construídos para bloqueá-los.

30B+ requests/anoaté 2B requests/mêsScrapy Cloud · entrega S3
2.1

Entrega ao cliente & operações

Responsável pelo crawler depois que ele chegava em produção

Trabalhei diretamente com clientes para transformar falhas de cobertura, campos ausentes, tráfego bloqueado e problemas de entrega em correções de produção — e depois verificar se o dado esperado realmente chegou.

  • Gerenciei projetos no Scrapy Cloud de ponta a ponta: deploys, jobs agendados, concorrência, logs, métricas, exceções, validação de itens, saúde dos crawls e feed exports para buckets S3 dos clientes.
  • Diagnostiquei e corrigi spiders de clientes sob pressão de entrega, usando logs e dados extraídos para separar falhas de acesso de defeitos de parsing, paginação, schema e pipeline.
  • Trabalhei diretamente com clientes em requisitos, incidentes, qualidade de dados, cobertura e expectativas de entrega, mantendo mudanças nos crawlers mensuráveis e seguras para produção.
2.2

Anti-bot & crawling distribuído

Extraindo dados confiáveis através de camadas hostis de acesso

Construí e otimizei pipelines com Scrapy e Zyte API numa escala em que bans, estado de sessão, custo de rendering, tempestades de retries e perda silenciosa de dados eram problemas operacionais, não casos extremos.

  • Contornei bans por IP e sessão, fingerprinting, desafios JavaScript, rate limits e fluxos dependentes de navegador com rotação de proxies, cookies e sessões, browser rendering, retries adaptativos e diagnóstico por request.
  • Operei portfólios acima de 30 bilhões de requisições anuais, incluindo workloads individuais de clientes que chegavam a 2 bilhões de requests por mês em infraestrutura distribuída.
  • Equilibrei unblock rate, throughput, completude, latência e custo de infraestrutura, impedindo que respostas HTTP bem-sucedidas com itens vazios ou inválidos fossem tratadas como dados corretos.
  • Escalei crawlers containerizados com Docker e Kubernetes e mantive pipelines resilientes da extração até validação e entrega em S3.

HTML válido com dado vazio continua quebrado.

03

Lumma Despachante

Development Coordinator → Software Engineer

set 2023 — fev 2025

Brasil · remoto

Entrei como engenheiro construindo a plataforma de automação e depois assumi coordenação sem me afastar da arquitetura ou do código.

4.500 h/mês removidas500K requests/dia−50% custo de automação
3.1

Development Coordinator

jul 2024 — fev 2025

Responsável pelo sistema e pela entrega ao redor dele

Promovido para liderar o desenvolvimento, ainda atuando diretamente na arquitetura e na codebase.

  • Organização de projetos, arquitetura de sistemas, agenda de entregas e contratação para a área de desenvolvimento.
  • Alinhamento semanal com board e CEO, traduzindo prioridade operacional em sequência técnica e entrega responsável.
  • Decisões arquiteturais mantidas próximas da implementação — coordenação sem virar middleware de status report.
3.2

Software Engineer

set 2023 — jul 2024

Trocando automação alugada por infraestrutura própria

Projetei a plataforma interna que coordenava RPAs, integrações e coleta de dados veiculares no lugar de scripts isolados e orquestradores pagos.

  • Orquestrador full-stack com Express, Next.js e PostgreSQL no RDS para integrações REST/SOAP e RPAs em AWS Lambda e S3.
  • Redução aproximada de 4.500 horas de trabalho manual por mês, aumento de eficiência em 40% e corte de 50% nos custos ao substituir ferramentas terceirizadas.
  • Pipelines de dados veiculares com mais de 500 mil requisições diárias para manter registros automotivos continuamente atualizados.

Automação boa é a que ninguém precisa lembrar de rodar.

04

Grupo MOVE3

System Analyst

set 2021 — set 2023

Brasil · presencial

Onde automação deixou de ser script e virou produto interno com operadores, dashboards e impacto mensurável no tempo de ciclo.

−70% tempo de processo500+ horas/ano poupadasSelenium · Puppeteer
4.1

Automação & inteligência operacional

Deixando os robôs visíveis para quem dependia deles

  • Automação de rotinas repetitivas com Selenium e Puppeteer, poupando mais de 500 horas de trabalho por ano.
  • Dashboards em Power BI e GoodData, além de sistemas de reporting em NestJS e React.
  • Redução de 70% no tempo de processamento e feedback operacional mais rápido e orientado a dados.

Antes de IA, a gente chamava de script. Funcionava também.

03 / índice

Tecnologias que aparecem no trabalho.

Não é bingo de logo. É uma forma rápida de encontrar os substantivos úteis.

Extrair

PythonScrapyScrapy CloudZyte APIhttpxcurl-cffiPlaywrightsistemas anti-bot

Mover

PrefectAWS ECS/FargateKubernetesDockerS3TerraformCeleryRedis

Modelar

PostgreSQLSupabaseNeo4jPolarsPandasbronze/silver/goldGraphRAGnormalização estatística

Entregar

DjangoFastAPINode.jsNestJSNext.jsReactAWS CognitoLogfireCI/CD

04 / serviços

Engenharia de dados, da fonte ao produto.

Baseado em São Paulo, com experiência trabalhando remotamente com equipes no Brasil, nos Estados Unidos e na Irlanda. Estes são os problemas com que trabalho.

Web scraping e extração de dados

Construo e opero crawlers em Python, Scrapy e Zyte API para sites, APIs e documentos. Validação, monitoramento e pipelines de entrega transformam fontes instáveis em dados que as equipes conseguem usar.

Zyte: operação e correção de crawlers em produção ↗

Pipelines de dados e plataformas cloud

Desenvolvo pipelines de ingestão e transformação com Prefect, AWS, S3 e PostgreSQL, com infraestrutura gerenciada por Terraform. Camadas bronze, silver e gold rastreáveis tornam os conjuntos de dados reproduzíveis e mais fáceis de manter.

RTI: aquisição, infraestrutura AWS e índices rastreáveis ↗

Ingestão de documentos e inteligência regulatória

Estruturo documentos regulatórios para grafos de conhecimento, GraphRAG e produtos analíticos de dados. Proveniência e verificações de qualidade ajudam equipes a rastrear respostas e indicadores até suas fontes.

Labrynth: ingestão de documentos e grafos de conhecimento ↗

05 / contato

Tem um problema de dados estranho?

Melhor ainda se envolver uma fonte pública instável, um PDF hostil ou escala suficiente para a solução óbvia parar de funcionar.

gabrielargreco@gmail.com

ENPT