~/about

Sobre

Richard Feng — engenheiro de web scraping. Transformo sites protegidos em dados estruturados, limpos e prontos para RAG para agentes de IA, pipelines de recuperação e LLMs.

Quem eu sou

Sou Richard Feng, engenheiro freelancer de automação web. Sou especializado em web scraping, extração de dados e engenharia reversa de APIs — transformando sites complexos e protegidos em dados limpos e estruturados que sistemas de IA realmente conseguem usar.

Meu conjunto de ferramentas abrange Node.js (TypeScript), Python, Go e Java, com profundo conhecimento em Crawlee, Playwright e Cheerio.

O que eu faço

Desenvolvo e mantenho os atores Apify de nível de produção deste catálogo. Cada ator gera JSON limpo e pronto para RAG — com esquema consistente, deduplicado e pronto para uso em um vector store, pipeline de recuperação ou conjunto de treinamento. A maioria dos atores de dados públicos não exige chave de API. Meu trabalho abrange cinco áreas:

Dados de e-commerce e varejo

Scrapers para as principais plataformas de beleza, moda e varejo, incluindo Sephora (lojas nos EUA, no Canadá, na UE, no Oriente Médio, no Reino Unido, na Índia e na Ásia-Pacífico), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s, e Talabat Mart, além de scrapers universais para qualquer loja Shopify ou WooCommerce.

Dados públicos, financeiros e jurídicos

Datasets oficiais dos EUA em JSON limpo e pronto para RAG — arquivos SEC EDGAR e dados financeiros XBRL, concessões federais do USAspending.gov, decisões judiciais do CourtListener, e estudos do ClinicalTrials.gov.

Dados de empresas, vagas e leads

Vagas e dados de empregadores do Indeed, leads de lojas Shopify, todos os anúncios do Google que um concorrente veicula e endereços de caixas postais virtuais (CMRA).

Inteligência de redes sociais e mídia

Posts, perfis e interações do Bluesky via AT Protocol, além de um scraper de legendas e transcrições do YouTube que gera JSON, SRT, VTT ou texto pronto para LLM em mais de 100 idiomas, e um scraper de transcrições do TikTok.

Utilitários para desenvolvedores

Ferramentas além do scraping — auditoria de SEO e dados estruturados e renderização de páginas em PDF/imagem.

Especialidades

  • Engenharia reversa de APIs privadas — transformando endpoints não documentados de mobile/web em fontes de dados confiáveis
  • Bypass de anti-bot — Cloudflare, Akamai WAF e proteções personalizadas
  • Saída pronta para RAG — JSON normalizado e com esquema consistente, construído para recuperação e grounding
  • Scraping multi-região — locales, moedas e compliance sob controle
  • Sistemas de alta confiabilidade — extratores construídos para continuar funcionando sem supervisão em escala

Stack técnica

CategoriaTecnologias
LinguagensTypeScript, Python, Go, Java
ScrapingCrawlee, Playwright, Cheerio, Parsel, got-scraping
Anti-botFingerprint generators, TLS fingerprinting, session rotation
InfraestruturaApify Platform, Docker, GitHub Actions
TestesVegeta, custom load-testing frameworks

Trabalhe comigo

Ofereço soluções de scraping sob medida, engenharia de pipelines de dados para RAG e serviços contínuos de extração de dados. Se a sua IA precisa da web real como dados limpos — vamos conversar.