Sobre
Richard Feng — engenheiro de web scraping. Transformo sites protegidos em dados estruturados, limpos e prontos para RAG para agentes de IA, pipelines de recuperação e LLMs.
Quem eu sou
Sou Richard Feng, engenheiro freelancer de automação web. Sou especializado em web scraping, extração de dados e engenharia reversa de APIs — transformando sites complexos e protegidos em dados limpos e estruturados que sistemas de IA realmente conseguem usar.
Meu conjunto de ferramentas abrange Node.js (TypeScript), Python, Go e Java, com profundo conhecimento em Crawlee, Playwright e Cheerio.
O que eu faço
Desenvolvo e mantenho os atores Apify de nível de produção deste catálogo. Cada ator gera JSON limpo e pronto para RAG — com esquema consistente, deduplicado e pronto para uso em um vector store, pipeline de recuperação ou conjunto de treinamento. A maioria dos atores de dados públicos não exige chave de API. Meu trabalho abrange cinco áreas:
Dados de e-commerce e varejo
Scrapers para as principais plataformas de beleza, moda e varejo, incluindo Sephora (lojas nos EUA, no Canadá, na UE, no Oriente Médio, no Reino Unido, na Índia e na Ásia-Pacífico), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s, e Talabat Mart, além de scrapers universais para qualquer loja Shopify ou WooCommerce.
Dados públicos, financeiros e jurídicos
Datasets oficiais dos EUA em JSON limpo e pronto para RAG — arquivos SEC EDGAR e dados financeiros XBRL, concessões federais do USAspending.gov, decisões judiciais do CourtListener, e estudos do ClinicalTrials.gov.
Dados de empresas, vagas e leads
Vagas e dados de empregadores do Indeed, leads de lojas Shopify, todos os anúncios do Google que um concorrente veicula e endereços de caixas postais virtuais (CMRA).
Inteligência de redes sociais e mídia
Posts, perfis e interações do Bluesky via AT Protocol, além de um scraper de legendas e transcrições do YouTube que gera JSON, SRT, VTT ou texto pronto para LLM em mais de 100 idiomas, e um scraper de transcrições do TikTok.
Utilitários para desenvolvedores
Ferramentas além do scraping — auditoria de SEO e dados estruturados e renderização de páginas em PDF/imagem.
Especialidades
- Engenharia reversa de APIs privadas — transformando endpoints não documentados de mobile/web em fontes de dados confiáveis
- Bypass de anti-bot — Cloudflare, Akamai WAF e proteções personalizadas
- Saída pronta para RAG — JSON normalizado e com esquema consistente, construído para recuperação e grounding
- Scraping multi-região — locales, moedas e compliance sob controle
- Sistemas de alta confiabilidade — extratores construídos para continuar funcionando sem supervisão em escala
Stack técnica
| Categoria | Tecnologias |
|---|---|
| Linguagens | TypeScript, Python, Go, Java |
| Scraping | Crawlee, Playwright, Cheerio, Parsel, got-scraping |
| Anti-bot | Fingerprint generators, TLS fingerprinting, session rotation |
| Infraestrutura | Apify Platform, Docker, GitHub Actions |
| Testes | Vegeta, custom load-testing frameworks |
Trabalhe comigo
Ofereço soluções de scraping sob medida, engenharia de pipelines de dados para RAG e serviços contínuos de extração de dados. Se a sua IA precisa da web real como dados limpos — vamos conversar.