Sobre mí
Richard Feng — ingeniero de web scraping. Convierto sitios web protegidos en datos estructurados limpios y listos para RAG para agentes de IA, pipelines de recuperación y LLMs.
Quién soy
Soy Richard Feng, ingeniero freelance de automatización web. Me especializo en web scraping, extracción de datos e ingeniería inversa de APIs: convierto sitios web complejos y protegidos en datos estructurados y limpios que los sistemas de IA realmente pueden usar.
Mi caja de herramientas abarca Node.js (TypeScript), Python, Go y Java, con experiencia profunda en Crawlee, Playwright y Cheerio.
Qué hago
Desarrollo y mantengo los Apify Actors de nivel de producción de este catálogo. Cada actor genera JSON limpio y listo para RAG: consistente en su esquema, deduplicado y listo para cargar en un vector store, un pipeline de recuperación o un conjunto de entrenamiento. La mayoría de los actores de datos públicos no requieren clave API. Mi trabajo abarca cinco áreas:
Datos de e-commerce y retail
Scrapers para las principales plataformas de belleza, moda y retail, incluyendo Sephora (tiendas en EE. UU., Canadá, la UE, Oriente Medio, el Reino Unido, India y Asia-Pacífico), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s, y Talabat Mart, además de scrapers universales para cualquier tienda Shopify o WooCommerce.
Datos públicos, financieros y legales
Datasets oficiales de EE. UU. como JSON limpio y listo para RAG — informes SEC EDGAR y datos financieros XBRL, adjudicaciones federales de USAspending.gov, sentencias judiciales de CourtListener y estudios de ClinicalTrials.gov.
Datos de empresas, empleo y leads
Ofertas de empleo y datos de empleadores de Indeed, leads de tiendas Shopify, todos los anuncios de Google que publica un competidor y direcciones de buzones virtuales (CMRA).
Inteligencia social y de medios
Posts, perfiles e interacciones de Bluesky vía AT Protocol, además de un scraper de subtítulos y transcripciones de YouTube que genera JSON, SRT, VTT o texto listo para LLM en más de 100 idiomas, y un scraper de transcripciones de TikTok.
Utilidades para desarrolladores
Herramientas más allá del scraping — auditoría de SEO y datos estructurados y renderizado de web a PDF/imagen.
Especialidades
- Ingeniería inversa de APIs privadas — convierto endpoints móviles/web no documentados en fuentes de datos fiables
- Evasión anti-bot — Cloudflare, Akamai WAF y protecciones personalizadas
- Salida lista para RAG — JSON normalizado y con esquema consistente, pensado para recuperación y fundamentación
- Scraping multirregión — locales, monedas y cumplimiento normativo resueltos
- Sistemas de alta fiabilidad — extractores construidos para seguir funcionando sin supervisión a gran escala
Stack tecnológico
| Categoría | Tecnologías |
|---|---|
| Lenguajes | TypeScript, Python, Go, Java |
| Scraping | Crawlee, Playwright, Cheerio, Parsel, got-scraping |
| Anti-bot | Generadores de huellas digitales, huella digital TLS, rotación de sesiones |
| Infraestructura | Apify Platform, Docker, GitHub Actions |
| Pruebas | Vegeta, frameworks de pruebas de carga personalizados |
Trabaja conmigo
Ofrezco soluciones de scraping a medida, ingeniería de pipelines de datos RAG y servicios continuos de extracción de datos. Si tu IA necesita la web real convertida en datos limpios — hablemos.