~/about

À propos

Richard Feng — ingénieur web scraping. Je transforme les sites web protégés en données structurées propres, prêtes pour le RAG, pour agents IA, pipelines de récupération et LLM.

Qui je suis

Je m’appelle Richard Feng, ingénieur freelance en automatisation web. Je suis spécialisé en web scraping, extraction de données et rétro-ingénierie d’API — je transforme des sites web complexes et protégés en données structurées propres, directement exploitables par les systèmes d’IA.

Ma boîte à outils couvre Node.js (TypeScript), Python, Go et Java, avec une expertise approfondie de Crawlee, Playwright et Cheerio.

Ce que je fais

Je développe et maintiens les acteurs Apify de qualité production de ce catalogue. Chaque acteur produit du JSON propre, prêt pour le RAG — cohérent avec son schéma, dédupliqué, et prêt à être injecté dans une base vectorielle, un pipeline de récupération ou un jeu d’entraînement. La plupart des acteurs de données publiques ne nécessitent aucune clé API. Mon travail couvre cinq domaines :

E-commerce et données retail

Des scrapers pour les grandes plateformes de beauté, de mode et de retail, dont Sephora (boutiques aux États-Unis, au Canada, dans l’UE, au Moyen-Orient, au Royaume-Uni, en Inde et en Asie-Pacifique), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s, et Talabat Mart, ainsi que des scrapers universels pour toute boutique Shopify ou WooCommerce.

Données publiques, financières et juridiques

Des jeux de données officiels du gouvernement américain sous forme de JSON propre et prêt pour le RAG — dépôts SEC EDGAR et données financières XBRL, financements fédéraux USAspending.gov, décisions de justice CourtListener, et essais cliniques ClinicalTrials.gov.

Données entreprises, emploi et leads

Offres d’emploi et données employeurs d’Indeed, leads de boutiques Shopify, chaque annonce Google diffusée par un concurrent, et adresses de boîtes postales virtuelles (CMRA).

Veille réseaux sociaux et médias

Posts, profils et interactions Bluesky via l’AT Protocol, ainsi qu’un scraper de sous-titres et transcriptions YouTube qui génère du JSON, SRT, VTT ou du texte prêt pour LLM en plus de 100 langues, et un scraper de transcriptions TikTok.

Outils pour développeurs

Des outils au-delà du scraping — audit SEO et données structurées et conversion de pages web en PDF/image.

Spécialités

  • Rétro-ingénierie d’API privées — transformer des endpoints mobiles/web non documentés en sources de données fiables
  • Contournement anti-bot — Cloudflare, Akamai WAF, et protections personnalisées
  • Sortie prête pour le RAG — JSON normalisé et cohérent avec son schéma, conçu pour la récupération et le grounding
  • Scraping multi-régions — locales, devises et conformité pris en charge
  • Systèmes haute fiabilité — des extracteurs conçus pour continuer à fonctionner sans surveillance à grande échelle

Stack technique

CatégorieTechnologies
LangagesTypeScript, Python, Go, Java
ScrapingCrawlee, Playwright, Cheerio, Parsel, got-scraping
Anti-botGénérateurs de fingerprint, fingerprinting TLS, rotation de sessions
InfrastructureApify Platform, Docker, GitHub Actions
TestsVegeta, frameworks de test de charge personnalisés

Travailler avec moi

Je propose des solutions de scraping sur mesure, la conception de pipelines de données RAG, et des services d’extraction de données en continu. Si votre IA a besoin du web réel sous forme de données propres — parlons-en.