关于
Richard Feng——爬虫工程师。我将受保护的网站转化为面向 AI Agent、检索管道与 LLM 的干净、RAG 就绪结构化数据。
我是谁
我是 Richard Feng,一名自由职业的网页自动化工程师。我专注于爬虫、数据采集与 API 逆向工程——将复杂、受保护的网站转化为 AI 系统真正可用的干净结构化数据。
我的技术栈涵盖 Node.js(TypeScript)、Python、Go 和 Java,并深入掌握 Crawlee、Playwright 与 Cheerio。
我做什么
我构建并维护这份目录中的生产级 Apify Actor。每个 Actor 都输出干净的 RAG 就绪 JSON——schema 一致、去重完毕,可直接放入向量数据库、检索管道或训练集。大多数公开数据类 Actor 无需 API 密钥。我的工作涵盖五大领域:
电商与零售数据
面向主流美妆、时尚与零售平台的爬虫,包括 Sephora(覆盖美国、加拿大、欧盟、中东、英国、印度与亚太的站点)、Ulta Beauty、Farfetch、Lululemon、Boohoo、Macy’s,以及 Talabat Mart,外加适用于任意 Shopify 或 WooCommerce 商店的通用爬虫。
公开、金融与法律数据
官方美国数据集,转化为干净、RAG 就绪的 JSON——SEC EDGAR 财报文件与 XBRL 财务数据、USAspending.gov 联邦支出项目、CourtListener 法院判决,以及 ClinicalTrials.gov 临床研究。
商业、招聘与线索数据
Indeed 职位与雇主数据、Shopify 店铺线索、竞争对手投放的每一条 Google 广告,以及虚拟邮箱(CMRA)网点。
社交与媒体情报
通过 AT Protocol 获取 Bluesky 的帖子、主页资料与互动数据,以及一款 YouTube 字幕与文字稿爬虫,可输出 JSON、SRT、VTT 或适合 LLM 使用的文本,支持 100+ 种语言,还有一款 TikTok 转录爬虫。
开发者工具
爬虫之外的工具——SEO 与结构化数据审计与网页转 PDF/图片渲染。
专长
- 私有 API 逆向工程——将未公开的移动端/网页端接口转化为可靠的数据源
- 反爬虫绕过——Cloudflare、Akamai WAF 及各类定制防护
- RAG 就绪输出——为检索与事实支撑而设计的规范化、schema 一致 JSON
- 多地区爬取——妥善处理语言区域、货币与合规问题
- 高可靠性系统——即便在无人值守、大规模运行的场景下依然能持续工作的提取工具
技术栈
| 类别 | 技术 |
|---|---|
| 编程语言 | TypeScript, Python, Go, Java |
| 爬虫 | Crawlee, Playwright, Cheerio, Parsel, got-scraping |
| 反爬虫 | Fingerprint generators, TLS fingerprinting, session rotation |
| 基础设施 | Apify Platform, Docker, GitHub Actions |
| 测试 | Vegeta, custom load-testing frameworks |
与我合作
我提供定制爬虫方案、RAG 数据管道工程,以及持续性数据采集服务。如果你的 AI 需要将真实网页转化为干净数据——联系我。