# Proooxy — 面向 AI Agent 与 LLM 的 RAG 就绪网页数据 > 面向 AI Agent、检索管道与大语言模型的结构化、RAG 就绪网页数据。Richard Feng 打造生产级 Apify Actor,覆盖电商、SEC/EDGAR 财报文件、联邦支出、法院判决、临床试验、招聘与雇主数据、B2B 店铺线索、竞争对手的 Google 广告及社交与视频数据——绕过反爬虫防护,输出干净、schema 一致的 JSON,公开数据无需 API 密钥。 Richard Feng 是一名独立爬虫工程师,专注于将开放网络转化为面向 AI Agent、检索管道与 LLM 的干净、RAG 就绪结构化数据。他打造生产级 Apify Actor,覆盖五大领域:电商与零售、公开与金融数据(SEC EDGAR 财报文件与 XBRL、USAspending.gov 联邦支出项目、CourtListener 法院判决、ClinicalTrials.gov 临床研究)、商业、招聘与线索数据(Indeed 职位与雇主数据、Shopify 店铺线索、竞争对手的 Google 广告、虚拟邮箱地址)、社交与媒体(Bluesky、YouTube 与 TikTok 字幕/文字稿),以及开发者/SEO 工具。每个 Actor 都输出 schema 一致的 JSON,专为事实支撑与检索而设计——大多数公开数据类 Actor 无需 API 密钥——必要时具备反爬虫绕过能力(Cloudflare、Akamai)与住宅代理支持,并按事件计费。 **最适合:** 为 AI Agent 与 RAG 系统提供实时网页数据支撑、构建 LLM 训练/评估数据集、开展市场与竞争情报分析,以及搭建另类数据管道。 ## 基本信息 - **网站:** https://proooxy.com/zh/ - **作者:** Richard Feng (p8p9cmk96@mozmail.com) - **GitHub:** https://github.com/autofacts - **Apify Store:** https://apify.com/autofacts - **工具数量:** 23 - **技术栈:** Python(Crawlee、curl_cffi、Parsel)与 TypeScript(Apify SDK、Crawlee、Cheerio) - **托管方式:** Apify 云端——按事件计费,提供免费额度 ## 工具 ### [Google Ads Scraper——搜索、YouTube 与购物广告](https://proooxy.com/zh/tools/google-ads-scraper/) 竞争对手在 Google 上投放的每一条广告——搜索、YouTube、购物、地图与 Play——按域名、广告主或品牌查找,附带每条广告的投放天数、覆盖的国家,以及在欧盟境内的展示次数与受众定向。 - 市场: 全球 - 技术栈: TypeScript - Apify: https://apify.com/autofacts/google-ads-scraper ### [ASOS 爬虫——价格、各尺码库存、评价与分类](https://proooxy.com/zh/tools/asos-scraper/) 抓取 ASOS 12 个站点的商品与分类:含建议零售价与 30 天最低价的价格、每个尺码的库存、EAN 条码、颜色与尺码变体、图片与 T 台视频、评分、评价与收藏数。 - 市场: 英国, 美国, 法国, 德国, 西班牙, 意大利, 荷兰, 波兰, 瑞典, 丹麦, 澳大利亚, 俄罗斯 - 技术栈: TypeScript, Crawlee - Apify: https://apify.com/autofacts/asos ### [TikTok 字幕与转录爬虫——JSON、SRT、VTT、LLM](https://proooxy.com/zh/tools/tiktok-transcript-scraper/) 从视频链接、短链或整个 @账号 提取 TikTok 字幕与转录文本,输出 JSON、SRT、VTT、纯文本或适配大模型的清洗文本。直接取原生字幕——不用 Whisper,不需要 API key,单条视频约两秒。 - 市场: 全球 - 技术栈: TypeScript - Apify: https://apify.com/autofacts/tiktok-subtitle-transcript-scraper ### [WooCommerce 爬虫——商品、价格、库存与评价](https://proooxy.com/zh/tools/woocommerce-scraper/) 从任意 WooCommerce 店铺抓取商品、变体、类目与用户评价。只需给出域名即可定位商品目录——即使店铺关闭了 JSON API 也能抓取。 - 市场: 全球 - 技术栈: TypeScript, Cheerio - Apify: https://apify.com/autofacts/woocommerce-scraper ### [Anytime Mailbox 爬虫——虚拟邮箱地址与 CMRA 名录](https://proooxy.com/zh/tools/anytime-mailbox-scraper/) 抓取 Anytime Mailbox 全球所有虚拟邮箱网点——街道地址、邮件中心运营方与起步价——并通过 Smarty 逐条核验地址,输出可投递性、CMRA 标记、所属县与经纬度。 - 市场: 美国, 全球 - 技术栈: TypeScript, Crawlee - Apify: https://apify.com/autofacts/anytime-mailbox-scraper-virtual-mailbox-locations-cmra ### [Indeed 爬虫——职位、雇主、评价与薪资](https://proooxy.com/zh/tools/indeed-scraper/) 抓取 Indeed 职位信息,含完整职位描述与解析后的薪资,并在同一次运行中带回背后的雇主:公司资料、员工评价、薪资表与问答,按 Indeed 自有雇主 ID 关联。支持 62 个国家站点,无需登录。 - 市场: 全球 - 技术栈: TypeScript, Crawlee - Apify: https://apify.com/autofacts/indeed-jobs-scraper-companies-reviews-salaries ### [Shopify 店铺线索——目录规模、应用与联系方式](https://proooxy.com/zh/tools/shopify-store-leads/) 带有可用于判断成色的数字的 Shopify 店铺线索:商品数、价格区间、主题、已安装应用、上新节奏与商务联系方式。既可按筛选条件发现新店铺,也可为你已有的域名做富集。 - 市场: 全球 - 技术栈: TypeScript, Cheerio - Apify: https://apify.com/autofacts/shopify-store-leads ### [Talabat Mart 爬虫——迪拜生鲜杂货价格与 SKU](https://proooxy.com/zh/tools/talabat-mart-scraper/) 从迪拜各 Talabat Mart 前置仓(dark store)提取即时零售杂货 SKU、价格、条码与实时库存——覆盖 153 个配送区域,每件商品均带 EAN/UPC,输出统一的商品 schema。 - 市场: 阿联酋 - 技术栈: TypeScript - Apify: https://apify.com/autofacts/talabat-mart-grocery-scraper ### [Macy's Scraper——商品、价格、SKU 与新闻](https://proooxy.com/zh/tools/macys-scraper/) 提取 Macy's 的商品数据——价格、变体、SKU/UPC 条码、图片、评分与评论——以及 Macy's Inc. 新闻,覆盖搜索、分类、热门与商品 URL。无需浏览器。 - 市场: 美国 - 技术栈: TypeScript, Crawlee, Cheerio - Apify: https://apify.com/autofacts/macy-s-scraper ### [Bluesky Scraper——帖子、主页资料、动态与互动数据](https://proooxy.com/zh/tools/bluesky-scraper/) 通过 AT Protocol 提取 Bluesky 的帖子、主页资料、关注者、动态、话题串、点赞者与转发者数据——并支持通过 App Password 进行已登录搜索与话题标签查询。输出干净、规范化的 JSON。 - 市场: 全球 - 技术栈: TypeScript, AT Protocol - Apify: https://apify.com/autofacts/bluesky-scraper ### [ClinicalTrials.gov Scraper——临床研究、入组标准与结果数据](https://proooxy.com/zh/tools/clinical-trials-scraper/) 按病症、干预措施、申办方、地点、状态或 NCT ID 检索官方 ClinicalTrials.gov v2 API。导出包含入组标准、结果元数据的规范化研究记录,并支持增量更新——无需 API 密钥。 - 市场: 全球 - 技术栈: TypeScript, REST API - Apify: https://apify.com/autofacts/clinical-trials-scraper ### [CourtListener Scraper——判决书、案卷与全文数据](https://proooxy.com/zh/tools/courtlistener-scraper/) 查询 CourtListener 的美国法院判决、RECAP 案卷、口头辩论、法官与判例引注——附带完整判决全文与 RAG 就绪分块。支持按法院、日期或关键词筛选。 - 市场: 美国 - 技术栈: TypeScript, Cheerio - Apify: https://apify.com/autofacts/courtlistener-scraper ### [SEC EDGAR Scraper——财报文件、全文与 XBRL 财务数据](https://proooxy.com/zh/tools/sec-edgar-scraper/) 提取 SEC EDGAR 的财报文件元数据、10-K/10-Q 全文章节、EDGAR 全文检索结果,以及 XBRL 财务数据,输出干净、RAG 就绪的 JSON。无需 API 密钥。 - 市场: 美国 - 技术栈: TypeScript, Cheerio - Apify: https://apify.com/autofacts/sec-edgar-scraper ### [USAspending.gov Scraper——联邦支出项目、接收方与汇总数据](https://proooxy.com/zh/tools/usaspending-scraper/) 查询官方 USAspending.gov API v2 的联邦合同、拨款与贷款数据。支持按机构、接收方、NAICS/PSC 或日期筛选,并可拉取接收方档案、分类汇总,以及州/县/选区的地理汇总数据。无需 API 密钥。 - 市场: 美国 - 技术栈: TypeScript, REST API - Apify: https://apify.com/autofacts/usaspending-scraper ### [YouTube Subtitle & Transcript Scraper——JSON、SRT、VTT、LLM 多格式输出](https://proooxy.com/zh/tools/youtube-transcript-scraper/) 从视频、Shorts、播放列表与频道中提取 YouTube 字幕与文字稿,输出为 JSON、SRT、VTT、纯文本,或适合 LLM 使用的干净文本。支持 100+ 种语言、丰富的元数据、无需 API 密钥——提取失败不收费。 - 市场: 全球 - 技术栈: TypeScript - Apify: https://apify.com/autofacts/youtube-subtitle-transcript-scraper ### [Sephora Scraper(全球版)](https://proooxy.com/zh/tools/sephora-scraper/) 这是一款 Apify Actor,可提取 Sephora 完整的商品数据——变体、价格、图片、成分与评论——覆盖 Sephora 在美国、加拿大、9 个欧盟市场、6 个中东市场、英国、印度与 10 个亚太市场的站点,全部纳入同一套规范化 schema。 - 市场: 美国, 加拿大, 法国, 意大利, 德国, 西班牙, 波兰, 捷克, 希腊, 罗马尼亚, 葡萄牙, 阿联酋, 沙特阿拉伯, 巴林, 阿曼, 科威特, 卡塔尔, 英国, 印度, 新西兰, 澳大利亚, 新加坡, 马来西亚, 泰国, 印度尼西亚, 菲律宾, 中国香港, 中国台湾, 文莱 - 技术栈: Python, Crawlee - Apify: https://apify.com/autofacts/sephora ### [Boohoo Scraper——覆盖 7 个地区的商品数据](https://proooxy.com/zh/tools/boohoo-scraper/) 提取 Boohoo 电商网站在 7 个地区的商品数据,支持自动分页、分面筛选与多币种。 - 市场: 荷兰, 瑞典, 英国, 爱尔兰, 法国, 澳大利亚, 美国 - 技术栈: TypeScript, Cheerio - Apify: https://apify.com/autofacts/boohoo-scraper ### [Farfetch Scraper——奢侈时尚商品数据](https://proooxy.com/zh/tools/farfetch-scraper/) 提取 Farfetch 的奢侈时尚商品数据,包括多币种定价、尺码/版型变体与商品推荐。 - 市场: 全球 - 技术栈: TypeScript, Cheerio, Crawlee - Apify: https://apify.com/autofacts/farfetch ### [Lululemon Scraper——商品、变体与价格](https://proooxy.com/zh/tools/lululemon-scraper/) 抓取并提取 Lululemon 的商品详情,包括变体数据、颜色选项、媒体图库与定价信息。 - 市场: 美国 - 技术栈: TypeScript, Crawlee - Apify: https://apify.com/autofacts/lululemon-scraper ### [Schema Markup Scraper——结构化数据抓取与 SEO 审计工具](https://proooxy.com/zh/tools/schema-markup-scraper/) 从任意 URL 提取 JSON-LD、Microdata、RDFa、Open Graph 与 Twitter Cards,并提供完整的 SEO 审计评分系统。 - 市场: 全球 - 技术栈: TypeScript, Crawlee - Apify: https://apify.com/autofacts/metadata-scraper ### [Shopify Scraper——任意商店的商品数据](https://proooxy.com/zh/tools/shopify-scraper/) 专业级工具,可从任意 Shopify 商店提取高保真商品数据,包括系列(collections)、搜索与商品推荐。 - 市场: 全球 - 技术栈: TypeScript, Cheerio - Apify: https://apify.com/autofacts/shopify ### [Ulta Beauty Scraper——商品、价格与 SKU](https://proooxy.com/zh/tools/ulta-scraper/) 提取 Ulta Beauty 的商品详情、定价、图片与 SKU 信息,覆盖分类页、品牌页与促销专区。 - 市场: 美国 - 技术栈: TypeScript, Crawlee - Apify: https://apify.com/autofacts/ulta-scraper ### [Universal Web Printer——URL 与 HTML 转 PDF、图片](https://proooxy.com/zh/tools/web-printer/) 将任意 URL 或 HTML 转换为 PDF、PNG、JPEG 或 WebP,支持智能滚动拼接、元素提取、PDF 加密与水印。 - 市场: 全球 - 技术栈: TypeScript, Playwright, PDF-lib, Sharp - Apify: https://apify.com/autofacts/universal-web-printer ## 博客 - [2026 年网页抓取最佳实践:一线工程师指南](https://proooxy.com/zh/blog/web-scraping-best-practices-2026/) — 源自一线生产环境实战的爬虫策略——架构模式、错误处理、代理管理与输出规范化。 - [读懂反爬虫防护:2026 年哪些方法依然有效](https://proooxy.com/zh/blog/bypassing-anti-bot-protection-guide/) — 深入解析现代反爬虫系统——Cloudflare、Akamai、Datadome——以及生产级爬虫中实际使用的合规绕过技术。 ## 站点地图 - [关于 Richard Feng](https://proooxy.com/zh/about/) — 背景、专业领域与服务 - [联系方式](https://proooxy.com/zh/contact/) — 用于定制爬虫 / DaaS 合作咨询 - [Apify Store](https://apify.com/autofacts) — 免费试用任意工具 - [GitHub](https://github.com/autofacts) — 部分项目的源码 - [纯文本形式的完整内容](https://proooxy.com/zh/llms-full.txt) — 整合全站页面内容,适配 AI 上下文窗口