~/about

プロフィール

Richard Feng — Webスクレイピングエンジニア。保護されたWebサイトを、AIエージェント・検索パイプライン・LLM向けのクリーンでRAG対応の構造化データに変えます。

私について

Richard Fengと申します。フリーランスWeb自動化エンジニアです。専門はWebスクレイピング、データ抽出、APIリバースエンジニアリング——複雑に保護されたWebサイトを、AIシステムが実際に活用できるクリーンな構造化データへと変えることです。

得意とする技術スタックはNode.js(TypeScript)、Python、Go、Javaに及び、Crawlee、Playwright、Cheerioに深い専門性を持っています。

手がけていること

このカタログに掲載しているプロダクション品質のApifyアクターを開発・保守しています。すべてのアクターがクリーンなRAG対応JSONを出力します——スキーマが一貫し、重複排除済みで、ベクトルストア、検索パイプライン、学習データセットにそのまま投入できます。公開データを扱うアクターの大半はAPIキー不要です。私の業務は次の5分野にまたがります。

EC・小売データ

Sephora(米国、カナダ、EU、中東、イギリス、インド、アジア太平洋の各ストア)、Ulta Beauty、Farfetch、Lululemon、Boohoo、Macy’s、Talabat Martなど主要ビューティー・ファッション・リテールプラットフォーム向けのスクレイパーに加え、任意のShopifyやWooCommerceストアで動作する汎用スクレイパーを提供しています。

公共・金融・法律データ

米国政府の公式データセットをクリーンでRAG対応のJSONとして提供——SEC EDGAR開示書類・XBRL財務データ、USAspending.gov連邦調達・助成データ、CourtListener判例、ClinicalTrials.gov臨床試験データ。

企業・求人・リードデータ

Indeedの求人・企業データ、Shopifyストアリード、競合他社が出稿するすべての Google 広告、バーチャル私書箱(CMRA)拠点。

ソーシャル・メディアインテリジェンス

AT Protocol経由でBlueskyの投稿・プロフィール・エンゲージメントを取得するほか、100以上の言語でJSON、SRT、VTT、あるいはLLM向けテキストを出力するYouTube字幕・文字起こしスクレイパー、そしてTikTok文字起こしスクレイパーを提供しています。

開発者向けユーティリティ

スクレイピングにとどまらないツール群——SEO・構造化データ監査とWebからPDF/画像へのレンダリング。

得意分野

  • プライベートAPIのリバースエンジニアリング — 未文書化のモバイル/Webエンドポイントを信頼できるデータソースに変換
  • アンチボット回避 — Cloudflare、Akamai WAF、および独自の防御機構に対応
  • RAG対応の出力 — 検索とグラウンディングのために設計された、正規化されスキーマが一貫したJSON
  • マルチリージョン対応スクレイピング — ロケール、通貨、コンプライアンスまで対応
  • 高信頼性システム — 大規模かつ無人運用でも稼働し続けるよう設計された抽出基盤

技術スタック

カテゴリ技術
言語TypeScript, Python, Go, Java
スクレイピングCrawlee, Playwright, Cheerio, Parsel, got-scraping
アンチボットフィンガープリント生成、TLSフィンガープリンティング、セッションローテーション
インフラApify Platform, Docker, GitHub Actions
テストVegeta、独自の負荷テストフレームワーク

お仕事のご相談

カスタムスクレイピングソリューション、RAGデータパイプライン構築、継続的なデータ抽出サービスを提供しています。AIに実際のWebをクリーンなデータとして取り込みたい方は——お気軽にご相談ください。