~/about

소개

Richard Feng — 웹 크롤링 엔지니어입니다. 보호된 웹사이트를 AI 에이전트, 리트리벌 파이프라인, LLM을 위한 클린 RAG-레디 구조화된 데이터로 바꿉니다.

소개

저는 Richard Feng, 프리랜서 웹 자동화 엔지니어입니다. 웹 크롤링, 데이터 추출, API 리버스 엔지니어링을 전문으로 하며, 복잡하고 보호된 웹사이트를 AI 시스템이 실제로 활용할 수 있는 클린한 구조화 데이터로 바꿉니다.

제 툴킷은 Node.js (TypeScript), Python, Go, Java를 아우르며, Crawlee, Playwright, Cheerio에 대한 깊은 전문성을 갖추고 있습니다.

하는 일

이 카탈로그에 있는 프로덕션급 Apify 액터를 만들고 유지보수하고 있습니다. 모든 액터는 클린한 RAG-레디 JSON을 출력합니다 — 스키마가 일관되고, 중복이 제거되어, 벡터 스토어·리트리벌 파이프라인·학습 세트에 바로 투입할 수 있습니다. 대부분의 공개 데이터 액터는 API 키가 필요 없습니다. 제 작업은 크게 다섯 가지 영역으로 나뉩니다:

이커머스 및 리테일 데이터

Sephora(미국, 캐나다, EU, 중동, 영국, 인도, 아시아태평양 스토어), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s, Talabat Mart 등 주요 뷰티·패션·리테일 플랫폼용 스크래퍼와, Shopify 또는 WooCommerce 기반이라면 어떤 스토어에도 동작하는 범용 스크래퍼를 제공합니다.

공공·금융·법률 데이터

미국 공식 데이터셋을 클린한 RAG-레디 JSON으로 제공합니다 — SEC EDGAR 공시 및 XBRL 재무 데이터, USAspending.gov 연방 지출 내역, CourtListener 판례, ClinicalTrials.gov 임상시험.

기업·채용·리드 데이터

Indeed 채용 공고 및 고용주 데이터, Shopify 스토어 리드, 경쟁사가 게재하는 모든 Google 광고, 가상 사서함(CMRA) 지점.

소셜 및 미디어 인텔리전스

AT Protocol을 통한 Bluesky 게시물·프로필·인터랙션 데이터, 100개 이상의 언어로 JSON, SRT, VTT, LLM-레디 텍스트를 출력하는 YouTube 자막·스크립트 스크래퍼, 그리고 TikTok 스크립트 스크래퍼를 제공합니다.

개발자 유틸리티

크롤링을 넘어선 도구들입니다 — SEO 및 구조화 데이터 감사와 웹-투-PDF/이미지 렌더링.

전문 분야

  • 비공개 API 리버스 엔지니어링 — 문서화되지 않은 모바일/웹 엔드포인트를 안정적인 데이터 소스로 전환
  • 안티봇 우회 — Cloudflare, Akamai WAF 및 커스텀 방어 시스템
  • RAG-레디 출력 — 리트리벌과 그라운딩을 위해 설계된 정규화·스키마 일관 JSON
  • 다중 지역 크롤링 — 로케일, 통화, 컴플라이언스까지 처리
  • 고신뢰성 시스템 — 대규모 환경에서도 무인으로 계속 작동하도록 설계된 추출기

기술 스택

분류기술
언어TypeScript, Python, Go, Java
크롤링Crawlee, Playwright, Cheerio, Parsel, got-scraping
안티봇핑거프린트 생성기, TLS 핑거프린팅, 세션 로테이션
인프라Apify Platform, Docker, GitHub Actions
테스트Vegeta, 커스텀 부하 테스트 프레임워크

함께 일하기

맞춤 크롤링 솔루션, RAG 데이터 파이프라인 엔지니어링, 지속적인 데이터 추출 서비스를 제공합니다. AI에 실제 웹 데이터를 클린한 형태로 공급해야 한다면 — 이야기해봅시다.