~/about

Обо мне

Ричард Фэн — инженер по веб-парсингу. Я превращаю защищенные сайты в чистые структурированные данные, готовые к RAG, для ИИ-агентов, retrieval-конвейеров и LLM.

Кто я

Я Ричард Фэн, независимый инженер по веб-автоматизации. Я специализируюсь на веб-парсинге, извлечении данных и реверс-инжиниринге API — превращаю сложные защищенные сайты в чистые структурированные данные, которые ИИ-системы могут реально использовать.

Мой инструментарий охватывает Node.js (TypeScript), Python, Go и Java, с глубокой экспертизой в Crawlee, Playwright и Cheerio.

Чем я занимаюсь

Я создаю и поддерживаю производственные акторы Apify из этого каталога. Каждый актор выдает чистый JSON, готовый к RAG, — с единой схемой, без дублей, готовый к загрузке в векторное хранилище, retrieval-конвейер или обучающий датасет. Большинству акторов с открытыми данными API-ключ не нужен. Моя работа охватывает пять направлений:

Данные e-commerce и розничной торговли

Парсеры для крупных платформ в сфере красоты, моды и розничной торговли: Sephora (витрины в США, Канаде, ЕС, на Ближнем Востоке, в Великобритании, Индии и Азиатско-Тихоокеанском регионе), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s и Talabat Mart, а также универсальные парсеры для любого магазина на Shopify или WooCommerce.

Открытые, финансовые и юридические данные

Официальные датасеты США в виде чистого JSON, готового к RAG, — отчетность SEC EDGAR и финансовые показатели XBRL, федеральные контракты USAspending.gov, судебные решения CourtListener и исследования ClinicalTrials.gov.

Данные о компаниях, вакансиях и лидах

Вакансии Indeed и данные о работодателях, лиды Shopify-магазинов, вся реклама конкурента в Google и точки виртуальных почтовых ящиков (CMRA).

Аналитика соцсетей и медиа

Посты, профили и взаимодействия Bluesky через AT Protocol, а также парсер субтитров и транскриптов YouTube, который выдает JSON, SRT, VTT или текст, готовый для LLM, на 100+ языках, и парсер транскриптов TikTok.

Утилиты для разработчиков

Инструменты, выходящие за рамки парсинга, — аудит SEO и структурированных данных и рендеринг веб-страниц в PDF/изображения.

Специализация

  • Реверс-инжиниринг закрытых API — превращаю недокументированные мобильные/веб-эндпоинты в надежные источники данных
  • Обход антибот-защиты — Cloudflare, Akamai WAF и другие индивидуальные системы защиты
  • Вывод, готовый к RAG — нормализованный JSON с единой схемой, созданный для retrieval и обоснования ответов
  • Мультирегиональный парсинг — локали, валюты и соответствие требованиям под контролем
  • Высоконадежные системы — экстракторы, созданные для бесперебойной работы без присмотра при масштабировании

Технологический стек

КатегорияТехнологии
ЯзыкиTypeScript, Python, Go, Java
ПарсингCrawlee, Playwright, Cheerio, Parsel, got-scraping
АнтиботГенераторы фингерпринтов, TLS-фингерпринтинг, ротация сессий
ИнфраструктураApify Platform, Docker, GitHub Actions
ТестированиеVegeta, собственные фреймворки для нагрузочного тестирования

Сотрудничество

Я предлагаю индивидуальные решения для парсинга, разработку RAG-конвейеров данных и постоянные услуги по извлечению данных. Если вашему ИИ нужен реальный веб в виде чистых данных — давайте обсудим.