Tentang Saya
Richard Feng — web scraping engineer. Saya mengubah situs web yang terproteksi menjadi data terstruktur yang bersih dan siap-RAG untuk agen AI, pipeline retrieval, dan LLM.
Siapa saya
Saya Richard Feng, seorang freelance web-automation engineer. Saya berspesialisasi dalam web scraping, ekstraksi data, dan reverse engineering API — mengubah situs web yang kompleks dan terproteksi menjadi data terstruktur yang benar-benar bisa digunakan oleh sistem AI.
Toolkit saya mencakup Node.js (TypeScript), Python, Go, dan Java, dengan keahlian mendalam di Crawlee, Playwright, dan Cheerio.
Apa yang saya kerjakan
Saya membangun dan memelihara Apify Actor kelas produksi dari katalog ini. Setiap actor menghasilkan JSON siap-RAG yang bersih — konsisten skemanya, terdeduplikasi, dan siap langsung dipakai di vector store, pipeline retrieval, atau training set. Sebagian besar actor data publik tidak memerlukan API key. Pekerjaan saya mencakup lima bidang:
Data e-commerce & ritel
Scraper untuk platform kecantikan, fashion, dan ritel besar, termasuk Sephora (storefront di US, Kanada, EU, Timur Tengah, Inggris, India, dan Asia-Pasifik), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s, dan Talabat Mart, plus scraper universal untuk toko Shopify atau WooCommerce mana pun.
Data publik, keuangan & hukum
Dataset resmi Amerika Serikat sebagai JSON bersih dan siap-RAG — laporan SEC EDGAR & data keuangan XBRL, dana federal dari USAspending.gov, putusan pengadilan dari CourtListener, dan studi dari ClinicalTrials.gov.
Data bisnis, lowongan & prospek
Lowongan Indeed dan data pemberi kerja, prospek toko Shopify, semua iklan Google yang dijalankan kompetitor, dan lokasi kotak surat virtual (CMRA).
Intelijen sosial & media
Postingan, profil, dan interaksi Bluesky via AT Protocol, ditambah YouTube subtitle & transcript scraper yang menghasilkan output JSON, SRT, VTT, atau teks siap-LLM dalam 100+ bahasa, dan TikTok transcript scraper.
Utilitas developer
Tools di luar scraping — audit SEO & structured data dan rendering web-ke-PDF/gambar.
Spesialisasi
- Reverse engineering private API — mengubah endpoint mobile/web yang tidak terdokumentasi menjadi sumber data yang andal
- Bypass anti-bot — Cloudflare, Akamai WAF, dan proteksi custom
- Output siap-RAG — JSON yang dinormalisasi dan konsisten skemanya, dibangun untuk retrieval dan grounding
- Scraping multi-region — locale, mata uang, dan kepatuhan (compliance) sudah ditangani
- Sistem dengan reliabilitas tinggi — extractor yang dibangun untuk terus bekerja tanpa pengawasan dalam skala besar
Tech stack
| Kategori | Teknologi |
|---|---|
| Bahasa | TypeScript, Python, Go, Java |
| Scraping | Crawlee, Playwright, Cheerio, Parsel, got-scraping |
| Anti-bot | Fingerprint generator, TLS fingerprinting, rotasi sesi |
| Infrastruktur | Apify Platform, Docker, GitHub Actions |
| Testing | Vegeta, framework load-testing custom |
Bekerja sama dengan saya
Saya menawarkan solusi scraping custom, rekayasa pipeline data RAG, dan layanan ekstraksi data berkelanjutan. Jika AI Anda membutuhkan web asli sebagai data yang bersih — mari bicara.