~/about

परिचय

Richard Feng — वेब स्क्रैपिंग इंजीनियर। मैं प्रोटेक्टेड वेबसाइटों को AI एजेंट, रिट्रीवल पाइपलाइन और LLM के लिए साफ, RAG-तैयार संरचित डेटा में बदलता हूं।

मैं कौन हूं

मैं Richard Feng हूं, एक फ्रीलांस वेब-ऑटोमेशन इंजीनियर। मैं वेब स्क्रैपिंग, डेटा एक्सट्रैक्शन, और API रिवर्स इंजीनियरिंग में विशेषज्ञ हूं — जटिल, प्रोटेक्टेड वेबसाइटों को ऐसे साफ, संरचित डेटा में बदलता हूं जिसे AI सिस्टम असल में इस्तेमाल कर सकें।

मेरी टूलकिट Node.js (TypeScript), Python, Go, और Java तक फैली है, साथ ही Crawlee, Playwright, और Cheerio में गहरी विशेषज्ञता है।

मैं क्या करता हूं

मैं इस कैटलॉग के प्रोडक्शन-ग्रेड Apify एक्टर बनाता और मेंटेन करता हूं। हर एक्टर साफ, RAG-तैयार JSON देता है — schema-सुसंगत, डीड्यूप्लिकेटेड, और वेक्टर स्टोर, रिट्रीवल पाइपलाइन, या ट्रेनिंग सेट में सीधे इस्तेमाल के लिए तैयार। ज़्यादातर सार्वजनिक-डेटा एक्टर के लिए किसी API key की ज़रूरत नहीं होती। मेरा काम पाँच क्षेत्रों में फैला है:

ई-कॉमर्स और रिटेल डेटा

प्रमुख ब्यूटी, फैशन, और रिटेल प्लेटफ़ॉर्म के लिए स्क्रैपर, जिनमें शामिल हैं Sephora (अमेरिका, कनाडा, EU, मिडिल ईस्ट, UK, भारत, और एशिया-पैसिफ़िक में स्टोरफ्रंट), Ulta Beauty, Farfetch, Lululemon, Boohoo, Macy’s, और Talabat Mart, साथ ही किसी भी Shopify या WooCommerce स्टोर के लिए यूनिवर्सल स्क्रैपर।

सार्वजनिक, वित्तीय और कानूनी डेटा

आधिकारिक U.S. डेटासेट साफ, RAG-तैयार JSON के रूप में — SEC EDGAR फाइलिंग व XBRL फाइनेंशियल्स, USAspending.gov के संघीय अवार्ड्स, CourtListener अदालती फैसले, और ClinicalTrials.gov स्टडीज़।

बिज़नेस, जॉब और लीड डेटा

Indeed नौकरियाँ और नियोक्ता डेटा, Shopify स्टोर लीड, किसी प्रतिस्पर्धी का Google पर चलने वाला हर विज्ञापन, और वर्चुअल मेलबॉक्स (CMRA) लोकेशन।

सोशल और मीडिया इंटेलिजेंस

AT Protocol के ज़रिए Bluesky पोस्ट, प्रोफ़ाइल, और इंटरैक्शन, साथ ही एक YouTube subtitle & transcript scraper जो 100+ भाषाओं में JSON, SRT, VTT, या LLM-तैयार टेक्स्ट देता है, और एक TikTok transcript scraper।

डेवलपर यूटिलिटीज़

स्क्रैपिंग से आगे के टूल्स — SEO व संरचित-डेटा ऑडिटिंग और web-to-PDF/image रेंडरिंग।

विशेषज्ञताएं

  • प्राइवेट API रिवर्स इंजीनियरिंग — अनडॉक्यूमेंटेड मोबाइल/वेब एंडपॉइंट्स को भरोसेमंद डेटा सोर्स में बदलना
  • एंटी-बॉट बाईपास — Cloudflare, Akamai WAF, और कस्टम प्रोटेक्शन
  • RAG-तैयार आउटपुट — रिट्रीवल और ग्राउंडिंग के लिए बना normalized, schema-सुसंगत JSON
  • मल्टी-रीजन स्क्रैपिंग — लोकेल, करेंसी, और कंप्लायंस का पूरा ध्यान
  • हाई-रिलायबिलिटी सिस्टम — ऐसे एक्सट्रैक्टर जो स्केल पर बिना निगरानी के लगातार काम करते रहते हैं

टेक स्टैक

कैटेगरीटेक्नोलॉजीज़
भाषाएंTypeScript, Python, Go, Java
स्क्रैपिंगCrawlee, Playwright, Cheerio, Parsel, got-scraping
एंटी-बॉटFingerprint generators, TLS fingerprinting, session rotation
इंफ्रास्ट्रक्चरApify Platform, Docker, GitHub Actions
टेस्टिंगVegeta, custom load-testing frameworks

मेरे साथ काम करें

मैं कस्टम स्क्रैपिंग सॉल्यूशन, RAG डेटा-पाइपलाइन इंजीनियरिंग, और लगातार चलने वाली डेटा एक्सट्रैक्शन सर्विसेज़ ऑफ़र करता हूं। अगर आपके AI को असली वेब साफ डेटा के रूप में चाहिए — बात करते हैं।