# Proooxy — RAG-fertige Webdaten für KI-Agenten & LLMs > Strukturierte, RAG-fertige Webdaten für KI-Agenten, Retrieval-Pipelines und LLMs. Richard Feng entwickelt produktionsreife Apify-Actors für E-Commerce, SEC/EDGAR-Filings, US-Bundesausgaben, Gerichtsentscheidungen, klinische Studien, Stellen- und Arbeitgeberdaten, B2B-Store-Leads, Google-Anzeigen von Wettbewerbern sowie Social- und Videodaten — Anti-Bot-Bypass, sauberes, schemakonsistentes JSON, keine API-Keys für öffentliche Daten. Richard Feng ist ein unabhängiger Web-Scraping-Engineer, der das offene Web in saubere, RAG-fertige strukturierte Daten für KI-Agenten, Retrieval-Pipelines und LLMs verwandelt. Er entwickelt produktionsreife Apify-Actors in fünf Bereichen: E-Commerce & Einzelhandel, öffentliche & Finanzdaten (SEC-EDGAR-Filings & XBRL, USAspending.gov-Bundesvergaben, CourtListener-Gerichtsentscheidungen, ClinicalTrials.gov-Studien), Unternehmens-, Job- und Lead-Daten (Indeed-Stellen und -Arbeitgeber, Shopify-Store-Leads, Google-Anzeigen von Wettbewerbern, Standorte virtueller Postfächer), Social & Media (Bluesky, YouTube- und TikTok-Untertitel/-Transkripte) sowie Entwickler-/SEO-Tools. Jeder Actor liefert schemakonsistentes JSON für Grounding und Retrieval — die meisten Actors für öffentliche Daten benötigen keinen API-Key —, dazu Anti-Bot-Bypass (Cloudflare, Akamai) und Unterstützung für Residential-Proxys wo nötig sowie Pay-per-Event-Preise. **Ideal für:** Grounding von KI-Agenten und RAG-Systemen mit aktuellen Webdaten, den Aufbau von LLM-Trainings-/Eval-Datensätzen, Markt- und Wettbewerbsanalysen sowie Alternative-Data-Pipelines. ## Auf einen Blick - **Website:** https://proooxy.com/de/ - **Autor:** Richard Feng (p8p9cmk96@mozmail.com) - **GitHub:** https://github.com/autofacts - **Apify Store:** https://apify.com/autofacts - **Anzahl Tools:** 23 - **Stack:** Python (Crawlee, curl_cffi, Parsel) und TypeScript (Apify SDK, Crawlee, Cheerio) - **Hosting:** Apify Cloud — Pay-per-Event-Preise, kostenloser Tarif verfügbar ## Tools ### [Google Ads Scraper — Search, YouTube & Shopping Ads](https://proooxy.com/de/tools/google-ads-scraper/) Jede Anzeige, die ein Wettbewerber auf Google schaltet — Search, YouTube, Shopping, Maps und Play — gefunden nach Domain, Werbetreibendem oder Marke, mit den Tagen, an denen jede Anzeige lief, den erreichten Ländern und, in der EU, ihren Impressionen und ihrer Zielgruppenausrichtung. - Märkte: Weltweit - Stack: TypeScript - Apify: https://apify.com/autofacts/google-ads-scraper ### [ASOS Scraper — Preise, Bestand je Größe, Bewertungen & Kategorien](https://proooxy.com/de/tools/asos-scraper/) Scrapen Sie ASOS-Produkte und -Kategorien in 12 Shops: Preise mit UVP und niedrigstem Preis der letzten 30 Tage, Bestand je Größe, EAN-Codes, Farb- und Größenvarianten, Bilder und Laufstegvideos, Bewertungen, Rezensionen und Merklisten-Zahlen. - Märkte: Großbritannien, USA, Frankreich, Deutschland, Spanien, Italien, Niederlande, Polen, Schweden, Dänemark, Australien, Russland - Stack: TypeScript, Crawlee - Apify: https://apify.com/autofacts/asos ### [TikTok Transkript- & Untertitel-Scraper — JSON, SRT, VTT, LLM](https://proooxy.com/de/tools/tiktok-transcript-scraper/) Extrahiert TikTok-Untertitel und -Transkripte aus Video-URLs, Kurzlinks oder einem ganzen @Profil als JSON, SRT, VTT, Klartext oder LLM-fertigen Text. Native Untertitel — kein Whisper, kein API-Key, rund zwei Sekunden pro Video. - Märkte: Weltweit - Stack: TypeScript - Apify: https://apify.com/autofacts/tiktok-subtitle-transcript-scraper ### [WooCommerce-Scraper — Produkte, Preise, Bestand & Bewertungen](https://proooxy.com/de/tools/woocommerce-scraper/) Liest Produkte, Varianten, Kategorien und Kundenbewertungen aus jedem WooCommerce-Shop. Eine Domain genügt, und der Actor findet den Katalog — auch wenn der Shop seine JSON-API abgeschaltet hat. - Märkte: Weltweit - Stack: TypeScript, Cheerio - Apify: https://apify.com/autofacts/woocommerce-scraper ### [Anytime Mailbox Scraper — Virtuelle Postfächer & CMRA-Register](https://proooxy.com/de/tools/anytime-mailbox-scraper/) Crawlen Sie weltweit jeden Anytime-Mailbox-Standort für virtuelle Postfächer — Straßenadresse, Betreiber des Mail Centers und Einstiegspreis — mit jeder Adresse über Smarty auf Zustellbarkeit, CMRA-Status, County und Geokoordinaten geprüft. - Märkte: USA, Weltweit - Stack: TypeScript, Crawlee - Apify: https://apify.com/autofacts/anytime-mailbox-scraper-virtual-mailbox-locations-cmra ### [Indeed Scraper — Stellen, Arbeitgeber, Bewertungen & Gehälter](https://proooxy.com/de/tools/indeed-scraper/) Scrapen Sie Indeed-Stellenanzeigen mit vollständigen Beschreibungen und geparsten Gehältern — und im selben Lauf die Arbeitgeber dahinter: Unternehmensprofile, Mitarbeiterbewertungen, Gehaltstabellen und Q&A, verknüpft über Indeeds eigene Arbeitgeber-ID. 62 Länderdomains, ohne Login. - Märkte: Weltweit - Stack: TypeScript, Crawlee - Apify: https://apify.com/autofacts/indeed-jobs-scraper-companies-reviews-salaries ### [Shopify Store Leads — Katalogumfang, Apps & Kontakte](https://proooxy.com/de/tools/shopify-store-leads/) Shopify-Store-Leads mit den Kennzahlen, die sie qualifizieren: Produktanzahl, Preisband, Theme, installierte Apps, Veröffentlichungsfrequenz und Geschäftskontakte. Finden Sie neue Stores per Filter oder reichern Sie vorhandene Domains an. - Märkte: Weltweit - Stack: TypeScript, Cheerio - Apify: https://apify.com/autofacts/shopify-store-leads ### [Talabat Mart Scraper — Lebensmittelpreise und Artikel in Dubai](https://proooxy.com/de/tools/talabat-mart-scraper/) Extrahieren Sie Artikelnummern, Preise, Barcodes und echte Lagerbestände aus den Talabat-Mart-Dark-Stores in Dubai — 153 Lieferzonen, EAN/UPC auf jedem Artikel, ein einheitliches Produktschema. - Märkte: VAE - Stack: TypeScript - Apify: https://apify.com/autofacts/talabat-mart-grocery-scraper ### [Macy's Scraper — Produkte, Preise, SKUs & News](https://proooxy.com/de/tools/macys-scraper/) Macy's-Produktdaten extrahieren — Preise, Varianten, SKU-/UPC-Barcodes, Bilder, Bewertungen & Rezensionen — plus Macy's-Inc.-News, aus Such-, Kategorie-, Trending- und Produkt-URLs. Ohne Browser. - Märkte: USA - Stack: TypeScript, Crawlee, Cheerio - Apify: https://apify.com/autofacts/macy-s-scraper ### [Bluesky Scraper — Beiträge, Profile, Feeds & Interaktionen](https://proooxy.com/de/tools/bluesky-scraper/) Bluesky-Beiträge, -Profile, -Follower, -Feeds, -Threads, -Liker und -Reposter über das AT Protocol extrahieren — plus authentifizierte Suche und Hashtag-Ergebnisse mit einem App-Passwort. Sauberes, normalisiertes JSON. - Märkte: Weltweit - Stack: TypeScript, AT Protocol - Apify: https://apify.com/autofacts/bluesky-scraper ### [ClinicalTrials.gov Scraper — Studien, Eignungskriterien & Ergebnisse](https://proooxy.com/de/tools/clinical-trials-scraper/) Die offizielle ClinicalTrials.gov-v2-API durchsuchen nach Erkrankung, Intervention, Sponsor, Standort, Status oder NCT-ID. Normalisierte Studiendatensätze mit Eignungskriterien, Ergebnis-Metadaten und inkrementellen Updates exportieren — kein API-Key nötig. - Märkte: Weltweit - Stack: TypeScript, REST API - Apify: https://apify.com/autofacts/clinical-trials-scraper ### [CourtListener Scraper — Gerichtsentscheidungen, Dockets & Volltext](https://proooxy.com/de/tools/courtlistener-scraper/) CourtListener durchsuchen nach US-Gerichtsentscheidungen, RECAP-Dockets, mündlichen Verhandlungen, Richtern und Zitaten — mit vollständigem Urteilstext und RAG-fertigen Chunks. Filterbar nach Gericht, Datum oder Stichwort. - Märkte: USA - Stack: TypeScript, Cheerio - Apify: https://apify.com/autofacts/courtlistener-scraper ### [SEC EDGAR Scraper — Filings, Volltext & XBRL-Finanzdaten](https://proooxy.com/de/tools/sec-edgar-scraper/) SEC-EDGAR-Filing-Metadaten, Volltext-Abschnitte aus 10-K/10-Q, EDGAR-Volltextsuche-Ergebnisse und XBRL-Finanzdaten als sauberes, RAG-fertiges JSON extrahieren. Kein API-Key erforderlich. - Märkte: USA - Stack: TypeScript, Cheerio - Apify: https://apify.com/autofacts/sec-edgar-scraper ### [USAspending.gov Scraper — Bundesvergaben, Empfänger & Aggregate](https://proooxy.com/de/tools/usaspending-scraper/) Die offizielle USAspending.gov-API v2 nach Bundesverträgen, -zuschüssen und -darlehen durchsuchen. Filterbar nach Behörde, Empfänger, NAICS/PSC oder Datum; Empfängerprofile, Kategorie-Summen und geografische Aggregate nach Bundesstaat/County/Distrikt abrufen. Kein API-Key. - Märkte: USA - Stack: TypeScript, REST API - Apify: https://apify.com/autofacts/usaspending-scraper ### [YouTube-Untertitel- & Transkript-Scraper — JSON, SRT, VTT, LLM](https://proooxy.com/de/tools/youtube-transcript-scraper/) YouTube-Untertitel und -Transkripte aus Videos, Shorts, Playlists und Kanälen extrahieren — als JSON, SRT, VTT, Klartext oder sauberen LLM-fertigen Text. Über 100 Sprachen, umfangreiche Metadaten, kein API-Key — und fehlgeschlagene Extraktionen sind kostenlos. - Märkte: Weltweit - Stack: TypeScript - Apify: https://apify.com/autofacts/youtube-subtitle-transcript-scraper ### [Sephora Scraper (Weltweit)](https://proooxy.com/de/tools/sephora-scraper/) Apify-Actor, der vollständige Sephora-Produktdaten extrahiert — Varianten, Preise, Bilder, Inhaltsstoffe und Rezensionen — aus Sephora-Storefronts in den USA, Kanada, 9 EU-Märkten, 6 Nahost-Märkten, Großbritannien, Indien und 10 Asien-Pazifik-Märkten, in einem einzigen normalisierten Schema. - Märkte: USA, Kanada, Frankreich, Italien, Deutschland, Spanien, Polen, Tschechien, Griechenland, Rumänien, Portugal, Vereinigte Arabische Emirate, Saudi-Arabien, Bahrain, Oman, Kuwait, Katar, Großbritannien, Indien, Neuseeland, Australien, Singapur, Malaysia, Thailand, Indonesien, Philippinen, Hongkong, Taiwan, Brunei - Stack: Python, Crawlee - Apify: https://apify.com/autofacts/sephora ### [Boohoo Scraper — Produktdaten aus 7 Regionen](https://proooxy.com/de/tools/boohoo-scraper/) Produktdaten von Boohoo-E-Commerce-Seiten aus 7 Regionen extrahieren — mit automatischer Paginierung, Facettenfilterung und Multi-Währungs-Unterstützung. - Märkte: Niederlande, Schweden, Großbritannien, Irland, Frankreich, Australien, USA - Stack: TypeScript, Cheerio - Apify: https://apify.com/autofacts/boohoo-scraper ### [Farfetch Scraper — Luxusmode-Produktdaten](https://proooxy.com/de/tools/farfetch-scraper/) Produktdaten aus dem Luxusmode-Segment von Farfetch extrahieren — inklusive Multi-Währungs-Preisen, Größen-/Passform-Varianten und Produktempfehlungen. - Märkte: Weltweit - Stack: TypeScript, Cheerio, Crawlee - Apify: https://apify.com/autofacts/farfetch ### [Lululemon Scraper — Produkte, Varianten & Preise](https://proooxy.com/de/tools/lululemon-scraper/) Produktdetails von Lululemon crawlen und extrahieren — inklusive Variantendaten, Farboptionen, Mediengalerien und Preisinformationen. - Märkte: USA - Stack: TypeScript, Crawlee - Apify: https://apify.com/autofacts/lululemon-scraper ### [Schema Markup Scraper & SEO-Auditor](https://proooxy.com/de/tools/schema-markup-scraper/) JSON-LD, Microdata, RDFa, Open Graph und Twitter Cards von jeder URL extrahieren — mit einem umfassenden SEO-Audit-Scoring-System. - Märkte: Weltweit - Stack: TypeScript, Crawlee - Apify: https://apify.com/autofacts/metadata-scraper ### [Shopify Scraper — Produktdaten aus jedem Shop](https://proooxy.com/de/tools/shopify-scraper/) Professionelles Tool zur Extraktion hochpräziser Produktdaten aus jedem Shopify-Shop — inklusive Collections, Suche und Produktempfehlungen. - Märkte: Weltweit - Stack: TypeScript, Cheerio - Apify: https://apify.com/autofacts/shopify ### [Ulta Beauty Scraper — Produkte, Preise & SKUs](https://proooxy.com/de/tools/ulta-scraper/) Produktdetails, Preise, Bilder und SKU-Informationen von Ulta Beauty extrahieren — inklusive Kategorieseiten, Markenseiten und Sale-Bereichen. - Märkte: USA - Stack: TypeScript, Crawlee - Apify: https://apify.com/autofacts/ulta-scraper ### [Universal Web Printer — URL & HTML zu PDF, Bild](https://proooxy.com/de/tools/web-printer/) Jede URL oder jedes HTML in PDF, PNG, JPEG oder WebP umwandeln — mit intelligentem Scroll-Stitching, Element-Extraktion, PDF-Verschlüsselung und Wasserzeichen. - Märkte: Weltweit - Stack: TypeScript, Playwright, PDF-lib, Sharp - Apify: https://apify.com/autofacts/universal-web-printer ## Blog - [Web-Scraping Best Practices 2026: Ein Leitfaden aus der Praxis](https://proooxy.com/de/blog/web-scraping-best-practices-2026/) — Praxiserprobte Web-Scraping-Strategien aus dem laufenden Betrieb produktionsreifer Scraper — Architekturmuster, Fehlerbehandlung, Proxy-Management und Output-Normalisierung. - [Anti-Bot-Schutz verstehen: Was 2026 funktioniert](https://proooxy.com/de/blog/bypassing-anti-bot-protection-guide/) — Ein technischer Deep-Dive in moderne Anti-Bot-Systeme — Cloudflare, Akamai, Datadome — und die legitimen Bypass-Techniken, die im produktiven Scraping eingesetzt werden. ## Sitemap - [Über Richard Feng](https://proooxy.com/de/about/) — Hintergrund, Expertise, Leistungen - [Kontakt](https://proooxy.com/de/contact/) — für individuelle Scraper- / DaaS-Projekte - [Apify Store](https://apify.com/autofacts) — jedes Tool kostenlos testen - [GitHub](https://github.com/autofacts) — Quellcode für ausgewählte Projekte - [Vollständiger Inhalt als Klartext](https://proooxy.com/de/llms-full.txt) — alle Seiten aneinandergereiht für KI-Kontextfenster