~/utility/schema-markup-scraper
Scraper de Schema Markup y auditor SEO
Extrae JSON-LD, Microdata, RDFa, Open Graph y Twitter Cards de cualquier URL, con un sistema de puntuación de auditoría SEO integral.
SEO
TypeScriptCrawlee
Global
categoríautility / SEO
lenguajeTypeScript
stackTypeScript, Crawlee
mercadosGlobal
salidaJSON limpio y listo para RAG
características clave
Extracción de datos estructurados — JSON-LD, Microdata y RDFa
Metaetiquetas sociales — Open Graph, Twitter Cards, Dublin Core
Análisis SEO con puntuación de 0 a 100
Validación de URL canónica y hreflang
Extracción de autor para señales EEAT
Detección de LocalBusiness con más de 80 subtipos
Auditoría de texto alternativo de imágenes
Validación de schema de breadcrumbs
Extracción de etiquetas geo y NAP
casos de uso
- Auditoría técnica de SEO a gran escala
- Validación de datos estructurados para sitios web
- Análisis SEO competitivo — compara el schema markup entre competidores
- Evaluación de señales EEAT para sitios de contenido
- Auditoría de SEO local para negocios
- Validación de checklist SEO previo al lanzamiento
parámetros de entrada
| Parámetro | Tipo | Obligatorio | Descripción |
|---|---|---|---|
startUrls | array | obligatorio | URLs a analizar |
proxy | object | opcional | Configuración de proxy |
maxRequestsPerCrawl | number | opcional | Limita el total de URLs a auditar |
maxConcurrency | number | opcional | Solicitudes en paralelo |
extractMetaTags | boolean | opcional | Extrae metaetiquetas (por defecto: true) |
extractSeoAnalysis | boolean | opcional | Ejecuta el análisis SEO (por defecto: true) |
computeSeoScore | boolean | opcional | Calcula la puntuación SEO de 0 a 100 (por defecto: true) |
extractGeoData | boolean | opcional | Extrae etiquetas geo y datos NAP |
Ejemplo de salida
1{
2 "url": "https://developers.google.com/search/docs/appearance/structured-data/product",
3 "title": "Intro to Product Structured Data on Google | Google Search Central",
4 "linkedData": [
5 {
6 "@context": "https://schema.org",
7 "@type": "BreadcrumbList",
8 "itemListElement": [
9 { "@type": "ListItem", "position": 1, "name": "Search Central", "item": "https://developers.google.com/search" }
10 ]
11 }
12 ],
13 "openGraph": {
14 "site_name": "Google for Developers",
15 "type": "website"
16 },
17 "twitterCard": {
18 "card": "summary_large_image",
19 "has_large_image": "true"
20 },
21 "seoAudit": {
22 "score": 95,
23 "issues": [
24 { "severity": "warning", "code": "TITLE_TOO_LONG", "message": "Title is 122 chars (recommended: max 60)" }
25 ]
26 },
27 "headings": {
28 "headings": [
29 { "level": 1, "text": "Introduction to Product structured data" },
30 { "level": 2, "text": "Deciding which markup to use" }
31 ],
32 "h1Count": 1,
33 "issues": []
34 }
35}
faq
¿Qué formatos de datos estructurados son compatibles?
JSON-LD, Microdata y RDFa. El scraper también extrae metadatos de Open Graph, Twitter Cards y Dublin Core.
¿Cómo se calcula la puntuación SEO?
La puntuación de 0 a 100 evalúa las etiquetas title, las meta descriptions, la jerarquía de encabezados, el texto alternativo de imágenes, las URLs canónicas, el viewport móvil, la presencia de datos estructurados y más.
¿Puedo auditar varias páginas a la vez?
Sí, proporciona varias URLs en startUrls. El scraper las procesa en paralelo para una auditoría masiva rápida.
relacionado en ~/utility
medios
Universal Web Printer — URL y HTML a PDF, imagen
Convierte URLs y HTML a PDF, PNG, JPEG o WebP.
abrir