Marcado Semántico Avanzado (Schema) para LLMs

Yendo más allá del SEO tradicional: cómo el uso profundo e interconectado de Schema.org ayuda a los LLMs a desambiguar las entidades de tu sitio.

Lectura ejecutiva

Conclusiones principales

  • Usa la propiedad 'sameAs' agresivamente para vincular tu sitio a tus entidades en Wikipedia, Wikidata y redes sociales oficiales.
  • Crea un grafo de entidades conectadas (@id) en lugar de múltiples fragmentos JSON-LD sueltos.
  • Modelos como ChatGPT utilizan datos estructurados para llenar vacíos de conocimiento y garantizar la factualidad (grounding).
  • Define claramente la 'MainEntity' de la página para dirigir la atención del algoritmo.

Durante mucho tiempo, el incentivo para añadir el marcado de datos estructurados (Schema.org) al código de un sitio fue puramente estético: conseguir las deseadas estrellas de valoración en los resultados de Google o mostrar una receta destacada. Con el auge de la Inteligencia Artificial Generativa y los Modelos de Lenguaje Grande (LLMs), el marcado semántico vuelve a ser el corazón técnico del SEO.

LLMs, Ambigüedad y el "Grounding"

Los LLMs se basan en las probabilidades de que las palabras (tokens) aparezcan juntas. Por muy inteligentes que parezcan, no "entienden" el mundo real y son susceptibles a las alucinaciones: confundiendo, por ejemplo, "Apple" (la empresa de tecnología) con "Apple" (la discográfica de los Beatles).

El proceso de Grounding (anclaje en hechos reales) es cómo los motores de IA intentan resolver esto durante una búsqueda. Aquí es donde entran los datos estructurados en JSON-LD. Al proporcionar un grafo explícito que define quién eres, la IA no tiene que "adivinar" basándose en el texto. Consume los datos directos.

Conectando los puntos con @id y el Grafo Semántico

En lugar de lanzar múltiples bloques JSON-LD sueltos en el <head>, la estructura ideal en la era de la IA es un grafo conectado.

Utiliza el atributo @id para referenciar entidades a lo largo de todo el documento. Si el artículo fue escrito por "Juan", define la entidad Person con un ID y vincúlala a la propiedad author del Article.

{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@type": "Person",
      "@id": "https://misitio.es/sobre#juan",
      "name": "Juan García",
      "sameAs": ["https://www.linkedin.com/in/juangarcia", "https://www.wikidata.org/wiki/Q12345"]
    },
    {
      "@type": "Article",
      "headline": "El Futuro de la Inteligencia Artificial",
      "author": { "@id": "https://misitio.es/sobre#juan" }
    }
  ]
}

La Propiedad sameAs como Desambiguador Universal

La propiedad sameAs es quizás la herramienta de SEO técnico más subestimada en el contexto de la IA. Permite decirle al LLM: "Esta entidad que estoy describiendo aquí es exactamente la misma entidad que la de esa página en Wikipedia o Wikidata".

Dado que los LLMs tienen un peso de entrenamiento masivo en Wikipedia, establecer esta conexión transfiere la autoridad y el conocimiento semántico de la base de datos global directamente a tu entidad propietaria.

Propiedades críticas para el Contenido y la IA

Para páginas de artículos, tutoriales y análisis (donde el GEO - Generative Engine Optimization actúa con fuerza), refuerza las siguientes propiedades:

  • mainEntity: Define explícitamente cuál es la cosa principal (Producto, Evento, Concepto) de la que trata la página.
  • about: Enumera los temas centrales (entidades) del texto.
  • mentions: Enumera los conceptos secundarios que se mencionan.
  • citation: Crucial para demostrar la veracidad de tu contenido a la IA; conecta enlaces a estudios, informes o autores de renombre.

Ejemplo de hallazgo y acción

Observación: Un sitio de software financiero notó que motores como Perplexity y Google AI Overviews los confundían a menudo con una compañía de seguros del mismo nombre, recomendando los servicios equivocados a los usuarios en las respuestas generadas. Acción: Refactorizar el JSON-LD de la página de inicio y de la página "Acerca de". Implementar un esquema Organization completo con enlaces agresivos vía sameAs apuntando a los perfiles verificados de Crunchbase, LinkedIn y la página corporativa en la B3, además de rellenar la propiedad knowsAbout con las palabras clave financieras adecuadas. Aceptación: El modelo de datos estructurados fuerza la desambiguación; los agentes de búsqueda comenzaron a anclar la entidad correcta en las respuestas, separando claramente la empresa de software de la aseguradora.

La IA piensa en entidades (cosas), no en cadenas (textos sueltos). Hablar el lenguaje matemático de las entidades a través de un marcado semántico profundo es el atajo más eficiente para ser comprendido y recomendado en el nuevo panorama de las búsquedas.

Respuestas directas

Preguntas frecuentes

¿Los LLMs como GPT y Claude leen Schema.org?

Sí. Al acceder a la web (ya sea en la fase de entrenamiento o en búsquedas en tiempo real), los parsers extraen bloques JSON-LD porque ofrecen relaciones lógicas claras, libres de las ambigüedades del lenguaje natural.

¿Cuál es la diferencia entre usar Schema para SEO y para LLMs?

En el SEO clásico, el enfoque era validar tipos específicos (como FAQ o Receta) para ganar insignias visuales. Para los LLMs, el enfoque es construir la ontología completa de la página: usar 'about', 'mentions' y conectar entidades de forma sistémica.

¿Sigue siendo el formato JSON-LD el recomendado?

Totalmente. JSON-LD sigue siendo el estándar oficial de Google y el formato más sencillo para que los rastreadores y parsers de IA lo extraigan sin tener que procesar todo el árbol DOM.