Conjuntos de datos y fuentes de datos: de dónde obtienen los LLM su conocimiento sobre las marcas

Los LLM como ChatGPT, Claude y Gemini no se entrenan únicamente con tu sitio web: se entrenan con billones de palabras procedentes de cientos de fuentes distintas. Si quieres comprender por qué la IA menciona o ignora a tu marca, necesitas entender qué conjuntos de datos dan forma a estos sistemas. Esta guía te ofrece una visión general de dónde obtienen sus conocimientos los LLM, cómo puedes influir en estas fuentes y a cuáles deberías dar prioridad.

Conjuntos de datos y fuentes de datos: de dónde obtienen los LLM su conocimiento sobre las marcas

Publicado el

Autor

Jakob Langemark

Síguenos

Conjuntos de datos y fuentes de información — Dónde obtienen los LLM sus conocimientos sobre las marcas

Los LLM como ChatGPT, Claude y Gemini no se entrenan únicamente con tu sitio web; se entrenan con billones de palabras procedentes de cientos de fuentes diferentes. Si quieres entender por qué la IA menciona o ignora tu marca, necesitas comprender qué conjuntos de datos dan forma a estos sistemas. Esta guía te ofrece una visión general de dónde obtienen los LLM sus conocimientos, cómo puedes influir en estas fuentes y a cuáles debes dar prioridad.

Cómo aprenden los LLM sobre las marcas

El entrenamiento de los LLM se realiza en varias fases:

1. Preentrenamiento (la base)

El modelo se entrena con corpus de texto masivos para aprender la estructura del lenguaje y conocimientos generales.

Conjuntos de datos principales:

  • Common Crawl — Rastreo de toda la web (billones de páginas)

  • Wikipedia — Conocimiento estructurado y de autoridad

  • Corpus de libros — Millones de libros digitales

  • Reddit — Debates impulsados por la comunidad

  • Archivos de noticias — Artículos de noticias históricos

  • Artículos científicos — Conocimiento académico

Qué significa esto para tu marca: si tu marca no se menciona en estas fuentes durante el preentrenamiento, el modelo no sabrá nada de ti desde el principio.

2. Ajuste fino (refinamiento)

Tras el preentrenamiento, el modelo se ajusta con datos de alta calidad específicamente seleccionados.

Fuentes:

  • Texto curado de fuentes de confianza

  • Contenido escrito por expertos

  • Bases de datos estructuradas

3. RLHF (Aprendizaje por refuerzo a partir del feedback humano)

El modelo aprende a dar respuestas útiles y seguras basándose en los comentarios de los usuarios.

Esto no afecta directamente al conocimiento de la marca, pero:

  • El modelo aprende a citar fuentes

  • Aprende a reconocer la incertidumbre

  • Aprende a priorizar la información de autoridad

4. Recuperación en tiempo real (para algunos sistemas)

Algunos sistemas de IA (como Perplexity y la navegación web de ChatGPT) rastrean la web en directo para complementar sus conocimientos.

Fuentes:

  • Tu sitio web (si es rastreable)

  • Sitios de noticias

  • Redes sociales

Las fuentes de datos más importantes para el conocimiento de la marca

1. Common Crawl

Qué es: un proyecto sin fines de lucro que rastrea mensualmente miles de millones de páginas web y ofrece los datos de forma gratuita.

Por qué es importante:

  • Muchos modelos de IA (incluido GPT) se entrenan con Common Crawl

  • Si tu sitio no está aquí, serás invisible para muchos LLM

¿Está tu sitio en Common Crawl?

Compruébalo aquí: https://index.commoncrawl.org/

# Comprueba si tu dominio está en Common Crawl
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=tuweb.com&output=json" | head -5
# Comprueba si tu dominio está en Common Crawl
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=tuweb.com&output=json" | head -5
# Comprueba si tu dominio está en Common Crawl
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=tuweb.com&output=json" | head -5

Cómo entrar:

  • Permite el bot CCBot en tu archivo robots.txt

  • Asegúrate de que tu sitio es rastreable

  • Espera — Common Crawl realiza rastreos periódicos automáticamente

2. Wikipedia

Por qué es oro: Wikipedia es una de las fuentes de mayor autoridad en las que confían los LLM. Si tu marca tiene una página en Wikipedia, los LLM la citarán como un hecho.

Cómo influir:

  • Crea una página en Wikipedia (si cumples los criterios de relevancia)

  • Asegúrate de que las páginas existentes sean precisas y estén actualizadas

  • Añade fuentes y referencias

Criterios de relevancia de Wikipedia:

  • Cobertura mediática significativa en fuentes de confianza

  • Fuentes independientes (no relaciones públicas ni marketing propio)

  • Varios artículos detallados y en profundidad

Si no puedes conseguir una página en Wikipedia: céntrate en aparecer mencionado en artículos de Wikipedia existentes que sean relevantes (por ejemplo, artículos del sector, páginas geográficas o páginas de competidores con secciones de "Véase también").

3. Crunchbase

Qué es: base de datos de empresas, financiación y ecosistemas tecnológicos.

Por qué es importante: los LLM utilizan Crunchbase para entender:

  • A qué se dedica tu empresa

  • Quiénes son tus competidores

  • La fase de financiación y el tamaño

Optimiza tu perfil de Crunchbase:

  1. Reclama tu perfil de Crunchbase

  2. Completa todos los campos:

    • Descripción (específicamente a qué te dedicas)

    • Categorías (elige etiquetas relevantes)

    • Información de financiación

    • Enlace a tu sitio web

  3. Manténlo actualizado con cada ronda de financiación o lanzamiento de producto

4. LinkedIn

Por qué es importante: los LLM utilizan LinkedIn para entender:

  • El tamaño de la empresa y los empleados

  • El sector y las áreas de enfoque

  • El posicionamiento de la marca

Optimiza la página de empresa de tu negocio en LinkedIn:

  • Sección Información: descripción clara de lo que haces

  • Especialidades: etiqueta palabras clave relevantes

  • Publicaciones: publicaciones periódicas sobre novedades de productos, contrataciones y liderazgo de opinión

  • Perfiles de empleados: los perfiles de los empleados se conectan con la página de la empresa

5. Cobertura en noticias y medios de comunicación

Por qué es importante: los LLM valoran más las marcas con cobertura mediática que el contenido autopublicado.

Prioriza:

  • Medios de primer nivel: TechCrunch, Wired, Wall Street Journal, Financial Times

  • Publicaciones del sector: revistas especializadas de relevancia

  • Noticias regionales: medios de comunicación locales de negocios

Cómo conseguir cobertura:

  • Notas de prensa en lanzamientos de productos

  • Artículos de liderazgo de opinión (artículos de invitados)

  • Opinar sobre temas de actualidad

  • Premios y reconocimientos

6. GitHub (para marcas tecnológicas)

Por qué es importante: muchos LLM se entrenan con código de código abierto de GitHub.

Si tienes proyectos de código abierto:

  • Actualiza el archivo README con una descripción clara

  • Añade la sección "About" a tu repositorio

  • Enlaza al sitio web de tu empresa

  • Incluye casos de uso y ejemplos

7. Redes sociales

Twitter/X:

  • Algunos LLM rastrean las publicaciones públicas

  • Liderazgo de opinión y branding

Reddit:

  • Debates de la comunidad en torno a las marcas

  • Experiencias auténticas de los usuarios

YouTube:

  • Se rastrean las transcripciones

  • Demostraciones de productos y tutoriales

8. Artículos académicos e investigación

Si tu marca es tecnológica o está orientada a la investigación:

  • Publica libros blancos (whitepapers)

  • Patrocina investigación académica

  • Contribuye en conferencias

Súbelos a:

Cómo priorizar tus esfuerzos

Nivel 1: Imprescindibles (mayor impacto)

  1. Tu propio sitio web — Con un robots.txt correcto, JSON-LD y mapa del sitio (sitemap)

  2. Wikipedia — Si cumples los requisitos

  3. Crunchbase — Para marcas tecnológicas

  4. LinkedIn — Página de empresa optimizada

Nivel 2: Fuerte ROI

  1. Cobertura de noticias — Medios de primer nivel y publicaciones del sector

  2. Common Crawl — Asegúrate de que tu sitio es rastreable

  3. GitHub — Para marcas de código abierto

  4. Directorios del sector — Directorios especializados en nichos relevantes

Nivel 3: Valor a largo plazo

  1. Reddit — Interacción auténtica de la comunidad

  2. YouTube — Contenido de vídeo con transcripciones

  3. Podcasts — Participación como invitado (con transcripciones)

  4. Foros — Stack Overflow, Hacker News, comunidades de nicho

Cómo verificar si estás en los conjuntos de datos

Comprobar Common Crawl

curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=tuweb.com&output=json"
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=tuweb.com&output=json"
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=tuweb.com&output=json"

Comprobar Wikipedia

Busca el nombre de tu marca en https://es.wikipedia.org/wiki/Especial:Buscar.

Comprobar Crunchbase

Visita https://www.crunchbase.com/organization/TU-EMPRESA

Comprobar la cobertura de noticias

# Búsqueda en Google News
https://news.google.com/search?q="Nombre De Tu Marca"
# Búsqueda en Google News
https://news.google.com/search?q="Nombre De Tu Marca"
# Búsqueda en Google News
https://news.google.com/search?q="Nombre De Tu Marca"

Comprobar GitHub

Busca en https://github.com/search?q=TU-MARCA

Lista de verificación para la implementación

Usa esta lista para asegurar tu presencia en los conjuntos de datos importantes:

  1. Sitio web optimizado — robots.txt, sitemap, JSON-LD

  2. Common Crawl — Permitir CCBot

  3. Presencia en Wikipedia — Crear o actualizar la página (si cumples los requisitos)

  4. Perfil de Crunchbase — Reclamado y actualizado

  5. Página de empresa en LinkedIn — Perfil completo

  6. Cobertura de noticias — Mínimo 3-5 menciones en medios relevantes

  7. Repositorios de GitHub — Si eres una marca tecnológica, un README claro

  8. Presencia social — Activo en al menos 2 plataformas

  9. Directorios del sector — Aparecer en directorios relevantes

  10. Distribución de contenido — Sindicación de contenido en Medium, artículos de LinkedIn

Conclusión

Los LLM conocen tu marca a través de cientos de fuentes, no solo de tu sitio web. Para lograr la máxima visibilidad en la IA, debes asegurar tu presencia en los conjuntos de datos que más importan: Common Crawl (a través de tu sitio web), Wikipedia (si cumples los requisitos), Crunchbase, LinkedIn y la cobertura mediática.

Prioriza Wikipedia y la cobertura de noticias; tienen un peso desproporcionado en la forma en que los LLM evalúan la autoridad. A continuación, céntrate en hacer que tu propio sitio web sea perfectamente rastreable y esté estructurado con JSON-LD.

Recuerda: los conjuntos de datos no se actualizan en tiempo real. Pueden pasar meses desde que publicas un contenido hasta que se refleja en las respuestas de los LLM. Empieza ahora y construye de forma sistemática tu presencia en las fuentes en las que confían los sistemas de IA.