Conjuntos de datos y fuentes de datos: de dónde obtienen los LLM su conocimiento sobre las marcas

Los LLM como ChatGPT, Claude y Gemini no se entrenan únicamente con tu sitio web: se entrenan con billones de palabras procedentes de cientos de fuentes distintas. Si quieres comprender por qué la IA menciona o ignora a tu marca, necesitas entender qué conjuntos de datos dan forma a estos sistemas. Esta guía te ofrece una visión general de dónde obtienen sus conocimientos los LLM, cómo puedes influir en estas fuentes y a cuáles deberías dar prioridad.

Conjuntos de datos y fuentes de datos: de dónde obtienen los LLM su conocimiento sobre las marcas

Publicado el

Autor

Jakob Langemark

Síguenos

Conjuntos de datos y fuentes de datos: dónde obtienen los LLM su conocimiento sobre las marcas

Los LLM como ChatGPT, Claude y Gemini no se entrenan únicamente con tu sitio web; se entrenan con billones de palabras procedentes de cientos de fuentes diferentes. Si quieres entender por qué la IA menciona o ignora tu marca, necesitas comprender qué conjuntos de datos dan forma a estos sistemas. Esta guía te ofrece una visión general de dónde obtienen los LLM su conocimiento, cómo puedes influir en estas fuentes y cuáles debes priorizar.

Cómo aprenden los LLM sobre las marcas

El entrenamiento de los LLM se realiza en varias fases:

1. Preentrenamiento (la base)

El modelo se entrena con enormes corpus de texto para aprender la estructura del lenguaje y conocimientos generales.

Conjuntos de datos principales:

  • Common Crawl: rastreo de toda la web (billones de páginas)

  • Wikipedia: conocimiento estructurado y de autoridad

  • Corpus de libros: millones de libros digitales

  • Reddit: debates impulsados por la comunidad

  • Archivos de noticias: artículos de noticias históricos

  • Artículos científicos: conocimiento académico

Lo que esto significa para tu marca: si tu marca no se menciona en estas fuentes durante el preentrenamiento, el modelo no sabrá nada de ti desde el principio.

2. Ajuste fino (refinamiento)

Tras el preentrenamiento, el modelo se ajusta con datos de alta calidad específicamente seleccionados.

Fuentes:

  • Texto seleccionado de fuentes confiables

  • Contenido escrito por expertos

  • Bases de datos estructuradas

3. RLHF (aprendizaje por refuerzo a partir del feedback humano)

El modelo aprende a ofrecer respuestas útiles y seguras basándose en los comentarios de los usuarios.

Esto no afecta directamente al conocimiento de la marca, pero:

  • El modelo aprende a citar fuentes

  • Aprende a reconocer la incertidumbre

  • Aprende a priorizar la información de autoridad

4. Recuperación en tiempo real (para algunos sistemas)

Algunos sistemas de IA (como Perplexity y la navegación web de ChatGPT) realizan rastreos en vivo para complementar sus conocimientos.

Fuentes:

  • Tu sitio web (si permite el rastreo)

  • Sitios de noticias

  • Redes sociales

Las fuentes de datos más importantes para el conocimiento de la marca

1. Common Crawl

Qué es: un proyecto sin fines de lucro que rastrea mensualmente miles de millones de páginas web y ofrece los datos de forma gratuita.

Por qué es importante:

  • Muchos modelos de IA (incluido GPT) se entrenan con Common Crawl

  • Si tu sitio no está aquí, serás invisible para muchos LLM

¿Está tu sitio en Common Crawl?

Compruébalo aquí: https://index.commoncrawl.org/

# Comprueba si tu dominio está en Common Crawl
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=yourwebsite.com&output=json" | head -5
# Comprueba si tu dominio está en Common Crawl
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=yourwebsite.com&output=json" | head -5
# Comprueba si tu dominio está en Common Crawl
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=yourwebsite.com&output=json" | head -5

Cómo entrar:

  • Permite CCBot en el archivo robots.txt

  • Asegúrate de que tu sitio web permita el rastreo

  • Espera: Common Crawl realiza rastreos periódicos de forma automática

2. Wikipedia

Por qué es oro: Wikipedia es una de las fuentes de mayor autoridad en las que confían los LLM. Si tu marca tiene una página en Wikipedia, los LLM la citarán como un hecho.

Cómo influir:

  • Crea una página de Wikipedia (si cumples con los criterios de relevancia)

  • Asegúrate de que las páginas existentes sean precisas y estén actualizadas

  • Añade fuentes y referencias

Criterios de relevancia de Wikipedia:

  • Cobertura mediática significativa en fuentes confiables

  • Fuentes independientes (no relaciones públicas ni marketing propio)

  • Múltiples artículos detallados

Si no puedes conseguir una página de Wikipedia: céntrate en aparecer mencionado en artículos relevantes ya existentes en Wikipedia (por ejemplo, artículos del sector, páginas geográficas o páginas de competidores con secciones de "Ver también").

3. Crunchbase

Qué es: base de datos de empresas, financiación y ecosistemas tecnológicos.

Por qué es importante: los LLM utilizan Crunchbase para entender:

  • A qué se dedica tu empresa

  • Quiénes son tus competidores

  • Fase de financiación y tamaño

Optimiza tu perfil de Crunchbase:

  1. Reclama tu perfil de Crunchbase

  2. Completa todos los campos:

    • Descripción (específicamente a qué te dedicas)

    • Categorías (elige etiquetas relevantes)

    • Información de financiación

    • Enlace al sitio web

  3. Manténlo actualizado con las rondas de financiación o lanzamientos de productos

4. LinkedIn

Por qué es importante: los LLM utilizan LinkedIn para entender:

  • Tamaño de la empresa y empleados

  • Sector y áreas de enfoque

  • Posicionamiento de marca

Optimiza tu página de empresa en LinkedIn:

  • Sección Información: descripción clara de lo que haces

  • Especialidades: etiqueta palabras clave relevantes

  • Actualizaciones: publicaciones periódicas sobre novedades de productos, contrataciones y liderazgo de opinión

  • Perfiles de empleados: los perfiles de los empleados se conectan con la página de la empresa

5. Cobertura en noticias y medios de comunicación

Por qué es importante: los LLM valoran más las marcas con cobertura en medios de comunicación que el contenido autoeditado.

Prioriza:

  • Medios de primer nivel (Tier 1): TechCrunch, Wired, Wall Street Journal, Financial Times

  • Publicaciones del sector: revistas profesionales relevantes

  • Noticias regionales: medios de comunicación de negocios locales

Cómo conseguir cobertura:

  • Notas de prensa en lanzamientos de productos

  • Artículos de liderazgo de opinión (artículos de invitados)

  • Opinar sobre temas de actualidad

  • Premios y reconocimientos

6. GitHub (para marcas tecnológicas)

Por qué es importante: muchos LLM se entrenan con código de código abierto de GitHub.

Si tienes proyectos de código abierto:

  • Actualiza el archivo README con una descripción clara

  • Añade la sección "About" al repositorio

  • Enlaza al sitio web de tu empresa

  • Incluye casos de uso y ejemplos

7. Redes sociales

Twitter/X:

  • Los tweets públicos son rastreados por algunos LLM

  • Liderazgo de opinión e imagen de marca

Reddit:

  • Debates de la comunidad en torno a las marcas

  • Experiencias de usuario auténticas

YouTube:

  • Se rastrean las transcripciones

  • Demostraciones de productos y tutoriales

8. Artículos académicos e investigación

Si tu marca está orientada a la tecnología o la investigación:

  • Publica informes técnicos (whitepapers)

  • Patrocina investigación académica

  • Contribuye en conferencias

Súbelos a:

Cómo priorizar tus esfuerzos

Nivel 1: Imprescindible (mayor impacto)

  1. Tu propio sitio web: con robots.txt, JSON-LD y mapa del sitio correctos

  2. Wikipedia: si cumples los requisitos

  3. Crunchbase: para marcas tecnológicas

  4. LinkedIn: página de empresa optimizada

Nivel 2: Fuerte retorno de la inversión (ROI)

  1. Cobertura de noticias: medios de primer nivel y publicaciones del sector

  2. Common Crawl: asegúrate de que tu sitio web permita el rastreo

  3. GitHub: para marcas de código abierto

  4. Directorios del sector: directorios de nicho relevantes

Nivel 3: Valor a largo plazo

  1. Reddit: participación comunitaria auténtica

  2. YouTube: contenido de video con transcripciones

  3. Podcasts: apariciones como invitado (con transcripciones)

  4. Foros: Stack Overflow, Hacker News, comunidades de nicho

Cómo verificar que estás en los conjuntos de datos

Comprobar Common Crawl

curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=yourwebsite.com&output=json"
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=yourwebsite.com&output=json"
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=yourwebsite.com&output=json"

Comprobar Wikipedia

Busca el nombre de tu marca en https://es.wikipedia.org/wiki/Especial:Buscar.

Comprobar Crunchbase

Visita https://www.crunchbase.com/organization/YOUR-COMPANY

Comprobar la cobertura de noticias

# Búsqueda en Google News
https://news.google.com/search?q="Your Brand Name"
# Búsqueda en Google News
https://news.google.com/search?q="Your Brand Name"
# Búsqueda en Google News
https://news.google.com/search?q="Your Brand Name"

Comprobar GitHub

Busca en https://github.com/search?q=YOUR-BRAND

Lista de verificación de implementación

Utiliza esta lista de verificación para asegurar tu presencia en conjuntos de datos importantes:

  1. Sitio web optimizado: robots.txt, mapa del sitio, JSON-LD

  2. Common Crawl: permitir CCBot

  3. Presencia en Wikipedia: crear o actualizar la página (si cumples los requisitos)

  4. Perfil de Crunchbase: reclamado y actualizado

  5. Página de empresa de LinkedIn: perfil completo

  6. Cobertura de noticias: mínimo de 3 a 5 menciones en medios relevantes

  7. Repositorios de GitHub: si es una marca tecnológica, archivo README claro

  8. Presencia social: activo en al menos 2 plataformas

  9. Directorios del sector: presencia en directorios relevantes

  10. Distribución de contenido: distribuir contenido en Medium, artículos de LinkedIn

Conclusión

Los LLM aprenden sobre tu marca a través de cientos de fuentes, no solo de tu sitio web. Para lograr la máxima visibilidad en la IA, debes asegurarte de estar presente en los conjuntos de datos que más importan: Common Crawl (a través de tu sitio web), Wikipedia (si cumples los requisitos), Crunchbase, LinkedIn y la cobertura de noticias.

Prioriza Wikipedia y la cobertura de noticias; tienen un peso desproporcionado en la forma en que los LLM evalúan la autoridad. A continuación, céntrate en hacer que tu propio sitio web sea perfectamente rastreable y esté estructurado con JSON-LD.

Recuerda: los conjuntos de datos no se aktualizan en tiempo real. Pueden pasar meses desde que publicas un contenido hasta que se refleja en las respuestas de los LLM. Empieza ahora y construye sistemáticamente tu presencia en las fuentes en las que confían los sistemas de IA.