Conjuntos de datos y fuentes de datos: de dónde obtienen los LLM su conocimiento sobre las marcas
Los LLM como ChatGPT, Claude y Gemini no se entrenan únicamente con tu sitio web: se entrenan con billones de palabras procedentes de cientos de fuentes distintas. Si quieres comprender por qué la IA menciona o ignora a tu marca, necesitas entender qué conjuntos de datos dan forma a estos sistemas. Esta guía te ofrece una visión general de dónde obtienen sus conocimientos los LLM, cómo puedes influir en estas fuentes y a cuáles deberías dar prioridad.

Conjuntos de datos y fuentes de información — Dónde obtienen los LLM sus conocimientos sobre las marcas
Los LLM como ChatGPT, Claude y Gemini no se entrenan únicamente con tu sitio web; se entrenan con billones de palabras procedentes de cientos de fuentes diferentes. Si quieres entender por qué la IA menciona o ignora tu marca, necesitas comprender qué conjuntos de datos dan forma a estos sistemas. Esta guía te ofrece una visión general de dónde obtienen los LLM sus conocimientos, cómo puedes influir en estas fuentes y a cuáles debes dar prioridad.
Cómo aprenden los LLM sobre las marcas
El entrenamiento de los LLM se realiza en varias fases:
1. Preentrenamiento (la base)
El modelo se entrena con corpus de texto masivos para aprender la estructura del lenguaje y conocimientos generales.
Conjuntos de datos principales:
Common Crawl — Rastreo de toda la web (billones de páginas)
Wikipedia — Conocimiento estructurado y de autoridad
Corpus de libros — Millones de libros digitales
Reddit — Debates impulsados por la comunidad
Archivos de noticias — Artículos de noticias históricos
Artículos científicos — Conocimiento académico
Qué significa esto para tu marca: si tu marca no se menciona en estas fuentes durante el preentrenamiento, el modelo no sabrá nada de ti desde el principio.
2. Ajuste fino (refinamiento)
Tras el preentrenamiento, el modelo se ajusta con datos de alta calidad específicamente seleccionados.
Fuentes:
Texto curado de fuentes de confianza
Contenido escrito por expertos
Bases de datos estructuradas
3. RLHF (Aprendizaje por refuerzo a partir del feedback humano)
El modelo aprende a dar respuestas útiles y seguras basándose en los comentarios de los usuarios.
Esto no afecta directamente al conocimiento de la marca, pero:
El modelo aprende a citar fuentes
Aprende a reconocer la incertidumbre
Aprende a priorizar la información de autoridad
4. Recuperación en tiempo real (para algunos sistemas)
Algunos sistemas de IA (como Perplexity y la navegación web de ChatGPT) rastrean la web en directo para complementar sus conocimientos.
Fuentes:
Tu sitio web (si es rastreable)
Sitios de noticias
Redes sociales
Las fuentes de datos más importantes para el conocimiento de la marca
1. Common Crawl
Qué es: un proyecto sin fines de lucro que rastrea mensualmente miles de millones de páginas web y ofrece los datos de forma gratuita.
Por qué es importante:
Muchos modelos de IA (incluido GPT) se entrenan con Common Crawl
Si tu sitio no está aquí, serás invisible para muchos LLM
¿Está tu sitio en Common Crawl?
Compruébalo aquí: https://index.commoncrawl.org/
Cómo entrar:
Permite el bot CCBot en tu archivo robots.txt
Asegúrate de que tu sitio es rastreable
Espera — Common Crawl realiza rastreos periódicos automáticamente
2. Wikipedia
Por qué es oro: Wikipedia es una de las fuentes de mayor autoridad en las que confían los LLM. Si tu marca tiene una página en Wikipedia, los LLM la citarán como un hecho.
Cómo influir:
Crea una página en Wikipedia (si cumples los criterios de relevancia)
Asegúrate de que las páginas existentes sean precisas y estén actualizadas
Añade fuentes y referencias
Criterios de relevancia de Wikipedia:
Cobertura mediática significativa en fuentes de confianza
Fuentes independientes (no relaciones públicas ni marketing propio)
Varios artículos detallados y en profundidad
Si no puedes conseguir una página en Wikipedia: céntrate en aparecer mencionado en artículos de Wikipedia existentes que sean relevantes (por ejemplo, artículos del sector, páginas geográficas o páginas de competidores con secciones de "Véase también").
3. Crunchbase
Qué es: base de datos de empresas, financiación y ecosistemas tecnológicos.
Por qué es importante: los LLM utilizan Crunchbase para entender:
A qué se dedica tu empresa
Quiénes son tus competidores
La fase de financiación y el tamaño
Optimiza tu perfil de Crunchbase:
Reclama tu perfil de Crunchbase
Completa todos los campos:
Descripción (específicamente a qué te dedicas)
Categorías (elige etiquetas relevantes)
Información de financiación
Enlace a tu sitio web
Manténlo actualizado con cada ronda de financiación o lanzamiento de producto
4. LinkedIn
Por qué es importante: los LLM utilizan LinkedIn para entender:
El tamaño de la empresa y los empleados
El sector y las áreas de enfoque
El posicionamiento de la marca
Optimiza la página de empresa de tu negocio en LinkedIn:
Sección Información: descripción clara de lo que haces
Especialidades: etiqueta palabras clave relevantes
Publicaciones: publicaciones periódicas sobre novedades de productos, contrataciones y liderazgo de opinión
Perfiles de empleados: los perfiles de los empleados se conectan con la página de la empresa
5. Cobertura en noticias y medios de comunicación
Por qué es importante: los LLM valoran más las marcas con cobertura mediática que el contenido autopublicado.
Prioriza:
Medios de primer nivel: TechCrunch, Wired, Wall Street Journal, Financial Times
Publicaciones del sector: revistas especializadas de relevancia
Noticias regionales: medios de comunicación locales de negocios
Cómo conseguir cobertura:
Notas de prensa en lanzamientos de productos
Artículos de liderazgo de opinión (artículos de invitados)
Opinar sobre temas de actualidad
Premios y reconocimientos
6. GitHub (para marcas tecnológicas)
Por qué es importante: muchos LLM se entrenan con código de código abierto de GitHub.
Si tienes proyectos de código abierto:
Actualiza el archivo README con una descripción clara
Añade la sección "About" a tu repositorio
Enlaza al sitio web de tu empresa
Incluye casos de uso y ejemplos
7. Redes sociales
Twitter/X:
Algunos LLM rastrean las publicaciones públicas
Liderazgo de opinión y branding
Reddit:
Debates de la comunidad en torno a las marcas
Experiencias auténticas de los usuarios
YouTube:
Se rastrean las transcripciones
Demostraciones de productos y tutoriales
8. Artículos académicos e investigación
Si tu marca es tecnológica o está orientada a la investigación:
Publica libros blancos (whitepapers)
Patrocina investigación académica
Contribuye en conferencias
Súbelos a:
arXiv.org (prepublicaciones)
Repositorios universitarios
Cómo priorizar tus esfuerzos
Nivel 1: Imprescindibles (mayor impacto)
Tu propio sitio web — Con un robots.txt correcto, JSON-LD y mapa del sitio (sitemap)
Wikipedia — Si cumples los requisitos
Crunchbase — Para marcas tecnológicas
LinkedIn — Página de empresa optimizada
Nivel 2: Fuerte ROI
Cobertura de noticias — Medios de primer nivel y publicaciones del sector
Common Crawl — Asegúrate de que tu sitio es rastreable
GitHub — Para marcas de código abierto
Directorios del sector — Directorios especializados en nichos relevantes
Nivel 3: Valor a largo plazo
Reddit — Interacción auténtica de la comunidad
YouTube — Contenido de vídeo con transcripciones
Podcasts — Participación como invitado (con transcripciones)
Foros — Stack Overflow, Hacker News, comunidades de nicho
Cómo verificar si estás en los conjuntos de datos
Comprobar Common Crawl
Comprobar Wikipedia
Busca el nombre de tu marca en https://es.wikipedia.org/wiki/Especial:Buscar.
Comprobar Crunchbase
Visita https://www.crunchbase.com/organization/TU-EMPRESA
Comprobar la cobertura de noticias
Comprobar GitHub
Busca en https://github.com/search?q=TU-MARCA
Lista de verificación para la implementación
Usa esta lista para asegurar tu presencia en los conjuntos de datos importantes:
Sitio web optimizado — robots.txt, sitemap, JSON-LD
Common Crawl — Permitir CCBot
Presencia en Wikipedia — Crear o actualizar la página (si cumples los requisitos)
Perfil de Crunchbase — Reclamado y actualizado
Página de empresa en LinkedIn — Perfil completo
Cobertura de noticias — Mínimo 3-5 menciones en medios relevantes
Repositorios de GitHub — Si eres una marca tecnológica, un README claro
Presencia social — Activo en al menos 2 plataformas
Directorios del sector — Aparecer en directorios relevantes
Distribución de contenido — Sindicación de contenido en Medium, artículos de LinkedIn
Conclusión
Los LLM conocen tu marca a través de cientos de fuentes, no solo de tu sitio web. Para lograr la máxima visibilidad en la IA, debes asegurar tu presencia en los conjuntos de datos que más importan: Common Crawl (a través de tu sitio web), Wikipedia (si cumples los requisitos), Crunchbase, LinkedIn y la cobertura mediática.
Prioriza Wikipedia y la cobertura de noticias; tienen un peso desproporcionado en la forma en que los LLM evalúan la autoridad. A continuación, céntrate en hacer que tu propio sitio web sea perfectamente rastreable y esté estructurado con JSON-LD.
Recuerda: los conjuntos de datos no se actualizan en tiempo real. Pueden pasar meses desde que publicas un contenido hasta que se refleja en las respuestas de los LLM. Empieza ahora y construye de forma sistemática tu presencia en las fuentes en las que confían los sistemas de IA.