Conjuntos de datos y fuentes de datos: de dónde obtienen los LLM su conocimiento sobre las marcas
Los LLM como ChatGPT, Claude y Gemini no se entrenan únicamente con tu sitio web: se entrenan con billones de palabras procedentes de cientos de fuentes distintas. Si quieres comprender por qué la IA menciona o ignora a tu marca, necesitas entender qué conjuntos de datos dan forma a estos sistemas. Esta guía te ofrece una visión general de dónde obtienen sus conocimientos los LLM, cómo puedes influir en estas fuentes y a cuáles deberías dar prioridad.

Conjuntos de datos y fuentes de datos: dónde obtienen los LLM su conocimiento sobre las marcas
Los LLM como ChatGPT, Claude y Gemini no se entrenan únicamente con tu sitio web; se entrenan con billones de palabras procedentes de cientos de fuentes diferentes. Si quieres entender por qué la IA menciona o ignora tu marca, necesitas comprender qué conjuntos de datos dan forma a estos sistemas. Esta guía te ofrece una visión general de dónde obtienen los LLM su conocimiento, cómo puedes influir en estas fuentes y cuáles debes priorizar.
Cómo aprenden los LLM sobre las marcas
El entrenamiento de los LLM se realiza en varias fases:
1. Preentrenamiento (la base)
El modelo se entrena con enormes corpus de texto para aprender la estructura del lenguaje y conocimientos generales.
Conjuntos de datos principales:
Common Crawl: rastreo de toda la web (billones de páginas)
Wikipedia: conocimiento estructurado y de autoridad
Corpus de libros: millones de libros digitales
Reddit: debates impulsados por la comunidad
Archivos de noticias: artículos de noticias históricos
Artículos científicos: conocimiento académico
Lo que esto significa para tu marca: si tu marca no se menciona en estas fuentes durante el preentrenamiento, el modelo no sabrá nada de ti desde el principio.
2. Ajuste fino (refinamiento)
Tras el preentrenamiento, el modelo se ajusta con datos de alta calidad específicamente seleccionados.
Fuentes:
Texto seleccionado de fuentes confiables
Contenido escrito por expertos
Bases de datos estructuradas
3. RLHF (aprendizaje por refuerzo a partir del feedback humano)
El modelo aprende a ofrecer respuestas útiles y seguras basándose en los comentarios de los usuarios.
Esto no afecta directamente al conocimiento de la marca, pero:
El modelo aprende a citar fuentes
Aprende a reconocer la incertidumbre
Aprende a priorizar la información de autoridad
4. Recuperación en tiempo real (para algunos sistemas)
Algunos sistemas de IA (como Perplexity y la navegación web de ChatGPT) realizan rastreos en vivo para complementar sus conocimientos.
Fuentes:
Tu sitio web (si permite el rastreo)
Sitios de noticias
Redes sociales
Las fuentes de datos más importantes para el conocimiento de la marca
1. Common Crawl
Qué es: un proyecto sin fines de lucro que rastrea mensualmente miles de millones de páginas web y ofrece los datos de forma gratuita.
Por qué es importante:
Muchos modelos de IA (incluido GPT) se entrenan con Common Crawl
Si tu sitio no está aquí, serás invisible para muchos LLM
¿Está tu sitio en Common Crawl?
Compruébalo aquí: https://index.commoncrawl.org/
Cómo entrar:
Permite CCBot en el archivo robots.txt
Asegúrate de que tu sitio web permita el rastreo
Espera: Common Crawl realiza rastreos periódicos de forma automática
2. Wikipedia
Por qué es oro: Wikipedia es una de las fuentes de mayor autoridad en las que confían los LLM. Si tu marca tiene una página en Wikipedia, los LLM la citarán como un hecho.
Cómo influir:
Crea una página de Wikipedia (si cumples con los criterios de relevancia)
Asegúrate de que las páginas existentes sean precisas y estén actualizadas
Añade fuentes y referencias
Criterios de relevancia de Wikipedia:
Cobertura mediática significativa en fuentes confiables
Fuentes independientes (no relaciones públicas ni marketing propio)
Múltiples artículos detallados
Si no puedes conseguir una página de Wikipedia: céntrate en aparecer mencionado en artículos relevantes ya existentes en Wikipedia (por ejemplo, artículos del sector, páginas geográficas o páginas de competidores con secciones de "Ver también").
3. Crunchbase
Qué es: base de datos de empresas, financiación y ecosistemas tecnológicos.
Por qué es importante: los LLM utilizan Crunchbase para entender:
A qué se dedica tu empresa
Quiénes son tus competidores
Fase de financiación y tamaño
Optimiza tu perfil de Crunchbase:
Reclama tu perfil de Crunchbase
Completa todos los campos:
Descripción (específicamente a qué te dedicas)
Categorías (elige etiquetas relevantes)
Información de financiación
Enlace al sitio web
Manténlo actualizado con las rondas de financiación o lanzamientos de productos
4. LinkedIn
Por qué es importante: los LLM utilizan LinkedIn para entender:
Tamaño de la empresa y empleados
Sector y áreas de enfoque
Posicionamiento de marca
Optimiza tu página de empresa en LinkedIn:
Sección Información: descripción clara de lo que haces
Especialidades: etiqueta palabras clave relevantes
Actualizaciones: publicaciones periódicas sobre novedades de productos, contrataciones y liderazgo de opinión
Perfiles de empleados: los perfiles de los empleados se conectan con la página de la empresa
5. Cobertura en noticias y medios de comunicación
Por qué es importante: los LLM valoran más las marcas con cobertura en medios de comunicación que el contenido autoeditado.
Prioriza:
Medios de primer nivel (Tier 1): TechCrunch, Wired, Wall Street Journal, Financial Times
Publicaciones del sector: revistas profesionales relevantes
Noticias regionales: medios de comunicación de negocios locales
Cómo conseguir cobertura:
Notas de prensa en lanzamientos de productos
Artículos de liderazgo de opinión (artículos de invitados)
Opinar sobre temas de actualidad
Premios y reconocimientos
6. GitHub (para marcas tecnológicas)
Por qué es importante: muchos LLM se entrenan con código de código abierto de GitHub.
Si tienes proyectos de código abierto:
Actualiza el archivo README con una descripción clara
Añade la sección "About" al repositorio
Enlaza al sitio web de tu empresa
Incluye casos de uso y ejemplos
7. Redes sociales
Twitter/X:
Los tweets públicos son rastreados por algunos LLM
Liderazgo de opinión e imagen de marca
Reddit:
Debates de la comunidad en torno a las marcas
Experiencias de usuario auténticas
YouTube:
Se rastrean las transcripciones
Demostraciones de productos y tutoriales
8. Artículos académicos e investigación
Si tu marca está orientada a la tecnología o la investigación:
Publica informes técnicos (whitepapers)
Patrocina investigación académica
Contribuye en conferencias
Súbelos a:
arXiv.org (prepublicaciones)
Repositorios universitarios
Cómo priorizar tus esfuerzos
Nivel 1: Imprescindible (mayor impacto)
Tu propio sitio web: con robots.txt, JSON-LD y mapa del sitio correctos
Wikipedia: si cumples los requisitos
Crunchbase: para marcas tecnológicas
LinkedIn: página de empresa optimizada
Nivel 2: Fuerte retorno de la inversión (ROI)
Cobertura de noticias: medios de primer nivel y publicaciones del sector
Common Crawl: asegúrate de que tu sitio web permita el rastreo
GitHub: para marcas de código abierto
Directorios del sector: directorios de nicho relevantes
Nivel 3: Valor a largo plazo
Reddit: participación comunitaria auténtica
YouTube: contenido de video con transcripciones
Podcasts: apariciones como invitado (con transcripciones)
Foros: Stack Overflow, Hacker News, comunidades de nicho
Cómo verificar que estás en los conjuntos de datos
Comprobar Common Crawl
Comprobar Wikipedia
Busca el nombre de tu marca en https://es.wikipedia.org/wiki/Especial:Buscar.
Comprobar Crunchbase
Visita https://www.crunchbase.com/organization/YOUR-COMPANY
Comprobar la cobertura de noticias
Comprobar GitHub
Busca en https://github.com/search?q=YOUR-BRAND
Lista de verificación de implementación
Utiliza esta lista de verificación para asegurar tu presencia en conjuntos de datos importantes:
Sitio web optimizado: robots.txt, mapa del sitio, JSON-LD
Common Crawl: permitir CCBot
Presencia en Wikipedia: crear o actualizar la página (si cumples los requisitos)
Perfil de Crunchbase: reclamado y actualizado
Página de empresa de LinkedIn: perfil completo
Cobertura de noticias: mínimo de 3 a 5 menciones en medios relevantes
Repositorios de GitHub: si es una marca tecnológica, archivo README claro
Presencia social: activo en al menos 2 plataformas
Directorios del sector: presencia en directorios relevantes
Distribución de contenido: distribuir contenido en Medium, artículos de LinkedIn
Conclusión
Los LLM aprenden sobre tu marca a través de cientos de fuentes, no solo de tu sitio web. Para lograr la máxima visibilidad en la IA, debes asegurarte de estar presente en los conjuntos de datos que más importan: Common Crawl (a través de tu sitio web), Wikipedia (si cumples los requisitos), Crunchbase, LinkedIn y la cobertura de noticias.
Prioriza Wikipedia y la cobertura de noticias; tienen un peso desproporcionado en la forma en que los LLM evalúan la autoridad. A continuación, céntrate en hacer que tu propio sitio web sea perfectamente rastreable y esté estructurado con JSON-LD.
Recuerda: los conjuntos de datos no se aktualizan en tiempo real. Pueden pasar meses desde que publicas un contenido hasta que se refleja en las respuestas de los LLM. Empieza ahora y construye sistemáticamente tu presencia en las fuentes en las que confían los sistemas de IA.