Conjuntos de Dados e Fontes de Dados — Onde os LLMs Obtêm o Seu Conhecimento Sobre as Marcas

Os LLMs como o ChatGPT, o Claude e o Gemini não são treinados apenas no seu website — são treinados em biliões de palavras provenientes de centenas de fontes diferentes. Se quer compreender a razão pela qual a IA menciona ou ignora a sua marca, precisa de perceber quais são os conjuntos de dados que moldam estes sistemas. Este guia oferece-lhe uma visão geral de onde os LLMs obtêm o seu conhecimento, como pode influenciar estas fontes e quais as fontes que deve priorizar.

Conjuntos de Dados e Fontes de Dados — Onde os LLMs Obtêm o Seu Conhecimento Sobre as Marcas

Publicado em

Autor

Jakob Langemark

Siga-nos

Conjuntos de Dados e Fontes de Dados — Onde os LLMs Obtêm o Seu Conhecimento Sobre Marcas

Os LLMs como o ChatGPT, o Claude e o Gemini não são treinados apenas no seu website — são treinados em biliões de palavras de centenas de fontes diferentes. Se quer compreender por que razão a IA menciona ou ignora a sua marca, precisa de perceber quais os conjuntos de dados que moldam estes sistemas. Este guia oferece uma visão geral de onde os LLMs obtêm o seu conhecimento, como pode influenciar estas fontes e quais as fontes que deve priorizar.

Como os LLMs Aprendem Sobre Marcas

O treino de LLMs ocorre em várias fases:

1. Pré-treino (a base)

O modelo é treinado em corpora massivos de texto para aprender a estrutura da linguagem e o conhecimento geral.

Principais conjuntos de dados:

  • Common Crawl — Extração de toda a web (biliões de páginas)

  • Wikipedia — Conhecimento estruturado e autoritário

  • Corpo de livros — Milhões de livros digitais

  • Reddit — Discussões impulsionadas pela comunidade

  • Arquivos de notícias — Artigos de notícias históricos

  • Artigos científicos — Conhecimento académico

O que isto significa para a sua marca: Se a sua marca não for mencionada nestas fontes durante o pré-treino, o modelo não saberá nada sobre si desde o início.

2. Ajuste fino (refinamento)

Após o pré-treino, o modelo é ajustado com base em dados especificamente selecionados e de alta qualidade.

Fontes:

  • Texto curado de fontes confiáveis

  • Conteúdo escrito por especialistas

  • Bases de dados estruturadas

3. RLHF (Aprendizagem por Reforço com Feedback Humano)

O modelo aprende a dar respostas úteis e seguras com base no feedback humano.

Isto não afeta diretamente o conhecimento sobre a marca, mas:

  • O modelo aprende a citar fontes

  • Aprende a reconhecer a incerteza

  • Aprende a priorizar informação autoritária

4. Recuperação em tempo real (para alguns sistemas)

Alguns sistemas de IA (como o Perplexity e a navegação na web do ChatGPT) realizam pesquisas em tempo real para complementar o seu conhecimento.

Fontes:

  • O seu website (se for rastreável)

  • Sites de notícias

  • Redes sociais

As Fontes de Dados Mais Importantes para o Conhecimento da Marca

1. Common Crawl

O que é: Um projeto sem fins lucrativos que rastreia mensalmente milhares de milhões de páginas web e disponibiliza os dados gratuitamente.

Porque é importante:

  • Muitos modelos de IA (incluindo o GPT) são treinados no Common Crawl

  • Se o seu site não estiver aqui, é invisível para muitos LLMs

O seu site está no Common Crawl?

Verifique aqui: https://index.commoncrawl.org/

# Verifique se o seu domínio está no Common Crawl
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=oseuwebsite.com&output=json" | head -5
# Verifique se o seu domínio está no Common Crawl
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=oseuwebsite.com&output=json" | head -5
# Verifique se o seu domínio está no Common Crawl
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=oseuwebsite.com&output=json" | head -5

Como entrar:

  • Permita o CCBot no robots.txt

  • Garanta que o seu site é rastreável

  • Aguarde — o Common Crawl rastreia periodicamente de forma automática

2. Wikipedia

Porque é valiosa: A Wikipedia é uma das fontes mais autoritárias em que os LLMs confiam. Se a sua marca tiver uma página na Wikipedia, os LLMs irão citá-la como um facto.

Como influenciar:

  • Crie uma página na Wikipedia (se cumprir os critérios de notoriedade)

  • Garanta que as páginas existentes são precisas e estão atualizadas

  • Adicione fontes e referências

Critérios de notoriedade da Wikipedia:

  • Cobertura mediática significativa em fontes confiáveis

  • Fontes independentes (não relações públicas ou marketing próprio)

  • Vários artigos aprofundados

Se não conseguir uma página na Wikipedia: Foque-se em ser mencionado em artigos relevantes já existentes na Wikipedia (ex.: artigos do setor, páginas geográficas ou páginas de concorrentes com secções "Ver também").

3. Crunchbase

O que é: Base de dados de empresas, financiamento e ecossistemas tecnológicos.

Porque é importante: Os LLMs utilizam o Crunchbase para compreender:

  • O que a sua empresa faz

  • Quem são os seus concorrentes

  • Fase de financiamento e dimensão

Otimize o seu perfil do Crunchbase:

  1. Reivindique o seu perfil no Crunchbase

  2. Preencha todos os campos:

    • Descrição (especificamente o que faz)

    • Categorias (escolha tags relevantes)

    • Informação de financiamento

    • Link do website

  3. Mantenha-o atualizado aquando de rondas de financiamento ou lançamentos de produtos

4. LinkedIn

Porque é importante: Os LLMs utilizam o LinkedIn para compreender:

  • Dimensão da empresa e colaboradores

  • Setor de atividade e áreas de foco

  • Posicionamento da marca

Otimize a Página da sua Empresa no LinkedIn:

  • Secção Sobre: Descrição clara do que faz

  • Especialidades: Identifique palavras-chave relevantes

  • Atualizações: Publicações regulares sobre novidades de produtos, contratações, liderança de opinião

  • Perfis de colaboradores: Os perfis dos colaboradores associam-se à página da empresa

5. Cobertura de Notícias e Media

Porque é importante: Os LLMs valorizam mais as marcas com cobertura mediática do que o conteúdo auto-publicado.

Priorize:

  • Media de referência (Tier 1): TechCrunch, Wired, Wall Street Journal, Financial Times

  • Publicações do setor: Revistas profissionais relevantes

  • Notícias regionais: Media de negócios locais

Como obter cobertura:

  • Comunicados de imprensa nos lançamentos de produtos

  • Artigos de liderança de opinião (artigos de convidados)

  • Comentários sobre temas de atualidade

  • Prémios e reconhecimentos

6. GitHub (para marcas tecnológicas)

Porque é importante: Muitos LLMs são treinados em código open-source do GitHub.

Se tiver projetos open-source:

  • Atualize o README com uma descrição clara

  • Adicione a secção "Sobre" ao repositório

  • Inclua um link para o website da sua empresa

  • Inclua casos de uso e exemplos

7. Redes Sociais

Twitter/X:

  • Os tweets públicos são rastreados por alguns LLMs

  • Liderança de opinião e branding

Reddit:

  • Discussões da comunidade em torno de marcas

  • Experiências autênticas dos utilizadores

YouTube:

  • As transcrições são rastreadas

  • Demonstrações de produtos e tutoriais

8. Artigos Académicos e Investigação

Se a sua marca for orientada para a tecnologia ou investigação:

  • Publique whitepapers

  • Patrocine investigação académica

  • Contribua para conferências

Carregue para:

Como Priorizar os Seus Esforços

Nível 1: Indispensável (maior impacto)

  1. O seu próprio website — Com robots.txt, JSON-LD e mapa do site corretos

  2. Wikipedia — Se elegível

  3. Crunchbase — Para marcas tecnológicas

  4. LinkedIn — Página de empresa otimizada

Nível 2: Forte ROI

  1. Cobertura de notícias — Media de referência e publicações do setor

  2. Common Crawl — Garanta que o seu site é rastreável

  3. GitHub — Para marcas de código aberto

  4. Diretórios do setor — Diretórios de nicho relevantes

Nível 3: Valor a longo prazo

  1. Reddit — Envolvimento autêntico da comunidade

  2. YouTube — Conteúdo de vídeo com transcrições

  3. Podcasts — Participações como convidado (com transcrições)

  4. Fóruns — Stack Overflow, Hacker News, comunidades de nicho

Como Verificar se Está nos Conjuntos de Dados

Verificar o Common Crawl

curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=oseuwebsite.com&output=json"
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=oseuwebsite.com&output=json"
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=oseuwebsite.com&output=json"

Verificar a Wikipedia

Pesquise pelo nome da sua marca em https://pt.wikipedia.org/wiki/Especial:Pesquisar.

Verificar o Crunchbase

Visite https://www.crunchbase.com/organization/YOUR-COMPANY

Verificar a cobertura de notícias

# Pesquisa no Google Notícias
https://news.google.com/search?q="Nome Da Sua Marca"
# Pesquisa no Google Notícias
https://news.google.com/search?q="Nome Da Sua Marca"
# Pesquisa no Google Notícias
https://news.google.com/search?q="Nome Da Sua Marca"

Verificar o GitHub

Pesquise em https://github.com/search?q=YOUR-BRAND

Lista de Verificação para Implementação

Utilize esta lista de verificação para garantir a sua presença em conjuntos de dados importantes:

  1. Website otimizado — robots.txt, sitemap, JSON-LD

  2. Common Crawl — Permitir CCBot

  3. Presença na Wikipedia — Criar ou atualizar página (se elegível)

  4. Perfil Crunchbase — Reivindicado e atualizado

  5. Página de empresa no LinkedIn — Perfil completo

  6. Cobertura de notícias — No mínimo 3 a 5 menções em meios relevantes

  7. Repositórios GitHub — Se for uma marca tecnológica, README claro

  8. Presença social — Ativo em pelo menos 2 plataformas

  9. Diretórios do setor — Listado em diretórios relevantes

  10. Distribuição de conteúdo — Sincronizar conteúdo no Medium, artigos do LinkedIn

Conclusão

Os LLMs aprendem sobre a sua marca através de centenas de fontes — não apenas do seu website. Para obter a máxima visibilidade de IA, precisa de garantir presença nos conjuntos de dados que mais importam: Common Crawl (através do seu website), Wikipedia (se elegível), Crunchbase, LinkedIn e cobertura de notícias.

Priorize a Wikipedia e a cobertura de notícias — estas têm um peso desproporcional na forma como os LLMs avaliam a autoridade. Em seguida, foque-se em tornar o seu próprio website perfeitamente rastreável e estruturado com JSON-LD.

Lembre-se: os conjuntos de dados não são atualizados em tempo real. Pode demorar meses desde o momento em que publica conteúdo até que este se reflita nas respostas dos LLMs. Comece agora e construa sistematicamente a sua presença nas fontes em que os sistemas de IA confiam.