Conjuntos de Dados e Fontes de Dados — Onde os LLMs Obtêm o Seu Conhecimento Sobre as Marcas

Os LLMs como o ChatGPT, o Claude e o Gemini não são treinados apenas no seu website — são treinados em biliões de palavras provenientes de centenas de fontes diferentes. Se quer compreender a razão pela qual a IA menciona ou ignora a sua marca, precisa de perceber quais são os conjuntos de dados que moldam estes sistemas. Este guia oferece-lhe uma visão geral de onde os LLMs obtêm o seu conhecimento, como pode influenciar estas fontes e quais as fontes que deve priorizar.

Conjuntos de Dados e Fontes de Dados — Onde os LLMs Obtêm o Seu Conhecimento Sobre as Marcas

Publicado em

Autor

Jakob Langemark

Siga-nos

Conjuntos de Dados e Fontes de Dados — Onde os LLMs Obtêm o Seu Conhecimento Sobre Marcas

Os LLMs como o ChatGPT, o Claude e o Gemini não são treinados apenas no seu website — são treinados em biliões de palavras de centenas de fontes diferentes. Se quer compreender por que razão a IA menciona ou ignora a sua marca, precisa de perceber quais os conjuntos de dados que moldam estes sistemas. Este guia oferece-lhe uma visão geral de onde os LLMs obtêm o seu conhecimento, como pode influenciar estas fontes e quais as fontes que deve priorizar.

Como os LLMs Aprendem Sobre Marcas

O treino de LLMs ocorre em várias fases:

1. Pré-treino (a base)

O modelo é treinado em corpora de texto massivos para aprender a estrutura da linguagem e o conhecimento geral.

Conjuntos de dados primários:

  • Common Crawl — Extração de toda a web (biliões de páginas)

  • Wikipedia — Conhecimento estruturado e fidedigno

  • Corpo de livros (Books corpus) — Milhões de livros digitais

  • Reddit — Discussões geradas pela comunidade

  • Arquivos de notícias — Artigos de notícias históricos

  • Artigos científicos — Conhecimento académico

O que isto significa para a sua marca: Se a sua marca não for mencionada nestas fontes durante o pré-treino, o modelo não saberá nada sobre si desde o início.

2. Ajuste fino (refinamento)

Após o pré-treino, o modelo é ajustado com dados especificamente selecionados e de alta qualidade.

Fontes:

  • Texto selecionado de fontes confiáveis

  • Conteúdo escrito por especialistas

  • Bases de dados estruturadas

3. RLHF (Aprendizagem por Reforço com Feedback Humano)

O modelo aprende a dar respostas úteis e seguras com base no feedback humano.

Isto não afeta diretamente o conhecimento da marca, mas:

  • O modelo aprende a citar fontes

  • Aprende a reconhecer a incerteza

  • Aprende a priorizar informação fidedigna

4. Recuperação em tempo real (para alguns sistemas)

Alguns sistemas de IA (como o Perplexity e a navegação web do ChatGPT) analisam a web em direto para complementar o seu conhecimento.

Fontes:

  • O seu website (se for indexável)

  • Sites de notícias

  • Redes sociais

As Fontes de Dados Mais Importantes para o Conhecimento de Marcas

1. Common Crawl

O que é: Um projeto sem fins lucrativos que analisa mensalmente milhares de milhões de páginas web e disponibiliza os dados gratuitamente.

Por que é importante:

  • Muitos modelos de IA (incluindo o GPT) são treinados no Common Crawl

  • Se o seu site não estiver aqui, é invisível para muitos LLMs

O seu site está no Common Crawl?

Verifique aqui: https://index.commoncrawl.org/

# Verifique se o seu domínio está no Common Crawl
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=oseuwebsite.com&output=json" | head -5
# Verifique se o seu domínio está no Common Crawl
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=oseuwebsite.com&output=json" | head -5
# Verifique se o seu domínio está no Common Crawl
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=oseuwebsite.com&output=json" | head -5

Como entrar:

  • Permita o CCBot no ficheiro robots.txt

  • Certifique-se de que o seu site é rastreável

  • Aguarde — o Common Crawl analisa a web periodicamente de forma automática

2. Wikipedia

Por que vale ouro: A Wikipedia é uma das fontes mais fidedignas em que os LLMs confiam. Se a sua marca tiver uma página na Wikipedia, os LLMs irão citá-la como um facto.

Como influenciar:

  • Crie uma página na Wikipedia (se cumprir os critérios de relevância)

  • Garanta que as páginas existentes são precisas e estão atualizadas

  • Adicione fontes e referências

Critérios de relevância da Wikipedia:

  • Cobertura mediática significativa em fontes confiáveis

  • Fontes independentes (não relações públicas ou marketing próprio)

  • Vários artigos aprofundados

Se não conseguir uma página na Wikipedia: Foque-se em ser mencionado em artigos relevantes já existentes na Wikipedia (por exemplo, artigos do setor, páginas geográficas ou páginas de concorrentes com secções "Ver também").

3. Crunchbase

O que é: Base de dados de empresas, financiamento e ecossistemas tecnológicos.

Por que é importante: Os LLMs utilizam o Crunchbase para compreender:

  • O que a sua empresa faz

  • Quem são os seus concorrentes

  • Fase de financiamento e dimensão

Otimize o seu perfil no Crunchbase:

  1. Reivindique o seu perfil no Crunchbase

  2. Preencha todos os campos:

    • Descrição (especificamente o que faz)

    • Categorias (escolha etiquetas relevantes)

    • Informação de financiamento

    • Link para o website

  3. Mantenha-o atualizado em rondas de financiamento ou lançamentos de produtos

4. LinkedIn

Por que é importante: Os LLMs utilizam o LinkedIn para compreender:

  • Dimensão da empresa e colaboradores

  • Setor e áreas de foco

  • Posicionamento de marca

Otimize a sua Página de Empresa no LinkedIn:

  • Secção Sobre: Descrição clara do que faz

  • Especialidades: Identifique palavras-chave relevantes

  • Atualizações: Publicações regulares sobre novidades de produtos, recrutamento e liderança de opinião

  • Perfis de colaboradores: Perfis que se ligam à página da empresa

5. Cobertura de Notícias e Media

Por que é importante: Os LLMs valorizam mais as marcas com cobertura mediática do que o conteúdo publicado pelo próprio.

Priorize:

  • Media de referência (Tier 1): TechCrunch, Wired, Wall Street Journal, Financial Times

  • Publicações do setor: Revistas especializadas relevantes

  • Notícias regionais: Media de negócios locais

Como obter cobertura:

  • Comunicados de imprensa no lançamento de produtos

  • Artigos de liderança de opinião (artigos de convidados)

  • Comentários sobre tópicos de tendência

  • Prémios e distinções

6. GitHub (para marcas tecnológicas)

Por que é importante: Muitos LLMs são treinados em código de código aberto do GitHub.

Se tiver projetos de código aberto:

  • Atualize o README com uma descrição clara

  • Adicione uma secção "Sobre" ao repositório

  • Coloque um link para o website da sua empresa

  • Inclua casos de uso e exemplos

7. Redes Sociais

Twitter/X:

  • Os tweets públicos são indexados por alguns LLMs

  • Liderança de opinião e branding

Reddit:

  • Discussões da comunidade em torno de marcas

  • Experiências autênticas de utilizadores

YouTube:

  • As transcrições são indexadas

  • Demonstrações de produtos e tutoriais

8. Artigos Académicos e Investigação

Se a sua marca for orientada para tecnologia ou investigação:

  • Publique relatórios (whitepapers)

  • Patrocine investigação académica

  • Contribua para conferências

Carregue para:

Como Priorizar os Seus Esforços

Nível 1: Essenciais (maior impacto)

  1. O seu próprio website — Com robots.txt, JSON-LD e sitemap corretos

  2. Wikipedia — Se elegível

  3. Crunchbase — Para marcas tecnológicas

  4. LinkedIn — Página de empresa otimizada

Nível 2: Forte Retorno sobre o Investimento (ROI)

  1. Cobertura de notícias — Media de referência e publicações do setor

  2. Common Crawl — Garanta que o seu site é indexável

  3. GitHub — Para marcas de código aberto

  4. Diretórios do setor — Diretórios relevantes de nicho

Nível 3: Valor a longo prazo

  1. Reddit — Interação autêntica com a comunidade

  2. YouTube — Conteúdo de vídeo com transcrições

  3. Podcasts — Participações como convidado (com transcrições)

  4. Fóruns — Stack Overflow, Hacker News, comunidades de nicho

Como Verificar se Está nos Conjuntos de Dados

Verifique o Common Crawl

curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=oseuwebsite.com&output=json"
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=oseuwebsite.com&output=json"
curl "http://index.commoncrawl.org/CC-MAIN-2024-10-index?url=oseuwebsite.com&output=json"

Verifique a Wikipedia

Pesquise o nome da sua marca em https://pt.wikipedia.org/wiki/Especial:Pesquisar.

Verifique o Crunchbase

Visite https://www.crunchbase.com/organization/YOUR-COMPANY

Verifique a cobertura de notícias

# Pesquisa no Google Notícias
https://news.google.com/search?q="Nome Da Sua Marca"
# Pesquisa no Google Notícias
https://news.google.com/search?q="Nome Da Sua Marca"
# Pesquisa no Google Notícias
https://news.google.com/search?q="Nome Da Sua Marca"

Verifique o GitHub

Pesquise em https://github.com/search?q=YOUR-BRAND

Lista de Verificação para Implementação

Utilize esta lista de verificação para garantir a sua presença em conjuntos de dados importantes:

  1. Website otimizado — robots.txt, sitemap, JSON-LD

  2. Common Crawl — Permitir o CCBot

  3. Presença na Wikipedia — Criar ou atualizar a página (se elegível)

  4. Perfil no Crunchbase — Reivindicado e atualizado

  5. Página de empresa no LinkedIn — Perfil completo

  6. Cobertura de notícias — No mínimo 3 a 5 menções em media relevante

  7. Repositórios no GitHub — Se for marca tecnológica, README claro

  8. Presença social — Ativo em pelo menos 2 plataformas

  9. Diretórios do setor — Listado em diretórios relevantes

  10. Distribuição de conteúdo — Sincronizar conteúdo no Medium, artigos do LinkedIn

Conclusão

Os LLMs aprendem sobre a sua marca através de centenas de fontes — não apenas do seu website. Para obter a máxima visibilidade da IA, precisa de garantir presença nos conjuntos de dados mais importantes: Common Crawl (através do seu website), Wikipedia (se elegível), Crunchbase, LinkedIn e cobertura de notícias.

Priorize a Wikipedia e a cobertura de notícias — têm um peso desproporcional na forma como os LLMs avaliam a autoridade. Em seguida, foque-se em tornar o seu próprio website perfeitamente indexável e estruturado com JSON-LD.

Lembre-se: Os conjuntos de dados não são atualizados em tempo real. Pode demorar meses desde o momento em que publica conteúdo até que este se reflita nas respostas dos LLMs. Comece agora e construa sistematicamente a sua presença nas fontes em que os sistemas de IA confiam.