Content-Signals: diga às IAs o que podem fazer no seu site

Content-Signals: diga às IAs o que podem fazer no seu site

Resposta rápida

O Content-Signal é uma linha no robots.txt que declara sua política de IA em três eixos: search, ai-input e ai-train. É placa, não cadeado — mas registra sua posição e orienta robôs bem-comportados. Para dentes de verdade, some bloqueio por user-agent (GPTBot, Google-Extended, CCBot).

  • Sem declaração, sua política de IA é 'façam o que quiserem' — por omissão.
  • Três sinais: search (busca), ai-input (citação em respostas), ai-train (treinamento).
  • Política típica de publisher: search=yes, ai-input=yes, ai-train=no.
  • É declaração de direitos, não trava: enforcement real é na infraestrutura.
  • Google-Extended bloqueia só o treinamento do Gemini — não afeta a Busca.
  • Coerência entre robots.txt, llms.txt e GEO: as camadas devem contar a mesma história.
O que éLinha de política de IA no robots.txt (Content Signals Policy)
OrigemCloudflare, 2025
Sinaissearch · ai-input · ai-train (yes/no)
NaturezaDeclaração de política — não é trava técnica
Política do WPRaizsearch=yes, ai-input=yes, ai-train=no
Caso mais agressivo no tech BROlhar Digital: 8 robôs de IA barrados nominalmente
PegadinhaGoogle-Extended não controla a Busca, só o treino do Gemini

O problema: sua política de IA hoje é “nenhuma”

Toda semana o seu site é lido por dezenas de robôs de IA — pra responder usuários, alimentar buscadores de IA e, em alguns casos, treinar modelos. Se o seu robots.txt não diz nada sobre isso, a sua política, na prática, é “façam o que quiserem”. Pode até ser essa a sua escolha — mas escolha se faz declarada, não por omissão.

Existem hoje duas ferramentas para declarar essa política, e elas se complementam: os Content-Signals e o bloqueio por user-agent.

O que é o Content-Signal

É uma convenção proposta pela Cloudflare em 2025 (Content Signals Policy): uma linha no robots.txt que separa os usos do seu conteúdo em três categorias, cada uma com yes ou no:

User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /wp-admin/
SinalO que autoriza
searchIndexar e exibir em resultados de busca (o SEO clássico)
ai-inputUsar o conteúdo como insumo de resposta de IA — citações, resumos, AI Overviews
ai-trainTreinar modelos com o seu conteúdo

A combinação do exemplo acima — buscar sim, citar sim, treinar não — é a que faz sentido pra maioria dos publishers: você quer aparecer nas respostas de IA (é tráfego e marca), mas não quer doar o acervo pra virar peso de modelo. É exatamente a política do WPRaiz, e você confere ao vivo no nosso robots.txt.

A verdade desconfortável: é placa, não cadeado

O Content-Signal é uma declaração de política, não uma trava técnica. Robô mal-comportado ignora — como sempre ignorou robots.txt. O valor está em três coisas: deixa sua posição juridicamente registrada (a política da Cloudflare foi desenhada como reserva expressa de direitos), orienta os robôs que respeitam convenções, e — para clientes Cloudflare — pode vir acompanhada de bloqueio real na borda, aí sim com dentes.

Quem promete que uma linha de texto “protege seu conteúdo da IA” está vendendo cadeado de papel. O honesto é: declare a política E, se quiser enforcement, bloqueie na infraestrutura.

A segunda camada: bloqueio por user-agent

Os principais operadores de IA publicam seus robôs, e você pode barrá-los um a um. Os que mais aparecem:

# exemplo: permitir busca, barrar treinamento
User-agent: GPTBot          # treinamento OpenAI
Disallow: /

User-agent: Google-Extended # treinamento Gemini (não afeta a Busca)
Disallow: /

User-agent: CCBot           # Common Crawl (base de muitos treinos)
Disallow: /

No nosso levantamento desta semana nos grandes portais tech do Brasil, o caso mais agressivo é o Olhar Digital: o robots deles cita nominalmente oito robôs de IA (GPTBot, ClaudeBot, Claude-Web, Google-Extended, PerplexityBot, CCBot, OAI-SearchBot, anthropic-ai). O Tecnoblog barra GPTBot e ClaudeBot. Cada um desenhou uma política — o ponto é que eles têm uma.

Atenção ao detalhe que mais confunde: Google-Extended controla só o treinamento do Gemini. Bloqueá-lo não tira você da Busca nem dos AI Overviews — quem controla isso são o Googlebot e as meta tags de snippet.

Como decidir a SUA política (sem dogma)

Não existe resposta única — existe coerência com o seu modelo de negócio:

  • Vive de tráfego e marca (blog, portal, e-commerce): search=yes, ai-input=yes, ai-train=no. Ser citado é distribuição; treinar modelo alheio de graça, não.
  • Vende o próprio conteúdo (cursos, pesquisa, dados): considere ai-input=no também, e bloqueio por user-agent nos robôs de IA — a resposta da IA substitui a sua venda.
  • Quer máxima distribuição (documentação, open source): tudo yes, e capriche no llms.txt pra ser citado do seu jeito.

Seja qual for a escolha, mantenha as três camadas contando a mesma história: robots.txt (política), llms.txt (contexto) e o seu trabalho de GEO (presença). Sinal contraditório — bloquear tudo no robots e implorar citação no llms.txt — só confunde máquina e advogado.

Três erros que anulam o trabalho

  1. Bloquear o que traz visita. Barrar OAI-SearchBot ou PerplexityBot tira você das respostas com link dessas ferramentas — é abrir mão de tráfego, não proteger acervo. Se o objetivo é só barrar treinamento, mire nos robôs de treino (GPTBot, Google-Extended, CCBot) e deixe os de busca passarem.
  2. Copiar o robots.txt de um portal grande. A política do Olhar Digital faz sentido para quem tem redação, marca consolidada e receita de display em escala. Para um site em construção de autoridade, ser citado costuma valer mais do que ser preservado.
  3. Esquecer que existe. Robots.txt é dos arquivos mais esquecidos da web. Coloque uma revisão semestral na agenda: robôs novos surgem, e uma política de 2024 pode estar barrando quem hoje te manda leitor.

Como aplicar no WordPress

O robots.txt do WordPress costuma ser virtual (gerado pelo plugin de SEO). No RankMath: Configurações Gerais → Editar robots.txt; no Yoast: Ferramentas → Editor de arquivos. Cole a linha do Content-Signal logo abaixo do User-agent: *, adicione os blocos de user-agent que decidiu barrar, salve e teste em seusite.com.br/robots.txt. Clientes Cloudflare podem ativar o robots gerenciado, que injeta os sinais automaticamente.

Perguntas frequentes

O que é a linha Content-Signal do robots.txt?

Convenção proposta pela Cloudflare em 2025: declara, com yes/no, se o conteúdo pode ser usado em busca (search), como insumo de respostas de IA (ai-input) e em treinamento de modelos (ai-train).

Content-Signal impede que a IA use meu conteúdo?

Não — é declaração de política, não trava técnica. Robôs bem-comportados respeitam; enforcement real exige bloqueio na infraestrutura (ex.: na borda da Cloudflare).

Bloquear Google-Extended me tira do Google?

Não. Google-Extended controla apenas o treinamento do Gemini. A presença na Busca e nos AI Overviews é controlada pelo Googlebot e pelas meta tags de snippet.

Qual política os grandes sites de tech usam?

Varia: no nosso levantamento, o Olhar Digital barra nominalmente 8 robôs de IA; o Tecnoblog barra GPTBot e ClaudeBot; o WPRaiz declara search=yes, ai-input=yes, ai-train=no.

Qual a diferença entre robots.txt, Content-Signal e llms.txt?

robots.txt controla acesso; o Content-Signal (dentro dele) declara a política de uso por IA; o llms.txt apresenta o site com contexto para os modelos. As três camadas devem ser coerentes.