O Content-Signal é uma linha no robots.txt que declara sua política de IA em três eixos: search, ai-input e ai-train. É placa, não cadeado — mas registra sua posição e orienta robôs bem-comportados. Para dentes de verdade, some bloqueio por user-agent (GPTBot, Google-Extended, CCBot).
- Sem declaração, sua política de IA é 'façam o que quiserem' — por omissão.
- Três sinais: search (busca), ai-input (citação em respostas), ai-train (treinamento).
- Política típica de publisher: search=yes, ai-input=yes, ai-train=no.
- É declaração de direitos, não trava: enforcement real é na infraestrutura.
- Google-Extended bloqueia só o treinamento do Gemini — não afeta a Busca.
- Coerência entre robots.txt, llms.txt e GEO: as camadas devem contar a mesma história.
O problema: sua política de IA hoje é “nenhuma”
Toda semana o seu site é lido por dezenas de robôs de IA — pra responder usuários, alimentar buscadores de IA e, em alguns casos, treinar modelos. Se o seu robots.txt não diz nada sobre isso, a sua política, na prática, é “façam o que quiserem”. Pode até ser essa a sua escolha — mas escolha se faz declarada, não por omissão.
Existem hoje duas ferramentas para declarar essa política, e elas se complementam: os Content-Signals e o bloqueio por user-agent.
O que é o Content-Signal
É uma convenção proposta pela Cloudflare em 2025 (Content Signals Policy): uma linha no robots.txt que separa os usos do seu conteúdo em três categorias, cada uma com yes ou no:
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /wp-admin/| Sinal | O que autoriza |
|---|---|
search | Indexar e exibir em resultados de busca (o SEO clássico) |
ai-input | Usar o conteúdo como insumo de resposta de IA — citações, resumos, AI Overviews |
ai-train | Treinar modelos com o seu conteúdo |
A combinação do exemplo acima — buscar sim, citar sim, treinar não — é a que faz sentido pra maioria dos publishers: você quer aparecer nas respostas de IA (é tráfego e marca), mas não quer doar o acervo pra virar peso de modelo. É exatamente a política do WPRaiz, e você confere ao vivo no nosso robots.txt.
A verdade desconfortável: é placa, não cadeado
O Content-Signal é uma declaração de política, não uma trava técnica. Robô mal-comportado ignora — como sempre ignorou robots.txt. O valor está em três coisas: deixa sua posição juridicamente registrada (a política da Cloudflare foi desenhada como reserva expressa de direitos), orienta os robôs que respeitam convenções, e — para clientes Cloudflare — pode vir acompanhada de bloqueio real na borda, aí sim com dentes.
Quem promete que uma linha de texto “protege seu conteúdo da IA” está vendendo cadeado de papel. O honesto é: declare a política E, se quiser enforcement, bloqueie na infraestrutura.
A segunda camada: bloqueio por user-agent
Os principais operadores de IA publicam seus robôs, e você pode barrá-los um a um. Os que mais aparecem:
# exemplo: permitir busca, barrar treinamento
User-agent: GPTBot # treinamento OpenAI
Disallow: /
User-agent: Google-Extended # treinamento Gemini (não afeta a Busca)
Disallow: /
User-agent: CCBot # Common Crawl (base de muitos treinos)
Disallow: /No nosso levantamento desta semana nos grandes portais tech do Brasil, o caso mais agressivo é o Olhar Digital: o robots deles cita nominalmente oito robôs de IA (GPTBot, ClaudeBot, Claude-Web, Google-Extended, PerplexityBot, CCBot, OAI-SearchBot, anthropic-ai). O Tecnoblog barra GPTBot e ClaudeBot. Cada um desenhou uma política — o ponto é que eles têm uma.
Atenção ao detalhe que mais confunde: Google-Extended controla só o treinamento do Gemini. Bloqueá-lo não tira você da Busca nem dos AI Overviews — quem controla isso são o Googlebot e as meta tags de snippet.
Como decidir a SUA política (sem dogma)
Não existe resposta única — existe coerência com o seu modelo de negócio:
- Vive de tráfego e marca (blog, portal, e-commerce):
search=yes, ai-input=yes, ai-train=no. Ser citado é distribuição; treinar modelo alheio de graça, não. - Vende o próprio conteúdo (cursos, pesquisa, dados): considere
ai-input=notambém, e bloqueio por user-agent nos robôs de IA — a resposta da IA substitui a sua venda. - Quer máxima distribuição (documentação, open source): tudo yes, e capriche no llms.txt pra ser citado do seu jeito.
Seja qual for a escolha, mantenha as três camadas contando a mesma história: robots.txt (política), llms.txt (contexto) e o seu trabalho de GEO (presença). Sinal contraditório — bloquear tudo no robots e implorar citação no llms.txt — só confunde máquina e advogado.
Três erros que anulam o trabalho
- Bloquear o que traz visita. Barrar
OAI-SearchBotouPerplexityBottira você das respostas com link dessas ferramentas — é abrir mão de tráfego, não proteger acervo. Se o objetivo é só barrar treinamento, mire nos robôs de treino (GPTBot, Google-Extended, CCBot) e deixe os de busca passarem. - Copiar o robots.txt de um portal grande. A política do Olhar Digital faz sentido para quem tem redação, marca consolidada e receita de display em escala. Para um site em construção de autoridade, ser citado costuma valer mais do que ser preservado.
- Esquecer que existe. Robots.txt é dos arquivos mais esquecidos da web. Coloque uma revisão semestral na agenda: robôs novos surgem, e uma política de 2024 pode estar barrando quem hoje te manda leitor.
Como aplicar no WordPress
O robots.txt do WordPress costuma ser virtual (gerado pelo plugin de SEO). No RankMath: Configurações Gerais → Editar robots.txt; no Yoast: Ferramentas → Editor de arquivos. Cole a linha do Content-Signal logo abaixo do User-agent: *, adicione os blocos de user-agent que decidiu barrar, salve e teste em seusite.com.br/robots.txt. Clientes Cloudflare podem ativar o robots gerenciado, que injeta os sinais automaticamente.
Perguntas frequentes
O que é a linha Content-Signal do robots.txt?
Convenção proposta pela Cloudflare em 2025: declara, com yes/no, se o conteúdo pode ser usado em busca (search), como insumo de respostas de IA (ai-input) e em treinamento de modelos (ai-train).
Content-Signal impede que a IA use meu conteúdo?
Não — é declaração de política, não trava técnica. Robôs bem-comportados respeitam; enforcement real exige bloqueio na infraestrutura (ex.: na borda da Cloudflare).
Bloquear Google-Extended me tira do Google?
Não. Google-Extended controla apenas o treinamento do Gemini. A presença na Busca e nos AI Overviews é controlada pelo Googlebot e pelas meta tags de snippet.
Qual política os grandes sites de tech usam?
Varia: no nosso levantamento, o Olhar Digital barra nominalmente 8 robôs de IA; o Tecnoblog barra GPTBot e ClaudeBot; o WPRaiz declara search=yes, ai-input=yes, ai-train=no.
Qual a diferença entre robots.txt, Content-Signal e llms.txt?
robots.txt controla acesso; o Content-Signal (dentro dele) declara a política de uso por IA; o llms.txt apresenta o site com contexto para os modelos. As três camadas devem ser coerentes.






