Ir para o conteúdo principal

Guias / Conceitos de monitoramento explicados

llms.txt: o que é, quem lê e como escrever um

llms.txt é uma convenção proposta, não um padrão da web, para publicar um arquivo Markdown curto na raiz de um site que dá aos modelos de linguagem de IA uma lista curada das páginas mais úteis do site. Jeremy Howard, da Answer.AI, apresentou a proposta em setembro de 2024 no llmstxt.org; nenhum navegador, mecanismo de busca ou grande produto de IA é obrigado a dar suporte a ela, e nenhum a trata como autoritativa hoje.

O que é o llms.txt?

O llms.txt resolve um problema real: uma página feita para pessoas embrulha seu conteúdo em navegação, anúncios e JavaScript, e transformar isso de volta em texto limpo para um modelo é difícil e impreciso. Em vez de pedir que um modelo rastreie e interprete páginas HTML completas, um site publica um único arquivo Markdown simples que lista, em ordem de importância, as páginas que um modelo deveria ler.

É explicitamente uma proposta, não um padrão: sem órgão regulador, sem suporte obrigatório de nenhuma ferramenta de IA. Se ela é usada ou não depende inteiramente de cada ferramenta decidir lê-la.

O que entra em um arquivo llms.txt?

O formato definido no llmstxt.org é específico:

  • Um H1 com o nome do site ou projeto, o único elemento obrigatório.
  • Uma citação em bloco logo abaixo do H1 com um resumo curto.
  • Parágrafos simples opcionais com mais contexto, antes do primeiro H2.
  • Uma ou mais seções H2, cada uma uma lista Markdown de links: [nome](url): nota opcional.
  • Um H2 opcional chamado "Optional" para links secundários que um modelo pode ignorar quando tem pouco contexto.

Veja um exemplo realista para um SaaS fictício:

# Acme Metrics

> Acme Metrics is a hosted dashboard for product analytics events.

## Docs

- [Quickstart](https://docs.acmemetrics.com/quickstart.md): Install the SDK, send your first event
- [API reference](https://docs.acmemetrics.com/api.md): REST endpoints for events and dashboards
- [Webhooks](https://docs.acmemetrics.com/webhooks.md): Real-time event notifications

## Optional

- [Changelog](https://docs.acmemetrics.com/changelog.md): Release notes
- [Status page](https://status.acmemetrics.com): Uptime and incidents

Muitos sites também publicam um llms-full.txt: o mesmo mapa, mas com o conteúdo Markdown completo de cada página vinculada colado em um único arquivo, para que um modelo que não vá seguir links receba tudo em uma única busca.

llms.txt vs robots.txt vs sitemap.xml

Esses três arquivos são confundidos porque todos ficam na raiz do site e todos têm a ver com como as máquinas veem um site, mas cumprem três funções diferentes:

ArquivoFinalidadeQuem lêControla o acesso?
robots.txtQuais caminhos os rastreadores podem buscarRastreadores que optam por respeitá-loSim, de forma consultiva (um bot compatível o segue)
sitemap.xmlURLs que você quer descobertas e indexadasMecanismos de busca, para descobertaNão, é uma lista de sugestões, não de permissões
llms.txtUm mapa curado em Markdown das suas melhores páginasSó ferramentas que optam por buscá-loNão, não afeta rastreamento nem indexação

O robots.txt é o único dos três que realmente restringe algo, e mesmo assim de forma voluntária: funciona porque rastreadores bem-comportados o consultam primeiro, não porque um servidor o impõe.

O Google ou algum mecanismo de busca de IA usa o llms.txt?

A própria documentação do Google responde a isso diretamente. O guia do Search Central sobre busca com IA generativa, na seção "Mythbusting generative AI search: what you don't need to do", cita os arquivos LLMS.txt e afirma: "You don't need to create new machine readable files, AI text files, markup, or Markdown to appear in Google Search (including its generative AI capabilities), as Google Search itself doesn't use them" (Você não precisa criar novos arquivos legíveis por máquina, arquivos de texto para IA, marcação ou Markdown para aparecer na Busca Google, incluindo os recursos de IA generativa, já que a própria Busca Google não os usa; página atualizada pela última vez em julho de 2026).

Representantes do Google vêm dizendo o mesmo publicamente há mais de um ano. No Search Central Live de julho de 2025, Gary Illyes disse que o Google não dá suporte ao llms.txt e não tem planos de fazê-lo, comparando-o à antiga meta tag keywords, um sinal que os mecanismos de busca deixaram de confiar quando os donos de sites passaram a controlá-lo. Em janeiro de 2026, depois que a própria plataforma de documentação do Google gerou automaticamente um arquivo llms.txt, John Mueller foi questionado no Bluesky se isso era um endosso: "Tenho vontade de dizer algo irônico, já que isso surge com tanta frequência, mas, para ser direto, não."

Outros fornecedores de IA falaram menos. O que é verificável: Anthropic, OpenAI e Perplexity publicam, cada um, seu próprio llms.txt para a documentação voltada a desenvolvedores (por exemplo platform.claude.com/llms.txt e developers.openai.com/llms.txt), o que só mostra que consideram o formato útil para o próprio site. Isso é diferente de dizer que os rastreadores deles leem um llms.txt no site de outra pessoa antes de responder a uma pergunta, e nenhum dos três publicou isso. A própria documentação de rastreadores da Perplexity descreve o PerplexityBot e o Perplexity-User em detalhes e não menciona o llms.txt. Trate uma afirmação como "o ChatGPT lê o llms.txt" como não verificada até que o próprio fornecedor diga isso.

Vale a pena publicar um mesmo assim?

Provavelmente, por motivos modestos. Um llms.txt é um arquivo estático sem configuração de servidor além de servi-lo como texto simples, então o custo é próximo de zero. O uso real é mais restrito do que "SEO para IA": um agente de código ou assistente de IDE que busca páginas sob demanda ao responder uma pergunta pode usar um llms.txt curto para achar seu guia rápido ou referência de API mais rápido do que adivinhando a partir de um sitemap.

Ele não substitui um serviço construído para agentes agirem: o servidor MCP da própria HostTracker (/pt/mcp-server) é uma interface ativa que um assistente chama para rodar uma verificação ou gerenciar um monitor, não um arquivo que ele só lê. O llms.txt só oferece uma lista de leitura; ele não faz nada acontecer.

Mantenha o arquivo curto e preciso. Um link desatualizado em um arquivo cujo propósito inteiro é ser um mapa confiável é pior do que não ter arquivo nenhum, e não há evidência que ligue o llms.txt a rankings melhores ou mais citações de IA, então não vale a pena enchê-lo de texto de marketing.

Como controlar rastreadores de IA de verdade

Se o objetivo é controlar o que sistemas de IA fazem com o seu conteúdo, o robots.txt com grupos de user-agent nomeados é a alavanca real, não o llms.txt. Cada fornecedor documenta seu próprio token:

  • GPTBot (OpenAI): coleta conteúdo público da web para treinar modelos futuros; a OpenAI o lista separadamente do OAI-SearchBot, usado para resultados de busca, então você pode permitir um e bloquear o outro.
  • ClaudeBot, Claude-User, Claude-SearchBot (Anthropic): o ClaudeBot coleta dados de treinamento, o Claude-User busca uma página para responder a uma pergunta ao vivo de um usuário, e o Claude-SearchBot rastreia para resultados no estilo de busca; a documentação de suporte da Anthropic afirma que os três respeitam o robots.txt.
  • PerplexityBot e Perplexity-User (Perplexity): o PerplexityBot rastreia para exibir e linkar sites nos resultados e, segundo a própria documentação da Perplexity, não é usado para treinar modelos. O Perplexity-User busca uma página ao vivo para uma pergunta específica de um usuário e geralmente ignora o robots.txt, já que a busca é iniciada pelo usuário, não um rastreamento em segundo plano.
  • Google-Extended: um token de robots.txt, não um rastreador com user-agent próprio, que controla se o conteúdo já buscado pelo Googlebot pode treinar futuros modelos Gemini. O Google afirma que bloqueá-lo não tem efeito no ranking nem na indexação da Busca.

Teste suas próprias regras com o testador gratuito de robots.txt: ele verifica se o grupo geral User-agent: * bloqueia uma URL e se a URL está no seu sitemap. Ele ainda não avalia uma regra escrita para um rastreador nomeado específico, então uma URL liberada sob User-agent: * ainda pode estar bloqueada para o GPTBot se esse bot tiver seu próprio grupo mais abaixo no arquivo; por enquanto, verifique os grupos de rastreadores nomeados lendo o arquivo bruto. O guia de como verificar o robots.txt mostra como ler um arquivo manualmente.

Como verificar se o seu llms.txt está acessível

Um llms.txt que um modelo não consegue buscar é pior do que inútil, porque um modelo que tenta uma vez e é bloqueado ou redirecionado não tem como avisar que falhou. Antes de considerar o arquivo no ar, confirme três coisas:

  1. Ele retorna um status 200 simples, não um redirecionamento para uma página de login nem uma página de erro renderizada como 200.
  2. Seu Content-Type é text/plain ou text/markdown, não text/html, o que significaria que um template embrulhou o arquivo em vez de servi-lo bruto.
  3. Ele não é descartado silenciosamente por uma regra de WAF ou de mitigação de bots que sinalize uma requisição incomum por um arquivo de texto na raiz.

Uma verificação rápida pela linha de comando:

curl -I https://example.com/llms.txt

Procure por HTTP/1.1 200 e um content-type que comece com text/. Para confirmar que ele responde da mesma forma fora da sua própria rede, rode a URL pelo verificador de HTTP gratuito, que faz a requisição a partir de várias localidades e mostra o status e o tempo de resposta de cada uma. Depois use o testador de robots.txt para confirmar que um Disallow: / genérico não está escondendo o próprio arquivo llms.txt.

O monitoramento de SEO da HostTracker acompanha os sinais que realmente afetam a visibilidade na busca: meta tags noindex, cabeçalhos X-Robots-Tag e mudanças na tag canonical, além de um rastreamento agendado que cruza as páginas com o robots.txt a cada execução. O llms.txt fica fora de tudo isso.

Perguntas frequentes

O llms.txt substitui o robots.txt?

Não. O robots.txt controla o que os rastreadores podem buscar e existe há três décadas a mais que o llms.txt. Uma página pode estar listada no llms.txt e mesmo assim ser bloqueada no robots.txt, ou o contrário.

Publicar um llms.txt melhora o meu ranking de busca?

Não há evidência disso, e o Google já disse diretamente que seus sistemas de busca, incluindo o AI Overviews, não o usam. Trate-o como uma conveniência para certas ferramentas de desenvolvedor, não como uma tática de SEO.

O que é o llms-full.txt?

Um arquivo complementar que alguns sites publicam junto com o llms.txt, com o conteúdo Markdown completo de cada página vinculada em um único arquivo, para um modelo que não vai seguir links individuais.

O ChatGPT, o Claude ou a Perplexity leem o meu llms.txt automaticamente?

Nenhum fornecedor publicou uma declaração dizendo que seu rastreador ou produto de chat busca e interpreta arquivos llms.txt de outros sites. Os três publicam o próprio llms.txt para a documentação deles, o que é diferente de ler o seu.

Onde devo colocar o arquivo?

Na raiz do site, como /llms.txt, servido como texto simples. A proposta também permite um subcaminho, como /docs/llms.txt, para descrever só aquela seção.

O llms.txt é um padrão oficial?

Não. É uma proposta da comunidade publicada no llmstxt.org, sem nenhum órgão de padronização por trás e sem exigência de que alguma ferramenta o suporte.

Verificar agora

Faça a verificação gratuita no seu próprio site, sem precisar de conta.

Robots.txt tester

Monitorar permanentemente

Seja avisado no momento em que algo quebrar: o HostTracker verifica de mais de 300 localidades e notifica você por e-mail, SMS, Slack, Telegram e mais.

Recursos do HostTracker

Mais nesta seção: Conceitos de monitoramento explicados