SEO & AEO

Como deixar seu site legível para LLMs: guia prático de AEO

Por Vivian Kang
Pumpkin LabsPumpkin ExplicaSérieEnsaio Nº 14
Guia prático de AEO
Como deixar seu site
legível para LLMs
Pumpkin Labs
pumpkin explica · pt-br
pumpkinlabs.io
~12 min · junho 2026
camadas de legibilidade · esquemático
Fig. 01–03
01.
Schema
json-ld article
02.
Headers
perguntas em h2
03.
Recorte
bloco autocontido
schema nas páginas citadas → ≈81% · guia de aeo
S01 · E14
Pumpkin Explica, #14
(Como transformar seu conteúdo em material que as IAs citam de verdade)
TL;DR

O SEO tradicional otimiza páginas para rankearem numa lista de links. O AEO (answer-engine optimization) otimiza para o conteúdo ser extraído e citado dentro da resposta de uma IA. Os dois se complementam: como o ChatGPT busca no Bing e o AI Overviews usa o índice do Google, rankear bem na busca tradicional é o que coloca sua página no conjunto de onde a IA recorta. O AEO não substitui o SEO, ele continua o trabalho dentro da página. As LLMs não "veem" sua página como um humano vê. Elas parseiam o HTML bruto, tokenizam o texto e recortam blocos que respondem diretamente a uma pergunta. Este guia mostra as camadas que realmente funcionam para deixar seu site legível para LLMs, schema Article e FAQPage, headers escritos como perguntas naturais, respostas autocontidas, e o arquivo llms.txt, e por que cada uma importa, com o exemplo de uma empresa que vende cadeiras ergonômicas e quer ser citada quando alguém pergunta "qual a melhor cadeira para home office?".

Você publica o melhor artigo do mundo sobre cadeiras ergonômicas. A IA que responde perguntas sobre o tema nunca cita você. O problema não é seu conteúdo: é que ela não consegue ler seu conteúdo do jeito que você escreveu.

O SEO tradicional nasceu para um mundo em que o usuário via uma lista de links e clicava no que parecia mais relevante. Título, meta description, backlinks, densidade de palavra-chave: tudo isso servia para convencer um algoritmo de busca a te colocar no topo da lista. Mas quando a resposta é gerada por uma LLM, o jogo muda. A IA não te mostra numa lista: ela recorta um trecho do seu texto e o incorpora na resposta dela. E para ser recortado, seu conteúdo precisa ser legível por um robô que só enxerga HTML bruto e tokens, não layout, cores ou branding.

Rankear bem na busca tradicional, aliás, é o primeiro passo do AEO, não o oposto dele. O ChatGPT busca no Bing, o AI Overviews usa o índice do Google e o Perplexity combina vários buscadores: a IA quase sempre recorta de páginas que já aparecem bem ranqueadas. O SEO coloca você no conjunto de candidatos; o AEO decide se, dentro da página, a IA acha uma resposta limpa para recortar. O que atrapalha essa extração não é o SEO, é a forma: parágrafos longos, informação enterrada no meio do texto, headers genéricos como "Introdução" ou "Benefícios". Este guia percorre as camadas que realmente importam para deixar seu site legível para LLMs, usando o exemplo de uma empresa que vende cadeiras ergonômicas e tem um artigo chamado "Melhores cadeiras para home office em 2025". A pergunta que queremos que a IA responda citando a empresa é: "Qual a melhor cadeira ergonômica para home office?".

01 — O diagnóstico

Por que rankear no Google ajuda, mas não basta para as LLMs

A primeira diferença está no que a IA vê. Um buscador tradicional enxerga metadados, backlinks, autoridade de domínio. Já uma LLM, quando consulta uma página, tokeniza o HTML e lê o texto visível como uma sequência linear. Ela não tem um "olhar" para o layout: ela simplesmente processa caracteres. Um título de página bem escrito continua crucial, mas a forma como o conteúdo é estruturado dentro do HTML decide se a IA vai conseguir extrair uma resposta direta.

Na prática, as duas otimizações se reforçam. Análises de respostas com citação mostram forte correlação entre as páginas que a IA cita e as que já ranqueiam bem na busca: aparecer no topo do Bing ou do Google aumenta muito a chance de entrar na resposta da IA. Mas rankear não basta. Ainda é preciso uma mudança de mentalidade dentro da página: você não está escrevendo só para um leitor que vai clicar, está escrevendo também para um parser que vai recortar um trecho e colar na resposta.

O exemplo das cadeiras ergonômicas ilustra bem o problema. Se o artigo "Melhores cadeiras para home office em 2025" começa com um parágrafo introdutório de marketing e depois lista marcas sem responder diretamente "qual é a melhor para dor nas costas?", a IA provavelmente vai ignorar a página. Em vez disso, ela precisa encontrar, logo nos primeiros tokens, uma frase como "A melhor cadeira ergonômica para home office até R$2.000 é a modelo X, pois oferece suporte lombar ajustável e assento em mesh respirável." É essa resposta direta e extraível que a IA procura.

02 — O pipeline

O caminho que a IA percorre até te citar (e onde seu conteúdo cai)

●/02 — o pipeline · pumpkin labs
anim · 16:9 · t = 00:00.00
o caminho da ia até te citar
aeo · 02 / 07
Até te citar, a IA percorre seis passos.
0:00.00
0:26.00

Antes de pensar em táticas, vale entender o caminho que a IA percorre até citar alguém. O processo tem seis etapas, como detalhamos em como o ChatGPT escolhe quem citar. A pergunta do usuário aciona uma função de busca, que devolve uma lista de resultados. A IA então olha apenas o título, a descrição (snippet) e a URL de cada resultado para decidir quais abrir. Depois de abrir de 3 a 10 páginas em paralelo, ela lê o conteúdo e decide o que citar.

Cada etapa filtra páginas. O título e a descrição são tudo o que a IA tem para te escolher antes de te ler. Um título vago como "Cadeiras para home office" perde para "Melhores cadeiras ergonômicas para home office em 2025: testamos 20 modelos". A descrição precisa conter uma promessa concreta: "Comparativo com preços, suporte lombar e conforto para 8 horas de trabalho." Se esses dois campos não convencem, a página nunca é aberta, mesmo que o conteúdo interno seja perfeito.

Depois do clique, a página precisa ser legível pelo crawler. O conteúdo deve vir no HTML inicial (não carregado por JavaScript), sem bloqueios de robots.txt ou paywalls. Dependendo do mês, entre 20% e 36% dos mil maiores sites bloqueiam o GPTBot, o crawler da OpenAI, e a maioria dos crawlers de IA não roda JavaScript. Se o crawler não consegue ler, a citação não acontece. Por fim, o texto precisa responder diretamente à pergunta, de forma autocontida, para ser recortado. No caso das cadeiras, se a pergunta for "Qual a melhor cadeira para dor nas costas?", a resposta precisa estar literalmente escrita em algum lugar, de preferência num H2 ou H3, com a frase exata.

O título e a descrição são tudo o que a IA tem para te escolher antes de te ler. Se eles não convencem, a página nunca é aberta, mesmo que o conteúdo interno seja perfeito.

03 — Schema de artigo

Como deixar seu site legível para LLMs com JSON-LD Article

O schema Article (ou BlogPosting) é o equivalente a dar um RG para sua página. Ele diz explicitamente: "isto é um artigo, publicado nesta data, por este autor, com este título e esta descrição." Dados estruturados são quase onipresentes entre as páginas que a IA cita: uma análise de 9 mil citações encontrou algum schema em cerca de 81% delas, sendo o de autor (Person) o mais comum, perto de 56%. O Article isolado mostra correlação fraca com a citação, então o schema não é um botão mágico, mas faz parte do kit básico de uma página legível por máquina.

A implementação é simples: um bloco JSON-LD no <head> ou no <body> da página, com os campos headline, description, datePublished, dateModified, author e publisher. Para o artigo de cadeiras, seria algo como "headline": "Melhores cadeiras para home office em 2025", "description": "Comparativo com 20 modelos testados, preço, suporte lombar e conforto.", "datePublished": "2025-12-01". O crawler da IA tokeniza esse JSON como texto, mas a informação fica disponível de forma estruturada. Embora algumas LLMs não parseiem o schema semanticamente (elas tratam o JSON como texto plano), a presença do schema ainda aumenta a legibilidade para sistemas como Google AI Overviews e Bing Copilot, que têm infraestrutura de Knowledge Graph.

Vale um aviso: o JSON-LD não substitui o conteúdo visível. Se a resposta que você quer que seja citada não estiver escrita em texto na página, o schema sozinho não resolve. O schema é um complemento que sinaliza o tipo de conteúdo e fornece metadados, mas a citação depende do que está visível no HTML.

04 — FAQPage citável

FAQPage schema: blocos de pergunta-resposta que as LLMs recortam na hora

O FAQPage schema é um dos formatos mais úteis para citação por IA, mas não pelo motivo que muitos pensam. Páginas que combinam dados estruturados (Article, FAQPage, Organization) chegam a ser 2,3 a 2,7 vezes mais citadas do que páginas sem schema algum. Só que o FAQPage sozinho aparece em menos de 2% das páginas que a IA cita, e há evidência de que adicionar schema, por si só, quase não mexe na taxa de citação. O efeito real não vem do JSON-LD, mas do conteúdo visível de FAQ que acompanha toda boa implementação: as LLMs são treinadas para extrair pares de pergunta-resposta do HTML visível, e o FAQ schema tipicamente vem com uma seção de perguntas e respostas no corpo da página.

Para o exemplo das cadeiras, você pode incluir uma seção com perguntas como "Qual a melhor cadeira ergonômica para home office?", "Qual cadeira é melhor para dor nas costas?" e "Qual a melhor cadeira até R$2.000?". Cada pergunta vira um H3 (ou H2), e logo abaixo vem a resposta em um parágrafo curto:

<h3>Qual a melhor cadeira ergonômica para home office?</h3>
<p>Recomendamos o modelo X, que possui suporte lombar ajustável, assento em mesh e custa cerca de R$1.500.</p>

Esse formato é ideal para a IA recortar e citar diretamente.

O JSON-LD para FAQPage deve espelhar exatamente essas perguntas e respostas. Mas lembre-se: o que a IA realmente lê é o texto visível. O JSON-LD oferece uma redundância útil, mas o conteúdo visível é que faz a diferença na extração. Uma boa prática é garantir que a resposta seja autocontida e contenha a informação completa, sem depender de contexto anterior.

Adicionar schema, sozinho, quase não move a taxa de citação. O que move é o conteúdo visível de FAQ: perguntas e respostas que a IA consegue recortar direto do HTML.

05 — Headers AEO

Headers escritos como perguntas naturais, não como rótulos de SEO antigo

●/05 — headers aeo · pumpkin labs
anim · 16:9 · t = 00:00.00
rótulo de seo antigo → pergunta natural
aeo · 05 / 07
Headers genéricos são só rótulos de SEO antigo.
rótulo genérico · seo antigo
pergunta natural · aeo
0:00.00
0:14.00

A hierarquia de headings (H1, H2, H3) é o mapa que a IA usa para navegar seu conteúdo. Um H1 deve conter o título principal, e os H2s e H3s devem quebrar o texto em blocos temáticos. Mas a diferença para AEO está em como você escreve esses headers. Em vez de "Benefícios", escreva "Quais os benefícios de uma cadeira ergonômica para home office?". Em vez de "Comparativo de preços", escreva "Qual a melhor cadeira ergonômica até R$2.000?".

Headers no formato de pergunta funcionam porque a pergunta original do usuário geralmente termina com um ponto de interrogação. A IA procura correspondência entre a pergunta que recebeu e o conteúdo da página. Se o seu H2 diz exatamente "Qual a melhor cadeira para home office?", a chance de a IA considerar aquele bloco como resposta relevante aumenta drasticamente. Estudos mostram que uma hierarquia de headings adequada é um dos fatores que melhoram a crawlability para IA.

Para o artigo de cadeiras, a estrutura pode ser: H1 "Melhores cadeiras para home office em 2025", H2 "Qual a melhor cadeira ergonômica para home office?", com resposta direta; H2 "Qual cadeira é melhor para dor nas costas?", com resposta; H2 "Qual a melhor cadeira até R$2.000?", com resposta. Cada bloco de resposta deve ter de 2 a 4 frases, ser autocontido e incluir dados concretos (preço, características). Isso é o que a IA consegue recortar e citar com confiança.

06 — Mais táticas

Outras camadas de legibilidade: respostas autocontidas, llms.txt, entidades consistentes

Além de schema e headers, algumas camadas extras fazem a diferença na prática para deixar seu site legível para LLMs. A primeira são as respostas autocontidas. Cada bloco de resposta deve funcionar sozinho, sem precisar de contexto de parágrafos anteriores. Se o usuário pergunta "Qual a melhor cadeira para home office?", a resposta precisa incluir o modelo, o preço e o motivo, tudo na mesma frase ou no mesmo parágrafo. Evite "como vimos na seção anterior" ou "este modelo está listado abaixo".

O arquivo llms.txt é um padrão comunitário que oferece um resumo estruturado do site para LLMs. Colocado na raiz do servidor, ele lista as páginas mais importantes e fornece um resumo do que cada uma contém. Embora ainda não haja adoção oficial dos grandes provedores de LLM, ter um llms.txt bem feito é um sinal de boas práticas e pode ser consumido por crawlers que buscam um atalho para navegar pelo site. Para o site de cadeiras, o llms.txt poderia listar o artigo principal e incluir um resumo com as recomendações.

Outro ponto é a consistência de entidades. Use sempre o mesmo termo para se referir ao mesmo conceito. Se você chama de "cadeira ergonômica" em um parágrafo e de "assento de escritório" em outro, a IA pode não conectar os pontos. Manter a terminologia uniforme (por exemplo, sempre "cadeira ergonômica") ajuda a IA a entender que aquele é o tópico central. Por fim, incluir referências a fontes confiáveis (pesquisas, institutos, relatórios) aumenta a visibilidade em torno de 25% em média, e pode passar de 100% para páginas que hoje ranqueiam mais abaixo, segundo o estudo GEO; somadas, as técnicas de otimização para motores generativos chegam a elevar a visibilidade em até 40%.

07 — A Pumpkin

Antes de otimizar, descubra como sua marca aparece hoje nas IAs

A Pumpkin Labs ajuda empresas a construir agentes de IA confiáveis, e uma parte fundamental desse trabalho é entender como o conteúdo da marca é enxergado pelas LLMs hoje. Antes de sair implementando schema, reescrevendo headers e criando FAQs, é preciso diagnosticar: quando alguém pergunta sobre cadeiras ergonômicas para home office, a sua empresa é citada? Se não, em qual etapa do pipeline você está perdendo? Pode ser que o título e a descrição não estejam convencendo a IA a abrir a página, ou que o conteúdo não tenha respostas autocontidas, ou que o crawler esteja bloqueado.

A gente mapeia essa presença usando consultas reais às principais plataformas de IA e analisa o que elas veem do seu site. Depois, priorizamos as ações que vão ter o maior impacto: ajustar o schema, reestruturar headers, adicionar FAQPage, ou até mesmo criar conteúdo novo que responda diretamente às perguntas que os usuários estão fazendo. Cada mudança é orientada por dados, não por achismo, e é assim que a visibilidade nas IAs sobe, junto com os leads que ela traz.

Aparecer nas respostas das IAs externas, porém, é só uma das pontas. A outra é a sua própria IA. Depois que o diagnóstico aponta onde você perde visibilidade, a Pumpkin também constrói o agente que atende o topo do funil dentro do seu site: ele qualifica a intenção de quem chega, recomenda o produto certo e converte na própria conversa, sem redirecionar pra lugar nenhum. É o que a gente chama de B2A, business-to-agent: de um lado, ser citado pelas IAs que respondem antes do clique; do outro, ter um agente que responde com a autoridade de quem conhece o seu catálogo. O diagnóstico cuida de uma ponta, o agente cuida da outra, e o mesmo conhecimento estruturado que deixa seu conteúdo legível para uma LLM de fora é o que alimenta a sua.

Glossário rápido
Glossário rápido
Tokenização
O processo de quebrar o texto em unidades menores (tokens) que a LLM processa. Uma palavra comum vira um token, palavras raras viram vários. A tokenização determina como a IA "lê" seu conteúdo.
Crawler
Robô que percorre páginas da web e guarda o conteúdo no índice do buscador. O crawler da OpenAI para busca ao vivo é o OAI-SearchBot; o de treino é o GPTBot.
JSON-LD
Formato de dados estruturados que você insere no HTML para declarar metadados sobre a página, como schema Article ou FAQPage. É lido como texto plano pelas LLMs, mas parseado semanticamente por sistemas como Google e Bing.
Schema Article
Bloco JSON-LD que declara que sua página é um artigo, com campos como headline, datePublished, author e description. Ajuda a IA a reconhecer a página como fonte autoritativa.
FAQPage schema
Bloco JSON-LD que declara uma seção de perguntas e respostas. O ganho de citação vem sobretudo do conteúdo visível de FAQ que acompanha o schema, não do JSON-LD em si.
llms.txt
Arquivo de texto colocado na raiz do servidor que lista as páginas mais importantes do site e fornece um resumo para LLMs. Ainda sem adoção oficial, mas é uma boa prática.
Resposta autocontida
Bloco de texto que funciona sozinho, sem precisar de contexto de parágrafos anteriores. Essencial para ser recortado e citado por LLMs.
FAQ · Perguntas frequentes

Como deixar seu site legível para LLMs?

Para deixar seu site legível para LLMs, você precisa estruturar o conteúdo em blocos que a IA consiga recortar e citar diretamente. Isso inclui usar schema Article e FAQPage no JSON-LD, escrever headers no formato de perguntas naturais (como "Qual a melhor cadeira para home office?"), manter respostas autocontidas de 2 a 4 frases, e garantir que o HTML inicial contenha o texto visível sem depender de JavaScript. O arquivo llms.txt na raiz do servidor também ajuda crawlers a navegar pelo site.

Qual a diferença entre SEO e AEO para legibilidade de IA?

O SEO tradicional otimiza páginas para rankear numa lista de links, focando em metadados, backlinks e autoridade. O AEO (answer-engine optimization) otimiza o conteúdo para ser extraído e citado dentro da resposta de uma IA. Os dois se complementam: como o ChatGPT busca no Bing e o AI Overviews usa o índice do Google, rankear bem é o que coloca sua página no conjunto de onde a IA recorta, e o AEO garante que ela ache ali uma resposta limpa para citar. A diferença de mecânica é que a IA não 'vê' layout ou branding: ela parseia o HTML bruto e recorta blocos que respondem diretamente a uma pergunta.

O que é schema Article e como ele ajuda na citação por IA?

O schema Article (ou BlogPosting) é um bloco JSON-LD que declara explicitamente que sua página é um artigo, com campos como headline, datePublished, author e description. Dados estruturados aparecem em cerca de 81% das páginas citadas por IA, então são quase um pré-requisito, ainda que o Article isolado mostre correlação fraca com a citação. Ele funciona como um RG para o crawler, sinalizando tipo de conteúdo e autoria. Mas o schema não substitui o texto visível: a citação depende do que está escrito no HTML, não apenas do JSON-LD.

Como o FAQPage schema aumenta as chances de ser citado?

O ganho vem menos do JSON-LD e mais do conteúdo visível de FAQ que acompanha a implementação: perguntas em H3 seguidas de respostas curtas e autocontidas, que as LLMs são treinadas para extrair do HTML. Páginas que combinam dados estruturados (Article, FAQPage, Organization) chegam a ser 2,3 a 2,7 vezes mais citadas do que páginas sem schema algum, mas o FAQPage sozinho aparece em menos de 2% das páginas citadas, e adicionar schema, por si só, quase não move a taxa de citação. Para o efeito valer, cada resposta precisa funcionar sozinha, sem depender de contexto anterior.

Por que headers em formato de pergunta melhoram a legibilidade para IA?

Headers escritos como perguntas naturais (ex: "Qual a melhor cadeira ergonômica para home office?") funcionam porque a pergunta original do usuário geralmente termina com um ponto de interrogação. A IA procura correspondência entre a pergunta que recebeu e o conteúdo da página. Se o seu H2 diz exatamente a mesma frase, a chance de a IA considerar aquele bloco como resposta relevante aumenta drasticamente. Estudos mostram que uma hierarquia de headings adequada melhora a crawlability para IA.

O que é o arquivo llms.txt e como ele ajuda?

O llms.txt é um padrão comunitário que oferece um resumo estruturado do site para LLMs, colocado na raiz do servidor. Ele lista as páginas mais importantes e fornece um resumo do que cada uma contém. Embora ainda não haja adoção oficial dos grandes provedores de LLM, ter um llms.txt bem feito é um sinal de boas práticas e pode ser consumido por crawlers que buscam um atalho para navegar pelo site. Para um site de cadeiras, ele poderia listar o artigo principal com as recomendações.

O que são respostas autocontidas e por que são importantes?

Respostas autocontidas são blocos de texto que funcionam sozinhos, sem precisar de contexto de parágrafos anteriores. Se o usuário pergunta "Qual a melhor cadeira para home office?", a resposta precisa incluir o modelo, o preço e o motivo, tudo na mesma frase ou no mesmo parágrafo. Evite expressões como "como vimos na seção anterior" ou "este modelo está listado abaixo". As LLMs recortam blocos isolados, e uma resposta autocontida tem muito mais chance de ser citada com precisão.
Referências
  • Aggarwal, P. et al. GEO: Generative Engine Optimization. Proceedings of ACM SIGKDD (KDD), 2024.
  • AccuraCast. Does Schema Markup for AI Search Matter?. AccuraCast, setembro de 2025.
  • Ahrefs. Does Schema Markup Affect AI Citations?. Ahrefs Blog, 2025.
  • BrightEdge. Structured Data and AI Citation Rates. BrightEdge Research, 2026.
  • Originality.ai. AI Bot Blocking: GPTBot Block Rates. Originality.ai, 2024.
  • Dejan Marketing. How ChatGPT Search Results Work. Dejan Marketing, 2024.
  • OpenAI. ChatGPT Search. OpenAI Help Center, 2024.
  • OpenAI. Overview of OpenAI Crawlers (GPTBot, OAI-SearchBot). OpenAI Developers, 2025.
  • Vercel / MERJ. The Rise of the AI Crawler. Vercel, 2025.
O AEO não é um conjunto de truques, é uma mudança de paradigma na forma de escrever e estruturar conteúdo. A boa notícia é que muitas dessas mudanças são incrementais e podem ser feitas sem refazer o site inteiro. O resultado é um site que não só rankeia bem em buscadores, mas também é citado de verdade pelas LLMs.

Gostou do conteúdo?

Entre em contato conosco para descobrir como implementar essas soluções na sua empresa.