Inteligência Artificial

Ontologia e grafo de conhecimento: a arquitetura que faz a IA parar de chutar

Por Vivian Kang
Pumpkin LabsPumpkin ExplicaSérieEnsaio Nº 13
Fatos soltos não
formam significado
O grafo entrega os fatos certos, mas é a ontologia que diz quais combinações são válidas, e sem ela toda pergunta composta vira um palpite.
Pumpkin Labs
Ontologia e grafo de conhecimento
Por Vivian Kang · Co-fundadora
pumpkinlabs.io
~13 min · jun 2026
As camadas do significado · esquemático
Fig. 13
01.
Grafo
fatos atômicos
02.
Ontologia
a gramática
03.
Verbalizar
só o verificado
Nota da editora: décimo terceiro post da série Pumpkin Explica. No post anterior a gente mostrou como o GraphRAG resolve perguntas multi-hop transformando a recuperação numa travessia de grafo. Agora a pergunta é outra: uma vez que o grafo traz os fatos certos, isso basta pra resposta ser correta? A resposta é não, e é por isso que a engenharia de um agente confiável exige mais do que um grafo. Este post constrói sobre a base do anterior e avança para as camadas que separam um sistema que parece certo de um que de fato está certo.
Pumpkin Explica, #13
(Ontologia, orquestração e verbalização: o que falta entre o grafo e a resposta correta)
TL;DR

O GraphRAG entrega os fatos certos, mas fatos soltos não formam significado. Uma jaqueta "azul", "impermeável", "até R$200", "tamanho M" vira quatro nós no grafo, nenhum deles diz como combinar essas restrições. Sem uma camada de significado explícito (uma ontologia) que defina quais combinatórias são válidas e quais são proibidas, o LLM vai juntar azul e R$100 achando que resolveu, e vai errar. Este post mostra as quatro camadas que transformam grounding em correção: o grafo dá a fundamentação factual, a ontologia impõe as regras de combinação, o orquestrador traduz a intenção numa consulta validada e o LLM vira um verbalizador que só escreve o que já foi verificado. A ordem importa, e pular uma camada é o caminho mais rápido para uma resposta que parece certa mas não está.

O catálogo diz que existe uma jaqueta azul, que existe uma jaqueta impermeável, e que existe uma jaqueta até R$200. Três fatos verdadeiros no grafo. Só que a jaqueta azul custa R$250, a impermeável é tamanho G, e a de R$200 é verde. O grafo não impediu a combinação errada, ele só disse que as três existem.

O post anterior mostrou que o GraphRAG resolve o problema de encadear fatos que nunca aparecem juntos no mesmo parágrafo. Para o exemplo do compliance, ele conecta X, Z, Y e a sanção numa travessia que revela a relação indireta. Mas e quando a pergunta não é sobre existência de uma relação, e sim sobre uma restrição combinatória? A consulta "jaqueta azul impermeável até R$200, tamanho M, com entrega em 2 dias" não pergunta se cada atributo existe isoladamente: ela pergunta qual produto satisfaz todos ao mesmo tempo.

O grafo sabe que existe um nó Cor: Azul, um nó Feature: Impermeável, um nó Preço: R$200, um nó Tamanho: M e um nó Prazo: 2 dias. Ele pode até ligar cada um desses nós a produtos diferentes. Mas ele não sabe, sozinho, que a combinação "Azul + Impermeável + R$200 + M" é um único produto ou uma interseção impossível. O grafo dá a verdade dos fatos, mas não impõe o significado de juntá-los. Esse salto exige uma camada a mais, e é o que este post descreve.

01 — O diagnóstico

Por que o grafo de conhecimento sozinho não garante o significado

●/01 — o diagnóstico · pumpkin labs
anim · 16:9 · t = 00:00.00
grafo confirma cada fato · não impõe a combinação
pumpkin explica · 13 · §01
O catálogo tem três jaquetas, cada uma com seus atributos.
0:00.00
0:24.00

O grafo de conhecimento é excelente para representar fatos atômicos: "A Jaqueta A é azul", "A Jaqueta B é impermeável", "A Jaqueta C custa R$200". Cada afirmação é uma aresta entre um nó de produto e um nó de atributo, e o grafo é fiel aos dados: se o dado diz que a Jaqueta A é azul, a aresta existe; se não diz, não existe. Mas o significado de uma pergunta composta não está nos fatos individuais, está na regra de combinação entre eles. "Azul E impermeável E até R$200 E tamanho M" é uma conjunção lógica, e o grafo não tem operadores lógicos: ele tem nós e arestas. Um LLM que recebe o subgrafo com os três fatos tende a combiná-los mesmo assim, porque a linguagem natural permite essa composição. É o mesmo mecanismo que faz um LLM alucinar uma conexão que não existe no grafo: ele completou o padrão com o que parecia fazer sentido.

O grafo responde "existe um produto azul?" (sim) e "existe um produto impermeável?" (sim), mas não sabe responder "existe um produto que é azul E impermeável?" se essas duas arestas apontam para produtos diferentes. A ausência de uma tripla que una os dois atributos no mesmo sujeito força o LLM a inferir uma combinação que não está representada. O grafo é um modelo de dados baseado em triplas sujeito-predicado-objeto; ele não implementa, por si só, operações de junção entre propriedades de sujeitos distintos. Por isso, sem uma camada que discipline essas combinações, o LLM vai criar ligações falsas.

O grafo diz o que é verdade. Ele não diz o que é permitido combinar. E o LLM, sozinho, vai combinar tudo o que puder.

02 — A camada de significado

Ontologia: a gramática dos fatos no grafo de conhecimento

●/02 — a camada de significado · pumpkin labs
anim · 16:9 · t = 00:00.00
ontologia · a gramática das combinações
pumpkin explica · 13 · §02
A ontologia separa os atributos em categorias.
0:00.00
0:25.00

A primeira camada que falta é a ontologia. Uma ontologia é uma especificação explícita das categorias de entidades que existem no domínio e de como elas podem se relacionar. No e-commerce, ela define que Cor, Feature, Preço, Tamanho e Prazo são categorias distintas de atributos, e que um produto pode ter exatamente um valor de cada categoria. A ontologia transforma o grafo de uma coleção de fatos soltos numa estrutura disciplinada: ela não cria novos fatos, mas organiza os existentes e, mais importante, define o que é uma pergunta válida.

Na prática, uma ontologia declara as classes que existem (Produto, Cor, Feature) e as propriedades que ligam umas às outras (temCor, temFeature), e impõe restrições sobre elas: "temCor" liga um Produto a uma Cor, e nada mais; "impermeável" só pode ser atribuída a um produto da classe vestuário externo. Uma consulta que pede "azul, impermeável, R$200, M" é, então, decomposta pela ontologia numa verificação de consistência: existe um produto cujo nó de cor é "Azul", cujo nó de feature inclui "Impermeável", cujo nó de preço está na faixa "até R$200", cujo nó de tamanho é "M", e cujo nó de prazo é "2 dias"? A ontologia valida se todas as categorias estão presentes e se as combinações são permitidas.

Ela também impõe restrições específicas: "Impermeável" só pode ser aplicado a vestuário externo, não a acessórios; "tamanho M" só existe para roupas, não para sapatos. Sem essa gramática, o LLM trata "azul" e "impermeável" como dois adjetivos que podem ser somados livremente. Com ela, a consulta vira uma interseção de conjuntos, não uma soma de adjetivos. A ontologia é o que impede o modelo de juntar azul e R$100 como se fosse uma combinação óbvia, porque ela sabe que essas duas categorias não se misturam sem verificação de produto.

A ontologia é a gramática que impede o modelo de combinar atributos que nunca estiveram juntos. Sem ela, toda pergunta composta é um palpite.

03 — A ponte

Orquestração semântica: da intenção à consulta validada sobre o grafo

A ontologia organiza os fatos, mas ela não fala diretamente com a pergunta do usuário. Alguém precisa traduzir "jaqueta azul impermeável até R$200" numa consulta que respeite a ontologia. Essa é a função da orquestração semântica, a camada que fica entre o usuário e o grafo.

A orquestração faz três coisas, nessa ordem. Primeiro, lê a pergunta em linguagem natural e separa cada pedaço na categoria certa da ontologia: "azul" é uma cor, "impermeável" é uma feature, "até R$200" é uma faixa de preço, "M" é um tamanho, "2 dias" é um prazo. Depois, ela confere essa combinação contra as regras da ontologia antes de tocar no grafo: as categorias existem, podem coexistir num mesmo produto, e nenhuma viola uma restrição do domínio. Só então monta a consulta ao grafo e a executa. Se a combinação não fecha, a orquestração para ali e devolve um aviso, sem nunca passar a bola pro LLM.

Essa separação é o que distingue um sistema que parece inteligente de um que é confiável. A orquestração não adivinha o que o usuário quis dizer: ela aplica a gramática do domínio para transformar intenção em consulta, e só deixa passar o que é válido. É a ponte que impede o LLM de combinar atributos incompatíveis antes mesmo de ele ver qualquer resultado.

A orquestração semântica é a ponte que impede o LLM de combinar atributos incompatíveis antes mesmo de ele ver o resultado da consulta.

04 — O verbalizador

LLM: só escrever o que já foi verificado pelo grafo e pela ontologia

Depois que a orquestração validou a consulta e o grafo devolveu o resultado, o que resta para o LLM fazer é verbalizar. O modelo recebe a resposta estruturada (uma lista de produtos que satisfazem as restrições) e a transforma em linguagem natural. Ele não precisa mais "pensar" sobre a resposta: ela já foi determinada pelas camadas anteriores. Essa é a função mais enxuta e mais rigorosa do LLM num harness bem projetado. O modelo não infere, não completa, não adivinha. Ele só escreve o que já foi verificado.

Na prática, a verbalização funciona assim: o prompt inclui uma instrução explícita, "Com base nos dados fornecidos, escreva uma resposta. Não adicione nenhuma informação que não esteja nos dados." O LLM recebe os fatos como contexto (por exemplo, uma lista formatada de produtos com seus atributos) e gera uma frase ou parágrafo que os descreve. Ainda assim, o modelo pode, por inércia, adicionar um "mais vendido" ou "melhor avaliado" que não está no resultado. Por isso a instrução precisa ser acompanhada de guardrails que bloqueiam inserções não autorizadas, como uma verificação pós-geração que compara a saída com os fatos originais.

O princípio é claro: quando o LLM só verbaliza, o chute estrutural é eliminado. Ele não decide se a jaqueta azul é impermeável: ele escreve que o grafo disse que uma jaqueta específica tem cor azul e é impermeável. O LLM vira um tradutor de dados estruturados para linguagem natural. Quanto mais ele "pensa" sobre a resposta, mais chance de errar.

O LLM vira um tradutor de dados estruturados para linguagem natural. Quanto mais ele "pensa" sobre a resposta, mais chance de errar.

05 — A Pumpkin

Onde a Pumpkin entra

O harness da Pumpkin sempre colocou o grafo de conhecimento no centro, como o post anterior mostrou. Mas o grafo é só o começo: a engenharia de um agente confiável exige que a gente construa as três camadas ao redor dele, a ontologia que organiza os fatos em categorias coerentes, a orquestração semântica que traduz intenção em consulta validada, e a verbalização controlada que impede o LLM de extrapolar. Cada uma dessas camadas é desenhada para o domínio específico do cliente: a ontologia de um e-commerce é diferente da ontologia de compliance, que é diferente da ontologia de uma seguradora. O que não muda é o princípio: o LLM não decide a resposta, ele só escreve o que foi verificado em cada uma das camadas, e a ordem importa, primeiro o grafo fundamenta, depois a ontologia impõe as regras de combinação, depois a orquestração valida a consulta, e só então o LLM verbaliza.

O que está provado e o que é interpretação

Formalizado. A representação de conhecimento via ontologias é um campo maduro, com semântica formal definida (Guarino, 1998; Gruber, 1995). A validação de consultas contra restrições de domínio é um algoritmo clássico de inferência em lógica descritiva. O pipeline de orquestração (extração, mapeamento, validação, consulta) segue o padrão de sistemas de perguntas e respostas baseados em conhecimento, com décadas de uso em produção.

Interpretação (consistente, não um teorema fechado). Que a verbalização controlada reduz alucinações a zero é uma prática de engenharia de prompt, apoiada por evidências empíricas, mas não provada formalmente. A afirmação de que a ordem das camadas impede erros combinatórios é um princípio de design, coerente com a teoria de sistemas multiagente, mas sujeita a falhas de implementação (ex.: ontologia incompleta, orquestração com falsos positivos). Apresentamos como modelo mental robusto, não como resultado fechado.

Glossário rápido
Ontologia
Especificação explícita das categorias de entidades e das regras de relacionamento entre elas em um domínio. Define quais classes existem, quais propriedades as ligam e quais combinações são válidas.
Orquestração semântica
Camada que traduz a pergunta do usuário em uma consulta estruturada, extraindo intenções atômicas e validando-as contra a ontologia antes de enviá-las ao grafo.
Verbalização
Processo controlado em que o LLM recebe dados estruturados (resultado da consulta) e os transforma em linguagem natural, sem adicionar informações externas.
Grounding
Fundamentação factual das respostas em dados verificáveis, geralmente fornecida por um grafo de conhecimento.
GraphRAG
Técnica de recuperação que percorre um grafo de conhecimento para encontrar fatos relacionados, resolvendo perguntas multi-hop.
Grafo de conhecimento
Banco de dados baseado em nós e arestas que representa entidades e suas relações como triplas sujeito-predicado-objeto.
FAQ · Perguntas frequentes

O que é ontologia em um grafo de conhecimento?

Ontologia é uma especificação explícita das categorias de entidades e das regras de relacionamento entre elas dentro de um domínio. Num grafo de conhecimento de e-commerce, a ontologia define que Cor, Feature, Preço, Tamanho e Prazo são categorias distintas e que um produto pode ter exatamente um valor de cada. Ela também impõe restrições, como "impermeável só se aplica a vestuário externo", impedindo combinações inválidas.

Por que o grafo de conhecimento sozinho não garante respostas corretas?

O grafo de conhecimento representa fatos atômicos verdadeiros, mas não tem operadores lógicos para combinar restrições. Ele pode dizer que existe um produto azul e que existe um produto impermeável, mas não consegue responder se existe um produto que é azul E impermeável se esses atributos pertencem a produtos diferentes. Sem uma ontologia que discipline as combinações, o LLM pode fundir atributos de forma incorreta.

Como a ontologia e o grafo de conhecimento trabalham juntos?

A ontologia organiza os fatos do grafo em categorias coerentes e define quais combinações são válidas. O grafo fornece a fundamentação factual (nós e arestas), e a ontologia impõe a gramática de como esses fatos podem ser combinados. Juntos, eles permitem que uma consulta como "jaqueta azul impermeável até R$200" seja decomposta em interseções de conjuntos, e não em soma de adjetivos.

O que é orquestração semântica e qual seu papel?

Orquestração semântica é a camada que traduz a pergunta em linguagem natural em uma consulta estruturada que respeita a ontologia. Ela extrai intenções atômicas (ex.: "azul" vira cor:azul), valida a combinação contra as regras da ontologia, e só então envia a consulta ao grafo. Se a combinação for inválida, ela retorna um erro sem envolver o LLM.

Qual a diferença entre GraphRAG e ontologia?

GraphRAG é uma técnica de recuperação que percorre o grafo de conhecimento para encontrar fatos relacionados, resolvendo perguntas multi-hop. Ontologia é uma camada de significado que define regras de combinação entre esses fatos. O GraphRAG entrega os fatos certos, mas a ontologia é necessária para garantir que a combinação deles faça sentido e que a resposta seja correta.

Como garantir que o LLM não invente informações ao verbalizar a resposta?

A verbalização controlada restringe o LLM a escrever apenas o que foi verificado pelas camadas anteriores: o grafo, a ontologia e a orquestração. O modelo recebe uma instrução explícita para não adicionar informações novas, e guardrails bloqueiam inserções não autorizadas. Dessa forma, o LLM vira um tradutor de dados estruturados para linguagem natural, sem espaço para inferência ou alucinação.
Referências
  • Guarino, N. Formal Ontology in Information Systems. IOS Press, 1998.
  • Gruber, T. Toward Principles for the Design of Ontologies Used for Knowledge Sharing. International Journal of Human-Computer Studies, 1995.
  • Hogan, A. et al. Knowledge Graphs. ACM Computing Surveys, 2021.
  • Pan, J. Z. et al. Ontology-Driven Knowledge Graphs. Springer, 2024.
Décimo terceiro post da série Pumpkin Explica. O grafo de conhecimento é o alicerce, mas a correção exige uma ontologia que discipline as combinações, uma orquestração que valide a consulta e uma verbalização que impeça o LLM de extrapolar. É esse pipeline completo que transforma um agente que parece certo em um que de fato está certo.

Gostou do conteúdo?

Entre em contato conosco para descobrir como implementar essas soluções na sua empresa.