O modelo não é o problema.
O harness é.
Construímos o runtime em volta do modelo — a camada que separa um protótipo frágil de um sistema que aguenta produção.
Bem-vindo à Era B2A.
O mundo mudou. Seus clientes já não buscam sozinhos.
Hoje, uma parcela crescente das pesquisas de compra, comparação e decisão passa por agentes de IA — ChatGPT, Perplexity, Claude, Gemini. Esses agentes não clicam em anúncios. Não leem blogs por acaso. Eles buscam fontes estruturadas, confiáveis e bem indexadas para compor as respostas que dão aos seus usuários.
Esse novo modelo de descoberta tem nome: Business-to-Agent (B2A). E ele acontece em dois momentos críticos:
Quando um consumidor pergunta ao ChatGPT pelo melhor fornecedor do seu segmento — a resposta é você, ou seu concorrente?
Comércio conversacional substituiu o browsing. Seu cliente quer conversar com sua marca — você tem um agente pronto pra atendê-lo, ou ele segue pro próximo?
Assim como empresas que ignoraram o SEO perderam tráfego por anos, empresas que ignorarem o B2A perderão relevância antes de perceber.
A Pumpkin resolve as duas pontas do B2A: te coloca nas respostas das IAs grandes e estrutura a sua pra responder com autoridade.
A engenharia que rende não está dentro do modelo — está em torno dele.
É o que a gente chama de harness: as seis funções que cercam o modelo e decidem se a IA acerta ou alucina sobre os seus dados — grounding, guardrails, memória, observabilidade, resiliência e orquestração.
Veja na prática: ler o case completoA IA que fala por você. E a IA que fala de você.
Dois agentes construídos sobre o mesmo harness — um no chat, um na voz — e um diagnóstico do outro lado do espelho: o que ChatGPT, Claude, Gemini e Perplexity respondem quando perguntam da sua marca.
Pumpkin Agentes
A IA que atende seu cliente — verificada a cada resposta.
Não é um chatbot com prompt caprichado: é um harness em volta do modelo. O agente conversa, qualifica, cota, recomenda e executa — e nenhuma resposta chega ao cliente sem passar por um validador. Aceita texto, áudio e imagem no mesmo fio de conversa.
É o mesmo motor com a inteligência do seu negócio plugada: trocar de operação é trocar o domínio, não reconstruir o agente.
- + Custo previsível por arquitetura — cai com o volume, em vez de subir
- + Soberania de dados: roda na sua infraestrutura, sem lock-in com Big Tech
- + Controle total do stack — o roadmap do modelo é seu, não do fornecedor
- + Guardrails determinísticos: dado crítico verificado na fonte, nunca afirmado pelo modelo
- + Entrada multimodal: texto, áudio e imagem
Realtime Voice
O mesmo agente, agora segurando uma ligação.
Voz em tempo real, no ritmo de uma conversa humana. Não é um TTS lendo resposta de chatbot: são os mesmos agentes, as mesmas tools, o mesmo validador e o mesmo estado do Pumpkin Agentes, com o canal trocado.
O agente que qualifica no WhatsApp é o que atende no telefone — e a conversa continua de onde parou.
- + As mesmas garantias: custo previsível, soberania, controle e guardrails
- + Latência de conversa real, sem espera constrangedora entre turnos
- + Estado compartilhado com o canal de texto
- + Receptivo e ativo: SAC, call center, cobrança e agendamento
Pumpkin Diagnóstico
O outro lado do espelho: como sua marca aparece nas LLMs.
Saiba exatamente o que o ChatGPT, Perplexity, Claude e Gemini falam da sua marca, dos seus produtos e dos seus concorrentes. Monitoramento contínuo, análise comparativa e recomendações acionáveis pra entrar (ou subir) nas respostas certas.
- + Monitoramento das principais LLMs em queries do seu segmento
- + Análise comparativa: quem é citado, em qual posição, com qual tom
- + Recomendações práticas pra ganhar (ou recuperar) presença
- + Acompanhamento da evolução ao longo do tempo
Seis funções que o modelo não executa sozinho.
O modelo só faz uma coisa: gerar a próxima palavra. As outras seis — buscar o fato certo, impor limites, lembrar, vigiar, recuperar e coordenar — são o harness que a Pumpkin constrói em volta dele.
Como uma corretora de seguros escalou o topo do funil sem escalar o custo
Topo de funil automatizado de ponta a ponta, leads entregues prontos para fechar e um custo por conversa que cai conforme o volume cresce.
Quem depende de API de terceiro não controla a sua IA.
Nem o que ela responde, nem quanto custa quando ela escala.
O Knowledge Graph é o cérebro da sua IA.
Sua IA é tão boa quanto o conhecimento que ela tem do seu negócio. E aí está o problema: a maioria dos sistemas de IA empilha pedaços de texto soltos e torce pra que façam sentido juntos. A Pumpkin faz diferente.
O Knowledge Graph é uma representação estruturada do seu negócio — produtos, categorias, regras, políticas, histórico — e das relações entre tudo isso. Não é um banco de dados. Não é um vector store. É um mapa do seu domínio que a IA navega como um especialista navegaria.
É a diferença entre um vendedor que decorou o catálogo e um que entende o cliente, o produto, a política da casa, e sabe o que faz sentido conectar.
Tecnicamente: graph traversal sobre relações semânticas — não vector similarity sobre chunks.
Performance de fronteira, comprovada em produção.
O que acontece quando você libera o time humano pros leads que realmente importam.
Construímos um agente pra uma empresa que opera um funil consultivo de alto volume. Antes da Pumpkin, o time humano atendia todos os leads que chegavam — o que limitava velocidade, cobertura e foco. Com a Pumpkin, o assistente faz a primeira camada de atendimento e qualificação: conversa em volume, em escala, 24/7, e identifica os leads com fit real pra entregar ao time humano fechar.
Taxa do agente Pumpkin qualificando leads contra 15% do time humano fazendo o mesmo trabalho antes — com volume e velocidade que o time sozinho não conseguia atender.
Dos clientes que receberam a mensagem de abertura, 37,9% responderam — entrando ativamente na conversa.
Quando o assistente insiste com elegância em uma resposta faltante, 22,7% dos casos voltam pro fluxo.
Eficácia das tentativas de reativar conversas inativas — sem precisar de operador humano.
O time humano de vendas continua fechando. A Pumpkin garante que ele só atende quem importa.
Não é um TTS em cima de um chatbot. É o harness falando.
Voz em tempo real segurando uma conversa no ritmo de uma ligação humana — com o mesmo cérebro que já responde no chat. Os agentes, as tools, o validador e o estado são os mesmos. Nada é reimplementado para a voz existir.
Voz sintética sobre bot genérico
Uma voz lendo respostas sem verificação, sem estado e sem regra de negócio. Cada canal vira um projeto novo, com os mesmos riscos de sempre.
O mesmo harness, em tempo real
Validador, guardrails, tools, estado e follow-up do Pumpkin Agentes, agora segurando uma ligação. O agente que qualifica no WhatsApp atende no telefone, e a conversa continua de onde parou.
Nenhuma métrica de voz publicada até aqui, de propósito: número só entra nesta página quando for medido em produção.
Quero ouvir uma demoUm motor. Muitas operações.
O motor não sabe nada do seu produto: cada operação é um domínio plugado nele. É por isso que o mesmo agente que cota seguro no WhatsApp fecha uma venda no e-commerce e atende uma ligação de SAC.
Da conversa ao pagamento, sem sair do fio.
O agente não entrega o cliente para um site. Ele entende, recomenda, monta o carrinho e cobra dentro da própria conversa — e os dois passos onde a maioria dos chatbots quebra, carrinho e pagamento, passam por contrato de tool, nunca por texto gerado pelo modelo.
- 01Conversa
Entende a intenção em linguagem natural — por texto, por áudio ou por uma foto do produto.
- 02Recomendação
O knowledge graph do catálogo escolhe o item certo. Preço e disponibilidade são carregados na fonte antes de o modelo falar.
- 03Carrinho
O agente monta o carrinho por tool call. O modelo não escreve o pedido: ele executa uma ação verificada.
- 04Pagamento
Checkout gerado dentro da conversa. Sem redirecionamento, sem link perdido, sem carrinho abandonado no meio do caminho.
- 05Pós-venda
Status, rastreio, troca e recompra continuam no mesmo fio, com o histórico inteiro em estado durável.
Call center e SAC
Atendimento receptivo em tempo real, sem fila e sem script. O agente resolve o que dá para resolver e transfere o resto com o contexto inteiro — o humano não precisa pedir para o cliente repetir.
Cobrança ativa
Contato ativo em escala, com tom sob medida e registro verificado do que foi combinado. A insistência educada é comportamento do agente, não tarefa de operador.
Agendamento e confirmação
Marca, remarca e confirma consultando disponibilidade real por tool. A agenda que o agente informa é a agenda que existe.
Seguros · topo de funil
Qualifica, cota e entrega o lead pronto para o time humano fechar. É o caso com números medidos em produção.
Ler o case completoVendedor ativo · crédito
Abordagem ativa com follow-up e insistência embutidos: o lead que esfriaria volta para a conversa sem depender de alguém lembrar dele.
E-commerce ponta a ponta
Conversa, recomendação, carrinho e pagamento no mesmo fio — o caso destacado acima.
Pesquisadores que constroem. Engenheiros que entendem o negócio.
A Pumpkin nasceu da interseção entre pesquisa de ponta e problemas reais de negócio. Nossa equipe reúne cientistas e engenheiros formados nas melhores universidades do Brasil e do mundo — que em vez de ficarem na academia, decidiram construir a infraestrutura de IA que as empresas precisam agora.
Não vendemos ferramentas prontas. Arquitetamos soluções que funcionam no contexto específico do seu negócio — com a rigorosidade de quem pesquisou o tema antes de qualquer hype.
— time Pumpkin, São Paulo
O que escrevemos sobre IA, agentes e knowledge graphs.
Ensaios, benchmarks e estudos de caso.
Similaridade semântica: como o cosseno funciona e onde falha
Entenda por que a similaridade semântica (cosseno) falha em perguntas de e-commerce como 'geladeira frost free até R$ 3.000' e como contornar essa limitação combinando busca semântica com filtros determinísticos.
A era B2A: por que sua empresa vai vender para agentes de IA, não para pessoas
A venda para agentes de IA (B2A) está transformando o comércio. Quando quem pesquisa, compara e decide a compra é um agente, a unidade de distribuição deixa de ser o clique e passa a ser a citação, e a unidade de confiança deixa de ser a marca e passa a ser o fato verificável. Entenda o que isso muda no seu site, nos seus dados e nas suas APIs.
O que é engenharia de contexto: o recurso mais escasso do seu agente
Engenharia de contexto é a disciplina de decidir o que entra, o que fica de fora e em que ordem na janela do LLM. Este post mostra por que recuperar os trechos mais similares não é montar o melhor contexto e por que engenharia de contexto é responsabilidade do harness, não do modelo.