GEO

Como medir GEO de forma reproduzível, sem depender de print de tela

Alexandre Caramaschi
Alexandre Caramaschi é Chief Strategy Officer da

Medir GEO de forma reproduzível é rodar um banco fixo de perguntas nos motores de IA, em cadência e com temperatura 0, e publicar cada número com N de execuções, janela de tempo, variância e o total de consultas coletadas sobre as previstas. A Brasil GEO aplica esse método com 51 perguntas fixas por dia em ChatGPT, Claude, Gemini e Perplexity desde 23 de setembro de 2026.

Ilustração de equipe comparando telas de assistentes de IA com checklist e gráfico: print não é medição
Um print registra uma execução; a medição exige banco fixo de perguntas, vários motores e denominador explícito.

Na corrida de 29 de agosto de 2026, ainda com o banco de 37 perguntas, a marca combinada (Brasil GEO mais Alexandre Caramaschi) apareceu em 21,1% das respostas. O número veio acompanhado de outro, que quase nunca aparece em relatório de agência: 147 das 148 consultas previstas foram coletadas, 99,3%, com a amostra parcial declarada no Gemini (36 de 37).

Esse segundo número é o que separa medição de anedota, e o mercado ainda trabalha sem ele. Segundo a McKinsey (outubro de 2025), apenas 16% das marcas acompanham de forma sistemática seu desempenho na busca com IA. As demais decidem orçamento de GEO olhando telas avulsas.

A tese deste texto é que visibilidade em IA se comporta como distribuição, e não como posição. Todo relatório que não diz quantas vezes a pergunta rodou, em qual janela e com qual variação está reportando sorte de amostragem.

Por que um print de tela não prova visibilidade em IA?

Porque um print é uma execução única e sem denominador. A mesma pergunta, feita minutos depois, pode devolver outra lista de nomes, e sem saber quantas vezes ela rodou ninguém distingue padrão de acaso. A métrica que se sustenta é o percentual de execuções em que a marca aparece, medido sobre um banco congelado de perguntas e com o mesmo protocolo em toda rodada.

Benedict Evans apontou o efeito que torna o print tão convincente: a resposta chega com aparência de certeza, como se fosse a única possível. A série de execuções mostra a variação que cada resposta isolada esconde.

“Mas um chatbot entrega três parágrafos de texto com aparente certeza, como A Resposta, e notas de rodapé, um aviso para clicar e um lembrete padrão de ‘tome cuidado!’ no fim não resolvem de fato esse problema.”

Benedict Evans, analista independente de tecnologia, em Unbundling AI (2023). Tradução livre.

O estudo mais citado sobre o tema é o da SparkToro com a Gumshoe.ai, conduzido por Rand Fishkin em janeiro de 2026, com 2.961 prompts, 600 voluntários e 12 categorias em ChatGPT, Claude e Google AI. A conclusão foi que posição de ranking dentro da IA é ilusão, e os líderes de categoria apareceram entre 55% e 77% das respostas. Se até o líder some em uma parte relevante das execuções, um print favorável de uma marca menor prova ainda menos.

CritérioPrint de telaMedição reproduzível
UnidadeUma resposta, capturada uma vezPercentual de execuções em que a marca aparece
DenominadorAusente147 de 148 consultas, ou 99,3%
RepetiçãoA mesma pergunta devolve outra respostaBanco congelado e temperatura 0, com N por pergunta
Comparação no tempoSem antes e sem depoisSérie diária com corte na data da intervenção
ConcorrênciaSó quem apareceu naquela telaMesmo banco aplicado a 21 concorrentes monitorados
Uso na decisãoAnedota de reuniãoLinha de base para orçamento e meta
Print de tela contra medição reproduzível. Fonte: protocolo da Brasil GEO, corrida de 29 de agosto de 2026; página de método atualizada em 10 de setembro de 2026.

Quantas execuções por pergunta são necessárias?

Cinco execuções por pergunta é o mínimo para monitoramento contínuo, e 30 é o mínimo para comparar antes e depois de uma intervenção. A regra da casa da Brasil GEO deriva do paper arXiv 2604.07585, que trata visibilidade em IA como distribuição com N execuções. Abaixo desse piso, a variação natural entre respostas engole qualquer efeito real que a marca queira enxergar.

O N também precisa ser lido por motor, porque a média entre canais engana. Na mesma corrida de 29 de agosto de 2026, o banco devolveu as taxas de menção abaixo.

MotorMenção da marca
Perplexity35,1%
Gemini16,7%
OpenAI (ChatGPT)16,2%
Anthropic (Claude)16,2%
Menção da marca combinada por motor na corrida de 29 de agosto de 2026, banco de 37 perguntas, com amostra parcial declarada no Gemini (36 de 37). Fonte: Brasil GEO.

O Perplexity nomeou a marca em mais que o dobro das respostas dos outros três motores. A diferença reflete comportamento de produto, e não erro de coleta, e por isso uma média geral de 21,1% esconde a informação que decide onde investir. O relatório útil traz a linha de cada motor com o próprio denominador.

Como montar uma medição reproduzível em uma semana?

Em sete passos, cada um com um resultado que outra pessoa consegue verificar, e nenhum deles exige ferramenta paga na primeira volta. A ordem importa: o banco e o protocolo vêm antes da primeira rodada, a linha de base vem antes de qualquer mudança no site, e a data de cada intervenção é o que permite, depois, falar em causa.

  1. Escreva de 30 a 40 perguntas que um cliente real faria e congele o texto até o fim da janela de comparação.
  2. Cadastre sua marca, de 15 a 25 concorrentes e todas as grafias de cada nome, com contexto obrigatório para siglas curtas.
  3. Fixe motores, temperatura 0, horários de coleta e execuções por pergunta antes de rodar.
  4. Colete a linha de base com ao menos 30 execuções por pergunta antes de mexer no site.
  5. Registre a data em que cada página passou a responder a uma pergunta do banco.
  6. Publique consultas coletadas sobre previstas em toda tabela e declare a amostra parcial onde houver.
  7. Compare a média da janela nova com a da anterior e trate como ruído a variação dentro da faixa já observada.

Dois cuidados evitam as conclusões erradas mais comuns. O primeiro é o cadastro de aliases: no monitoramento da Brasil GEO, 11 dos 21 concorrentes acompanhados foram varridos mais de 60 vezes e nunca detectados, e esse contrafactual só vale depois da revisão de grafias, porque siglas como NAIA ou ECS só contam como menção com contexto do domínio numa janela de 120 caracteres. O segundo é o Entity Consistency Score: com fatos divergentes entre plataformas, a taxa de menção mede confusão, e o alvo é ficar acima de 0,9.

Como a mesma lógica funciona em escala pública?

No Brasil GEO Index, que aplica o protocolo a um mercado inteiro. A janela confirmatória v2 começou em 23 de abril de 2026, com protocolo pré-registrado, quatro verticais, 48 consultas por vertical, cinco modelos e duas coletas diárias, o que soma cerca de 960 observações por rodada, cada uma com commit e manifesto SHA-256 no repositório público.

O retrato de 9 de setembro de 2026 somava 88.911 respostas, 127 entidades e 36,1% de citação, com intervalo de confiança de 95% entre 35,8% e 36,4%. Dezesseis entidades fictícias rodam junto para medir falso positivo; dos 90 dias da janela, 54 tinham dado gravado, e os 36 restantes ficam em branco, sem projeção. Esse é o comportamento a cobrar de qualquer fornecedor: janela interrompida se declara. O protocolo completo está em como medir GEO de forma reproduzível, e o blog detalha a comparação com concorrentes em share of voice em IA.

Os 21,1% da corrida de 29 de agosto importam menos do que o fato de virem com 147 de 148 consultas ao lado. A tarefa para a próxima segunda-feira é escrever as perguntas do cliente antes de abrir qualquer motor, porque sem esse banco congelado nenhum número posterior terá com o que ser comparado.

Perguntas frequentes sobre medição de GEO

As respostas abaixo cobrem as situações que mais aparecem quando uma empresa monta a primeira medição. Elas seguem o protocolo publicado pela Brasil GEO, com versão de 29 de agosto de 2026, e o null-report Three Ways to Fail to Conclude, de maio de 2026, que aplica a mesma disciplina de não concluir antes da hora.

Como auditar a presença da minha marca em LLMs?

Comece pelo denominador, antes de olhar qualquer resposta: escreva de 30 a 40 perguntas de cliente, cadastre marca e concorrentes com todas as grafias, fixe motores e temperatura e só então rode. A auditoria só vale se disser quantas consultas foram coletadas sobre as previstas.

Por que meu concorrente nunca aparece na medição?

Na maioria das vezes, por falha no cadastro de aliases, e essa hipótese vem antes de qualquer conclusão sobre mercado. Revise as grafias e exija contexto do domínio para nomes curtos antes de ler a ausência como dado.

Como saber se a melhora veio da minha mudança no site?

Só pelo registro da data em que cada página passou a responder a uma pergunta do banco. Esse registro cria o corte entre antes e depois; sem ele, nenhum efeito é atribuível à intervenção, por melhor que seja o gráfico.

Alexandre Caramaschi é Chief Strategy Officer da Nuvini (Nasdaq: NVNI). As opiniões deste texto são emitidas na condição de Founder da Brasil GEO e não representam posição da Nuvini.

Alexandre Caramaschi

Alexandre Caramaschi é Chief Strategy Officer da Nuvini (Nasdaq: NVNI), Founder da Brasil GEO, cofundador da NAIA e cofundador da AI Brasil. Foi CMO da Semantix (Nasdaq).

Deixe um comentario