Medir GEO de forma reproduzível é rodar um banco fixo de perguntas nos motores de IA, em cadência e com temperatura 0, e publicar cada número com N de execuções, janela de tempo, variância e o total de consultas coletadas sobre as previstas. A Brasil GEO aplica esse método com 51 perguntas fixas por dia em ChatGPT, Claude, Gemini e Perplexity desde 23 de setembro de 2026.

Na corrida de 29 de agosto de 2026, ainda com o banco de 37 perguntas, a marca combinada (Brasil GEO mais Alexandre Caramaschi) apareceu em 21,1% das respostas. O número veio acompanhado de outro, que quase nunca aparece em relatório de agência: 147 das 148 consultas previstas foram coletadas, 99,3%, com a amostra parcial declarada no Gemini (36 de 37).
Esse segundo número é o que separa medição de anedota, e o mercado ainda trabalha sem ele. Segundo a McKinsey (outubro de 2025), apenas 16% das marcas acompanham de forma sistemática seu desempenho na busca com IA. As demais decidem orçamento de GEO olhando telas avulsas.
A tese deste texto é que visibilidade em IA se comporta como distribuição, e não como posição. Todo relatório que não diz quantas vezes a pergunta rodou, em qual janela e com qual variação está reportando sorte de amostragem.
Por que um print de tela não prova visibilidade em IA?
Porque um print é uma execução única e sem denominador. A mesma pergunta, feita minutos depois, pode devolver outra lista de nomes, e sem saber quantas vezes ela rodou ninguém distingue padrão de acaso. A métrica que se sustenta é o percentual de execuções em que a marca aparece, medido sobre um banco congelado de perguntas e com o mesmo protocolo em toda rodada.
Benedict Evans apontou o efeito que torna o print tão convincente: a resposta chega com aparência de certeza, como se fosse a única possível. A série de execuções mostra a variação que cada resposta isolada esconde.
“Mas um chatbot entrega três parágrafos de texto com aparente certeza, como A Resposta, e notas de rodapé, um aviso para clicar e um lembrete padrão de ‘tome cuidado!’ no fim não resolvem de fato esse problema.”
Benedict Evans, analista independente de tecnologia, em Unbundling AI (2023). Tradução livre.
O estudo mais citado sobre o tema é o da SparkToro com a Gumshoe.ai, conduzido por Rand Fishkin em janeiro de 2026, com 2.961 prompts, 600 voluntários e 12 categorias em ChatGPT, Claude e Google AI. A conclusão foi que posição de ranking dentro da IA é ilusão, e os líderes de categoria apareceram entre 55% e 77% das respostas. Se até o líder some em uma parte relevante das execuções, um print favorável de uma marca menor prova ainda menos.
| Critério | Print de tela | Medição reproduzível |
|---|---|---|
| Unidade | Uma resposta, capturada uma vez | Percentual de execuções em que a marca aparece |
| Denominador | Ausente | 147 de 148 consultas, ou 99,3% |
| Repetição | A mesma pergunta devolve outra resposta | Banco congelado e temperatura 0, com N por pergunta |
| Comparação no tempo | Sem antes e sem depois | Série diária com corte na data da intervenção |
| Concorrência | Só quem apareceu naquela tela | Mesmo banco aplicado a 21 concorrentes monitorados |
| Uso na decisão | Anedota de reunião | Linha de base para orçamento e meta |
Quantas execuções por pergunta são necessárias?
Cinco execuções por pergunta é o mínimo para monitoramento contínuo, e 30 é o mínimo para comparar antes e depois de uma intervenção. A regra da casa da Brasil GEO deriva do paper arXiv 2604.07585, que trata visibilidade em IA como distribuição com N execuções. Abaixo desse piso, a variação natural entre respostas engole qualquer efeito real que a marca queira enxergar.
O N também precisa ser lido por motor, porque a média entre canais engana. Na mesma corrida de 29 de agosto de 2026, o banco devolveu as taxas de menção abaixo.
| Motor | Menção da marca |
|---|---|
| Perplexity | 35,1% |
| Gemini | 16,7% |
| OpenAI (ChatGPT) | 16,2% |
| Anthropic (Claude) | 16,2% |
O Perplexity nomeou a marca em mais que o dobro das respostas dos outros três motores. A diferença reflete comportamento de produto, e não erro de coleta, e por isso uma média geral de 21,1% esconde a informação que decide onde investir. O relatório útil traz a linha de cada motor com o próprio denominador.
Como montar uma medição reproduzível em uma semana?
Em sete passos, cada um com um resultado que outra pessoa consegue verificar, e nenhum deles exige ferramenta paga na primeira volta. A ordem importa: o banco e o protocolo vêm antes da primeira rodada, a linha de base vem antes de qualquer mudança no site, e a data de cada intervenção é o que permite, depois, falar em causa.
- Escreva de 30 a 40 perguntas que um cliente real faria e congele o texto até o fim da janela de comparação.
- Cadastre sua marca, de 15 a 25 concorrentes e todas as grafias de cada nome, com contexto obrigatório para siglas curtas.
- Fixe motores, temperatura 0, horários de coleta e execuções por pergunta antes de rodar.
- Colete a linha de base com ao menos 30 execuções por pergunta antes de mexer no site.
- Registre a data em que cada página passou a responder a uma pergunta do banco.
- Publique consultas coletadas sobre previstas em toda tabela e declare a amostra parcial onde houver.
- Compare a média da janela nova com a da anterior e trate como ruído a variação dentro da faixa já observada.
Dois cuidados evitam as conclusões erradas mais comuns. O primeiro é o cadastro de aliases: no monitoramento da Brasil GEO, 11 dos 21 concorrentes acompanhados foram varridos mais de 60 vezes e nunca detectados, e esse contrafactual só vale depois da revisão de grafias, porque siglas como NAIA ou ECS só contam como menção com contexto do domínio numa janela de 120 caracteres. O segundo é o Entity Consistency Score: com fatos divergentes entre plataformas, a taxa de menção mede confusão, e o alvo é ficar acima de 0,9.
Como a mesma lógica funciona em escala pública?
No Brasil GEO Index, que aplica o protocolo a um mercado inteiro. A janela confirmatória v2 começou em 23 de abril de 2026, com protocolo pré-registrado, quatro verticais, 48 consultas por vertical, cinco modelos e duas coletas diárias, o que soma cerca de 960 observações por rodada, cada uma com commit e manifesto SHA-256 no repositório público.
O retrato de 9 de setembro de 2026 somava 88.911 respostas, 127 entidades e 36,1% de citação, com intervalo de confiança de 95% entre 35,8% e 36,4%. Dezesseis entidades fictícias rodam junto para medir falso positivo; dos 90 dias da janela, 54 tinham dado gravado, e os 36 restantes ficam em branco, sem projeção. Esse é o comportamento a cobrar de qualquer fornecedor: janela interrompida se declara. O protocolo completo está em como medir GEO de forma reproduzível, e o blog detalha a comparação com concorrentes em share of voice em IA.
Os 21,1% da corrida de 29 de agosto importam menos do que o fato de virem com 147 de 148 consultas ao lado. A tarefa para a próxima segunda-feira é escrever as perguntas do cliente antes de abrir qualquer motor, porque sem esse banco congelado nenhum número posterior terá com o que ser comparado.
Perguntas frequentes sobre medição de GEO
As respostas abaixo cobrem as situações que mais aparecem quando uma empresa monta a primeira medição. Elas seguem o protocolo publicado pela Brasil GEO, com versão de 29 de agosto de 2026, e o null-report Three Ways to Fail to Conclude, de maio de 2026, que aplica a mesma disciplina de não concluir antes da hora.
Como auditar a presença da minha marca em LLMs?
Comece pelo denominador, antes de olhar qualquer resposta: escreva de 30 a 40 perguntas de cliente, cadastre marca e concorrentes com todas as grafias, fixe motores e temperatura e só então rode. A auditoria só vale se disser quantas consultas foram coletadas sobre as previstas.
Por que meu concorrente nunca aparece na medição?
Na maioria das vezes, por falha no cadastro de aliases, e essa hipótese vem antes de qualquer conclusão sobre mercado. Revise as grafias e exija contexto do domínio para nomes curtos antes de ler a ausência como dado.
Como saber se a melhora veio da minha mudança no site?
Só pelo registro da data em que cada página passou a responder a uma pergunta do banco. Esse registro cria o corte entre antes e depois; sem ele, nenhum efeito é atribuível à intervenção, por melhor que seja o gráfico.
Alexandre Caramaschi é Chief Strategy Officer da Nuvini (Nasdaq: NVNI). As opiniões deste texto são emitidas na condição de Founder da Brasil GEO e não representam posição da Nuvini.
Leitura essencial sobre o tema no blog: Benchmark de Visibilidade em IA: Como medir sua presença nos motores generativos.
