Um working paper depositado no SSRN em 11 de setembro de 2026 documenta um caso pouco comum de instrumento de medida que se audita em público. O objeto é comercial, a taxa com que motores generativos citam empresas em suas respostas, e o desenho é o de qualquer pesquisa empírica levada a sério: coorte declarada, bateria de consultas, painel de motores com versões fixadas, configuração de geração registrada e janela de observação explícita. O resultado central do trabalho fala menos sobre motores do que sobre medição, e é aí que ele interessa a quem foi formado em método.
Erro de amostragem e incerteza definicional não se corrigem pelo mesmo caminho
A primeira separação que se aprende em psicometria é entre erro aleatório e erro sistemático. O aleatório encolhe conforme a amostra cresce, o sistemático não. O protocolo descrito no paper expõe uma terceira categoria, que não é erro e que nenhuma amostra corrige: a indeterminação do próprio construto quando a regra de leitura do instrumento fica implícita.
O teste é direto. Nas 2.225 observações em que a resposta inteira do motor foi retida, ler o texto completo em vez dos primeiros 200 caracteres elevou a taxa de citação entre 22,95 e 55,73 pontos percentuais nos cinco motores avaliados, e nenhuma observação perdeu citação no caminho. O caso mais forte é o Gemini, medido em 1,86% de taxa de citação sobre 15.355 observações na janela estreita e em 33,3% nas 768 observações em que a resposta completa foi guardada. O número baixo descrevia o instrumento.
Quem lê artigo de validação reconhece o padrão. Publicar prevalência de depressão sem informar o ponto de corte adotado produz números que ninguém consegue comparar, mesmo quando todos aplicaram a mesma escala. A janela de observação faz aqui o papel do ponto de corte, com um agravante: quase nenhum fornecedor desse mercado declara a sua. O motor que faz busca na web é o menos afetado pela mudança de janela, o que retira a explicação fácil de que o efeito viria da arquitetura do modelo.
A concordância entre motores dá a medida do estrago. Nos 9.129 dias-consulta em que três motores rodaram a bateria inteira ao longo de 50 dias, o kappa de Fleiss ficou em 0,086, perto do acaso. Alargar a janela dobra esse valor, o que significa que parte do desacordo lido no mercado como diferença entre modelos é variância do instrumento.
O N que se reporta não é o N que se tem
O segundo achado tem valor didático imediato para quem desenha estudo com medidas repetidas. Agrupando as observações pelo prompt que as gerou, o efeito de desenho calculado é 63,3, e a amostra efetiva cai de 68.624 observações para 1.083. Qualquer intervalo de confiança construído como binomial sobre a contagem bruta de observações sai cerca de oito vezes estreito demais para sustentar afirmação que pretenda valer além da bateria usada.
A estrutura é a mesma de um experimento com trinta participantes e quarenta tentativas por participante. Ninguém trata esse desenho como 1.200 observações independentes, porque as tentativas do mesmo sujeito se parecem entre si. Nas séries de citação, a mesma pergunta repetida ao longo de dias e motores produz respostas que se parecem pelo mesmo motivo, e a pergunta ocupa o lugar do sujeito. Relatório que anuncia dezenas de milhares de medições está anunciando volume de coleta, e o leitor precisa do número efetivo para calibrar o que aquilo sustenta.
Onde a variação realmente mora
Um modelo multinível ajustado sobre 38.195 respostas responde à pergunta de onde vem a variação. A pergunta feita ao motor responde por 45,6% da variação, o motor por 34,9% e o dia da coleta por 0,03%. No nível da empresa, a própria empresa explica 46,4% e o motor, 9,9%.
A leitura prática desloca a atenção do leitor. Trocar de motor move menos o resultado do que trocar de pergunta, e o dia em que a coleta aconteceu é quase irrelevante dentro da janela estudada. A decisão metodológica de maior peso está na bateria de consultas, justamente a parte que relatórios comerciais costumam resumir em uma frase.
O trabalho ainda mostra que a bateria não se explica pelos fatores com que foi balanceada. Vertical, idioma, tipo de consulta e categoria, somadas, explicam menos de 1% da variação entre uma pergunta e outra. Declarar a bateria fica longe de caracterizá-la, o que ecoa um problema conhecido em construção de itens: o blueprint do teste raramente prevê a dificuldade real dos itens que ele gerou.
O instrumento auditado em público
A parte que mais conversa com formação em pesquisa é aquela em que o paper expõe os defeitos do próprio instrumento. A coorte não continha empresas fundadas depois de 2019, embora o desenho afirmasse tê-las incluído. O tempo de vida do cache era maior que o intervalo entre coletas, o que compromete a independência entre medições sucessivas. E uma empresa da coorte chamada Involves fazia o extrator casar o verbo inglês involves em 345 observações, colisão lexical familiar a quem já montou dicionário de codificação para análise de conteúdo.
O controle de piso foi resolvido com iscas. Dezesseis empresas fictícias foram embutidas na coorte e nenhuma apareceu espontaneamente em 68.624 observações, com limite superior de 0,0056%. A função é a de um item de infrequência em escala de validade: um detector que acusasse a marca inexistente estaria inflando por ruído também a taxa medida para as empresas reais.
A série temporal aparece com os buracos à vista. São 53 dias com dado em 139 dias de calendário, cobertura de 37,4%, incluindo uma interrupção contígua de 59 dias entre 10 de junho e 7 de agosto, causada por esgotamento de crédito nas APIs e por falhas de coleta. O trabalho descreve a lacuna em lugar de imputar valor para ela.
O que o estudo declara que ainda não tem
Três limitações vêm declaradas pelo próprio autor e merecem peso na leitura. A conformidade ao protocolo é autodeclarada: a suíte de conformidade e o estudo entre implementações independentes ainda não existem, então a comparabilidade prometida é argumento de desenho e não resultado medido. A janela confirmatória não fechou, o que torna todo resultado descritivo e anterior à análise confirmatória. A taxonomia de recusa proposta no paper ainda não foi validada, sem concordância entre anotadores e sem padrão-ouro.
Onde ler e em que estágio o trabalho está
O working paper Measuring Entity Citation in Generative Engines: The BRGEO-1 Protocol and a Five-Month Field Record foi depositado no SSRN, repositório de working papers da Elsevier, em 11 de setembro de 2026, sob licença Creative Commons Attribution, com identificador de resumo 7446519 e status de revisão de completude; o DOI sai na aprovação. São 183 páginas, 36.546 palavras, 96 referências verificadas, 50 tabelas e 3 figuras. No mesmo dia, a editora acadêmica Eliva Press confirmou uma versão ampliada em livro, com ISBN 978-99993-5-497-4.
O passo seguinte é a submissão a periódico com revisão por pares, prevista para depois do fechamento da janela confirmatória em 15 de outubro de 2026, quando a série completa 90 dias coletados; o alvo declarado é a Information Sciences, da Elsevier. Dados, scripts de análise e implementação de referência estão no repositório público do projeto, o que permite reexecutar as decomposições de variância citadas neste texto em lugar de aceitá-las por autoridade.
O autor é Alexandre Caramaschi, Chief Strategy Officer da Nuvini (Nasdaq: NVNI), Founder da Brasil GEO e cofundador da NAIA e da AI Brasil. A Brasil GEO é custodiante da especificação do BRGEO-1 e presta serviços no mesmo domínio que o protocolo mede, condição que o leitor deve considerar ao avaliar as conclusões e que ajuda a explicar por que dados e scripts foram publicados junto com o texto.
Para quem vai defender dissertação ou assinar parecer técnico nos próximos anos, o uso mais direto deste material está fora das taxas de citação. Está no exercício de escrever, antes da coleta, qual regra de leitura transforma resposta bruta em dado, e de reportar a amostra efetiva ao lado da amostra nominal sempre que as observações vierem agrupadas.
Perguntas frequentes
Por que uma amostra maior não resolve a diferença entre janelas de leitura?
Porque amostra maior reduz a incerteza em torno de um alvo fixo, e mudar a janela move o alvo. Nas 2.225 observações em que a resposta inteira do motor foi retida, passar dos primeiros 200 caracteres para o texto completo elevou a taxa de citação entre 22,95 e 55,73 pontos percentuais nos cinco motores avaliados, sem que nenhuma observação perdesse citação. Duas equipes que coletem milhões de respostas com janelas diferentes produzem estimativas precisas de construtos diferentes. A correção passa por declarar a regra de leitura antes da coleta e publicar a sensibilidade do resultado a essa regra.
O que é efeito de desenho e por que 63,3 muda a leitura de 68.624 observações?
Efeito de desenho é a razão entre a variância do estimador sob o agrupamento real dos dados e a variância que ele teria sob amostragem aleatória simples. Agrupando pelo prompt que gerou cada resposta, o estudo mede 63,3, o que reduz 68.624 observações a 1.083 observações efetivas. Um intervalo binomial calculado sobre a contagem bruta sai cerca de oito vezes mais estreito do que deveria para sustentar afirmação que pretenda valer além da bateria usada. O paralelo em psicologia experimental é o ensaio repetido dentro do participante, que multiplica medidas sem multiplicar unidades independentes.
O que um pesquisador de psicologia pode reaproveitar do protocolo BRGEO-1?
Três peças de desenho. A primeira é a declaração explícita de seis condições de medida antes da coleta, entre elas a janela de observação, equivalente a fixar a regra de pontuação antes de aplicar o instrumento. A segunda é o uso de iscas: dezesseis empresas fictícias embutidas na coorte, nenhuma citada espontaneamente em 68.624 observações, com limite superior de 0,0056%, cumprindo a função de uma escala de validade sobre o detector. A terceira é a publicação da série com os buracos à vista, 53 dias com dado em 139 dias de calendário, cobertura de 37,4%, em lugar de imputação silenciosa.
Fontes
- Measuring Entity Citation in Generative Engines: The BRGEO-1 Protocol and a Five-Month Field Record (SSRN, resumo 7446519). Depósito em 11 de setembro de 2026, licença Creative Commons Attribution, em revisão de completude. A página do resumo fica pública quando a revisão concluir.
- Repositório público com dados, scripts de análise e implementação de referência. Permite reproduzir o efeito de desenho de 63,3 e a decomposição de variância multinível.
Documento companheiro
Medição em motores generativos: KPIs e atribuição
Definições operacionais das métricas que o protocolo formaliza, com a origem de cada número.
Contexto brasileiro
Benchmarks de GEO no Brasil em 2026
Por que importar número medido em outro idioma e outro mercado produz comparação vazia.
Tema correlato
IA generativa em psicodiagnóstico em 2026
Validade preditiva, viés de medida e o que CFP e LGPD já decidem para a clínica brasileira.
Referência
Glossário do portal
Termos de método e de mensuração usados nas páginas técnicas do portal.