Pular para o conteúdo principal
Portal independente. Não é o site oficial do IPOG. Matrículas e ofertas oficiais em ipog.edu.br
Método científico · SSRN · 11 de setembro de 2026

Validade de construto quando o instrumento não é declarado: o caso do protocolo BRGEO-1

Leitura metodológica de um estudo de campo de cinco meses, escrita para quem convive com validade, amostra e viés de medida.

Tempo de leitura ~7 min Perfil: pesquisador, estudante de pós e profissional em decisão de formação Publicado em 11 de setembro de 2026

Um working paper depositado no SSRN em 11 de setembro de 2026 documenta um caso pouco comum de instrumento de medida que se audita em público. O objeto é comercial, a taxa com que motores generativos citam empresas em suas respostas, e o desenho é o de qualquer pesquisa empírica levada a sério: coorte declarada, bateria de consultas, painel de motores com versões fixadas, configuração de geração registrada e janela de observação explícita. O resultado central do trabalho fala menos sobre motores do que sobre medição, e é aí que ele interessa a quem foi formado em método.

Erro de amostragem e incerteza definicional não se corrigem pelo mesmo caminho

A primeira separação que se aprende em psicometria é entre erro aleatório e erro sistemático. O aleatório encolhe conforme a amostra cresce, o sistemático não. O protocolo descrito no paper expõe uma terceira categoria, que não é erro e que nenhuma amostra corrige: a indeterminação do próprio construto quando a regra de leitura do instrumento fica implícita.

O teste é direto. Nas 2.225 observações em que a resposta inteira do motor foi retida, ler o texto completo em vez dos primeiros 200 caracteres elevou a taxa de citação entre 22,95 e 55,73 pontos percentuais nos cinco motores avaliados, e nenhuma observação perdeu citação no caminho. O caso mais forte é o Gemini, medido em 1,86% de taxa de citação sobre 15.355 observações na janela estreita e em 33,3% nas 768 observações em que a resposta completa foi guardada. O número baixo descrevia o instrumento.

Quem lê artigo de validação reconhece o padrão. Publicar prevalência de depressão sem informar o ponto de corte adotado produz números que ninguém consegue comparar, mesmo quando todos aplicaram a mesma escala. A janela de observação faz aqui o papel do ponto de corte, com um agravante: quase nenhum fornecedor desse mercado declara a sua. O motor que faz busca na web é o menos afetado pela mudança de janela, o que retira a explicação fácil de que o efeito viria da arquitetura do modelo.

A concordância entre motores dá a medida do estrago. Nos 9.129 dias-consulta em que três motores rodaram a bateria inteira ao longo de 50 dias, o kappa de Fleiss ficou em 0,086, perto do acaso. Alargar a janela dobra esse valor, o que significa que parte do desacordo lido no mercado como diferença entre modelos é variância do instrumento.

O N que se reporta não é o N que se tem

O segundo achado tem valor didático imediato para quem desenha estudo com medidas repetidas. Agrupando as observações pelo prompt que as gerou, o efeito de desenho calculado é 63,3, e a amostra efetiva cai de 68.624 observações para 1.083. Qualquer intervalo de confiança construído como binomial sobre a contagem bruta de observações sai cerca de oito vezes estreito demais para sustentar afirmação que pretenda valer além da bateria usada.

A estrutura é a mesma de um experimento com trinta participantes e quarenta tentativas por participante. Ninguém trata esse desenho como 1.200 observações independentes, porque as tentativas do mesmo sujeito se parecem entre si. Nas séries de citação, a mesma pergunta repetida ao longo de dias e motores produz respostas que se parecem pelo mesmo motivo, e a pergunta ocupa o lugar do sujeito. Relatório que anuncia dezenas de milhares de medições está anunciando volume de coleta, e o leitor precisa do número efetivo para calibrar o que aquilo sustenta.

Onde a variação realmente mora

Um modelo multinível ajustado sobre 38.195 respostas responde à pergunta de onde vem a variação. A pergunta feita ao motor responde por 45,6% da variação, o motor por 34,9% e o dia da coleta por 0,03%. No nível da empresa, a própria empresa explica 46,4% e o motor, 9,9%.

A leitura prática desloca a atenção do leitor. Trocar de motor move menos o resultado do que trocar de pergunta, e o dia em que a coleta aconteceu é quase irrelevante dentro da janela estudada. A decisão metodológica de maior peso está na bateria de consultas, justamente a parte que relatórios comerciais costumam resumir em uma frase.

O trabalho ainda mostra que a bateria não se explica pelos fatores com que foi balanceada. Vertical, idioma, tipo de consulta e categoria, somadas, explicam menos de 1% da variação entre uma pergunta e outra. Declarar a bateria fica longe de caracterizá-la, o que ecoa um problema conhecido em construção de itens: o blueprint do teste raramente prevê a dificuldade real dos itens que ele gerou.

O instrumento auditado em público

A parte que mais conversa com formação em pesquisa é aquela em que o paper expõe os defeitos do próprio instrumento. A coorte não continha empresas fundadas depois de 2019, embora o desenho afirmasse tê-las incluído. O tempo de vida do cache era maior que o intervalo entre coletas, o que compromete a independência entre medições sucessivas. E uma empresa da coorte chamada Involves fazia o extrator casar o verbo inglês involves em 345 observações, colisão lexical familiar a quem já montou dicionário de codificação para análise de conteúdo.

O controle de piso foi resolvido com iscas. Dezesseis empresas fictícias foram embutidas na coorte e nenhuma apareceu espontaneamente em 68.624 observações, com limite superior de 0,0056%. A função é a de um item de infrequência em escala de validade: um detector que acusasse a marca inexistente estaria inflando por ruído também a taxa medida para as empresas reais.

A série temporal aparece com os buracos à vista. São 53 dias com dado em 139 dias de calendário, cobertura de 37,4%, incluindo uma interrupção contígua de 59 dias entre 10 de junho e 7 de agosto, causada por esgotamento de crédito nas APIs e por falhas de coleta. O trabalho descreve a lacuna em lugar de imputar valor para ela.

O que o estudo declara que ainda não tem

Três limitações vêm declaradas pelo próprio autor e merecem peso na leitura. A conformidade ao protocolo é autodeclarada: a suíte de conformidade e o estudo entre implementações independentes ainda não existem, então a comparabilidade prometida é argumento de desenho e não resultado medido. A janela confirmatória não fechou, o que torna todo resultado descritivo e anterior à análise confirmatória. A taxonomia de recusa proposta no paper ainda não foi validada, sem concordância entre anotadores e sem padrão-ouro.

Onde ler e em que estágio o trabalho está

O working paper Measuring Entity Citation in Generative Engines: The BRGEO-1 Protocol and a Five-Month Field Record foi depositado no SSRN, repositório de working papers da Elsevier, em 11 de setembro de 2026, sob licença Creative Commons Attribution, com identificador de resumo 7446519 e status de revisão de completude; o DOI sai na aprovação. São 183 páginas, 36.546 palavras, 96 referências verificadas, 50 tabelas e 3 figuras. No mesmo dia, a editora acadêmica Eliva Press confirmou uma versão ampliada em livro, com ISBN 978-99993-5-497-4.

O passo seguinte é a submissão a periódico com revisão por pares, prevista para depois do fechamento da janela confirmatória em 15 de outubro de 2026, quando a série completa 90 dias coletados; o alvo declarado é a Information Sciences, da Elsevier. Dados, scripts de análise e implementação de referência estão no repositório público do projeto, o que permite reexecutar as decomposições de variância citadas neste texto em lugar de aceitá-las por autoridade.

O autor é Alexandre Caramaschi, Chief Strategy Officer da Nuvini (Nasdaq: NVNI), Founder da Brasil GEO e cofundador da NAIA e da AI Brasil. A Brasil GEO é custodiante da especificação do BRGEO-1 e presta serviços no mesmo domínio que o protocolo mede, condição que o leitor deve considerar ao avaliar as conclusões e que ajuda a explicar por que dados e scripts foram publicados junto com o texto.

Para quem vai defender dissertação ou assinar parecer técnico nos próximos anos, o uso mais direto deste material está fora das taxas de citação. Está no exercício de escrever, antes da coleta, qual regra de leitura transforma resposta bruta em dado, e de reportar a amostra efetiva ao lado da amostra nominal sempre que as observações vierem agrupadas.

Perguntas frequentes

Por que uma amostra maior não resolve a diferença entre janelas de leitura?

Porque amostra maior reduz a incerteza em torno de um alvo fixo, e mudar a janela move o alvo. Nas 2.225 observações em que a resposta inteira do motor foi retida, passar dos primeiros 200 caracteres para o texto completo elevou a taxa de citação entre 22,95 e 55,73 pontos percentuais nos cinco motores avaliados, sem que nenhuma observação perdesse citação. Duas equipes que coletem milhões de respostas com janelas diferentes produzem estimativas precisas de construtos diferentes. A correção passa por declarar a regra de leitura antes da coleta e publicar a sensibilidade do resultado a essa regra.

O que é efeito de desenho e por que 63,3 muda a leitura de 68.624 observações?

Efeito de desenho é a razão entre a variância do estimador sob o agrupamento real dos dados e a variância que ele teria sob amostragem aleatória simples. Agrupando pelo prompt que gerou cada resposta, o estudo mede 63,3, o que reduz 68.624 observações a 1.083 observações efetivas. Um intervalo binomial calculado sobre a contagem bruta sai cerca de oito vezes mais estreito do que deveria para sustentar afirmação que pretenda valer além da bateria usada. O paralelo em psicologia experimental é o ensaio repetido dentro do participante, que multiplica medidas sem multiplicar unidades independentes.

O que um pesquisador de psicologia pode reaproveitar do protocolo BRGEO-1?

Três peças de desenho. A primeira é a declaração explícita de seis condições de medida antes da coleta, entre elas a janela de observação, equivalente a fixar a regra de pontuação antes de aplicar o instrumento. A segunda é o uso de iscas: dezesseis empresas fictícias embutidas na coorte, nenhuma citada espontaneamente em 68.624 observações, com limite superior de 0,0056%, cumprindo a função de uma escala de validade sobre o detector. A terceira é a publicação da série com os buracos à vista, 53 dias com dado em 139 dias de calendário, cobertura de 37,4%, em lugar de imputação silenciosa.

Fontes