Pular para o conteúdo
DocumentaçãoMetodologiaSTATS-1.0: confiança estatística
MetodologiaContrato atualVersão DOCS-2.0

STATS-1.0: confiança estatística

Cluster bootstrap, tamanho efetivo de amostra, completude e níveis de confiança tornam explícita a diferença entre um sinal exploratório e uma evidência mais robusta.

Como interpretar este documento

Este conteúdo descreve o comportamento técnico e metodológico implementado ou explicitamente planejado no produto. Quando um controle depende de configuração, provider, secret, contrato ou aprovação jurídica, essa dependência deve permanecer visível.

Por que estatística importa

LLMs não são funções determinísticas. O mesmo prompt pode produzir respostas diferentes. Sem repetição e desenho amostral, um dashboard pode parecer preciso enquanto a evidência subjacente continua instável.

Unidade amostral

STATS-1.0 agrupa respostas por prompt_key + modelo. Repetições da mesma unidade não são tratadas como se fossem observações totalmente independentes.

Cluster bootstrap

A implementação executa 500 iterações de bootstrap com seed e reamostra unidades prompt+modelo. Quando a amostra permite, persiste intervalo de confiança de 95% para o AVS.

Tamanho efetivo da amostra

Pesos estratégicos podem concentrar influência em poucas respostas. Por isso a plataforma calcula tamanho efetivo da amostra com base nos pesos, em vez de usar somente a contagem bruta.

High

Exige tamanho efetivo ≥ 40, pelo menos 20 unidades prompt+modelo, 10 prompts únicos e 2 modelos. É o nível mais forte implementado para interpretação de tendência.

Medium

Exige tamanho efetivo ≥ 20, pelo menos 10 unidades, 5 prompts únicos e 2 modelos. É adequado para leitura de tendência com cautela, especialmente para movimentos pequenos.

Low e Insufficient

Low começa com tamanho efetivo ≥ 10, pelo menos 8 unidades e 5 prompts. Abaixo disso a amostra permanece Insufficient e deve ser tratada principalmente como descritiva.

Completude

Abaixo de 80% das respostas esperadas, o nível se torna Insufficient. Entre 80% e 95%, resultados Medium ou High são rebaixados para Low. Isso impede que falhas de execução desapareçam da interpretação.

Comparação entre runs

Runs compatíveis podem calcular delta, erro padrão combinado, intervalo de confiança e indicador de significância a 95%. Comparação inferencial exige Medium ou High nas duas runs.