STATS-1.0
Um dashboard pode parecer preciso enquanto o comportamento da IA por baixo dele continua ruidoso.
STATS-1.0 expõe incerteza para que equipes saibam quando um resultado é descritivo, direcional ou adequado para interpretação de tendência.
500 iterações de bootstrap
Cluster bootstrap reamostra unidades prompt+modelo em vez de fingir independência entre respostas repetidas.
Intervalo de confiança de 95%
A plataforma persiste o intervalo ao redor da estimativa de AVS quando a amostra permite.
Tamanho efetivo da amostra
Pesos estratégicos entram no tamanho efetivo de amostra, não apenas na contagem bruta.
Confidence grade
Insufficient, Low, Medium ou High tornam explícito o limite de interpretação.
Insufficient
Trate o score como descritivo. Amplie prompts/modelos ou corrija uma execução incompleta.
Low
Leitura direcional. Útil para exploração, não para afirmações fortes de tendência.
Medium
Usável para leitura de tendência; movimentos pequenos devem ser confirmados em runs comparáveis posteriores.
High
A amostra atende os critérios fortes de STATS-1.0 para interpretação de tendência.
O threshold High é deliberadamente exigente.
High exige tamanho efetivo de amostra ≥ 40, pelo menos 20 unidades prompt+modelo, 10 prompts únicos e 2 modelos. Medium exige n_eff ≥ 20, 10 unidades, 5 prompts e 2 modelos. A completude da execução pode rebaixar o resultado.
Ler referência STATS-1.0