Pular para o conteúdo

STATS-1.0

Um dashboard pode parecer preciso enquanto o comportamento da IA por baixo dele continua ruidoso.

STATS-1.0 expõe incerteza para que equipes saibam quando um resultado é descritivo, direcional ou adequado para interpretação de tendência.

500 iterações de bootstrap

Cluster bootstrap reamostra unidades prompt+modelo em vez de fingir independência entre respostas repetidas.

Intervalo de confiança de 95%

A plataforma persiste o intervalo ao redor da estimativa de AVS quando a amostra permite.

Tamanho efetivo da amostra

Pesos estratégicos entram no tamanho efetivo de amostra, não apenas na contagem bruta.

Confidence grade

Insufficient, Low, Medium ou High tornam explícito o limite de interpretação.

01

Insufficient

Trate o score como descritivo. Amplie prompts/modelos ou corrija uma execução incompleta.

02

Low

Leitura direcional. Útil para exploração, não para afirmações fortes de tendência.

03

Medium

Usável para leitura de tendência; movimentos pequenos devem ser confirmados em runs comparáveis posteriores.

04

High

A amostra atende os critérios fortes de STATS-1.0 para interpretação de tendência.

O threshold High é deliberadamente exigente.

High exige tamanho efetivo de amostra ≥ 40, pelo menos 20 unidades prompt+modelo, 10 prompts únicos e 2 modelos. Medium exige n_eff ≥ 20, 10 unidades, 5 prompts e 2 modelos. A completude da execução pode rebaixar o resultado.

Ler referência STATS-1.0