A

Alocação de Neyman #
Reparte o tamanho da amostra entre os estratos conforme o tamanho e a variabilidade de cada um: estrato mais heterogêneo recebe mais unidades. Minimiza a variância da estimativa para um custo fixo.Veja: Fórmula interativaAmostragem
Amostra #
Subconjunto da população efetivamente observado. Toda a inferência estatística consiste em dizer algo sobre a população a partir dela — o que só é honesto quando a amostra foi obtida por um processo aleatório conhecido.Veja: Amostragem
Amostragem estratificada #
Divide a população em estratos homogêneos e sorteia dentro de cada um. Dá estimativas mais precisas que a amostragem simples quando os estratos diferem entre si.Veja: AmostragemAlocação de Neyman
Amplitude #
Diferença entre o maior e o menor valor do conjunto. É a medida de dispersão mais simples e a mais frágil: dois outliers bastam para descrevê-la inteira.Veja: Medidas de dispersão
Análise de variância (ANOVA) #
Testa se as médias de três ou mais grupos diferem, comparando a variação entre grupos com a variação dentro deles. Rejeitar a hipótese nula diz que alguma média difere, não qual.Veja: Análise de Variância
Análise exploratória de dados #
Etapa em que se olha para os dados antes de modelá-los — distribuições, faltantes, outliers, relações — para descobrir o que eles têm a dizer e que suposições são defensáveis.Veja: Análise Exploratória de DadosQuarteto de Anscombe
Assimetria #
Mede o quanto uma distribuição pende para um dos lados. Com assimetria à direita, a média é puxada acima da mediana — motivo pelo qual renda quase nunca deve ser resumida pela média.Veja: Medidas de tendência central

B

Boxplot #
Resumo gráfico de cinco números: mínimo, primeiro quartil, mediana, terceiro quartil e máximo, com os pontos além de 1,5 × IQR marcados à parte. Mostra dispersão e assimetria de uma vez.Veja: Boxplot: anatomia

C

Coeficiente binomial #
O número de maneiras de escolher k elementos entre n, sem importar a ordem. É também cada entrada do triângulo de Pascal.Veja: Fórmula interativaTriângulo de Pascal
Coeficiente de variação #
Desvio padrão dividido pela média, em geral em porcentagem. Permite comparar a dispersão de conjuntos em unidades ou escalas diferentes.Veja: Medidas de dispersão
Combinação #
Agrupamento em que a ordem não importa. Escolher 6 dezenas entre 60 é uma combinação — por isso a ordem do sorteio não muda a probabilidade do bilhete.Veja: Coeficiente binomialMega-Sena
Correção de população finita #
Fator que reduz o erro padrão quando a amostra representa uma parcela grande da população. Sem ele, a incerteza de um censo quase completo sairia exagerada.Veja: Fórmula interativa
Correlação #
Mede a força e a direção da associação linear entre duas variáveis, entre −1 e 1. Correlação alta não estabelece causa, e correlação zero não exclui relação não linear.Veja: Coeficiente de PearsonQuarteto de Anscombe
Covariância #
Mede se duas variáveis se afastam juntas de suas médias. O sinal indica a direção, mas a magnitude depende das unidades — padronizá-la dá a correlação.Veja: Fórmula interativa
Curtose #
Descreve o peso das caudas de uma distribuição em comparação com a normal. Cauda pesada significa que valores extremos são menos raros do que a normal previria.Veja: Distribuição normal

D

Desigualdade de Chebyshev #
Garante que pelo menos 1 − 1/k² das observações ficam a k desvios padrão da média, seja qual for a distribuição. É um limite frouxo, mas que não exige suposição nenhuma.Veja: Fórmula interativa
Desvio padrão #
Raiz quadrada da variância: a dispersão dos dados na mesma unidade da variável. Diz o quanto, em média, as observações se afastam da média.Veja: Desvio padrão explicadoMedidas de dispersão
Distribuição binomial #
Descreve o número de sucessos em n tentativas independentes com a mesma probabilidade p. É a soma de n ensaios de Bernoulli.Veja: Fórmula interativaCara ou coroa
Distribuição de Bernoulli #
A distribuição de um único ensaio com dois resultados possíveis, sucesso com probabilidade p e fracasso com 1 − p. É o tijolo da binomial.Veja: Fórmula interativa
Distribuição de Poisson #
Modela a contagem de eventos raros num intervalo fixo de tempo ou espaço, quando ocorrem de forma independente e a uma taxa média constante.Veja: Fórmula interativa
Distribuição normal #
A distribuição em forma de sino, simétrica em torno da média e descrita apenas por média e desvio padrão. Aparece com frequência porque somas de muitos efeitos independentes tendem a ela.Veja: Distribuição NormalTabela Z

E

Erro padrão #
Desvio padrão da distribuição de uma estatística ao longo de amostras repetidas. Mede a incerteza da estimativa, não a variabilidade dos dados — confundir os dois é o erro mais comum da área.Veja: Desvio padrão x erro padrão
Erro tipo I #
Rejeitar a hipótese nula quando ela é verdadeira: um falso positivo. Sua probabilidade é o nível de significância α, fixado antes do teste.Veja: Testes de hipótese
Erro tipo II #
Não rejeitar a hipótese nula quando ela é falsa: um falso negativo. Sua probabilidade é β, e 1 − β é o poder do teste.Veja: Testes de hipótese
Espaço amostral #
O conjunto de todos os resultados possíveis de um experimento aleatório. Definir bem o espaço amostral costuma resolver metade dos problemas de probabilidade.Veja: Eventos e espaço amostral
Esperança #
O valor médio de uma variável aleatória a longo prazo, ponderando cada resultado pela sua probabilidade. Também chamada de valor esperado ou média populacional.Veja: Variáveis aleatórias
Estimador #
Regra de cálculo aplicada à amostra para estimar um parâmetro da população. O valor que ela produz numa amostra concreta é a estimativa.Veja: Estimadores
Evento #
Qualquer subconjunto do espaço amostral — o conjunto de resultados sob o qual dizemos que algo aconteceu.Veja: Eventos e espaço amostral

F

Fórmula de Cochran #
Calcula quantos indivíduos a amostra precisa ter para atingir certa margem de erro e certo nível de confiança ao estimar uma proporção.Veja: Fórmula interativa
Frequência relativa #
Proporção das observações que caem em cada categoria ou faixa. É a base do histograma e a ponte empírica para a noção de probabilidade.Veja: Gráficos estatísticos
Função densidade de probabilidade #
Para uma variável contínua, a curva cuja área sob um intervalo dá a probabilidade de a variável cair nele. O valor da função num ponto não é uma probabilidade.Veja: Variáveis aleatórias

G

Graus de liberdade #
Quantos valores de um cálculo ainda podem variar livremente depois de impostas as restrições. Na variância amostral são n − 1, porque a média já consumiu uma informação.Veja: Distribuição t de Student

H

Heterocedasticidade #
Quando a variância dos resíduos muda ao longo dos valores previstos. Não enviesa os coeficientes da regressão, mas estraga os erros padrão — e com eles os testes e intervalos.Veja: Regressão linear
Hipótese alternativa #
A afirmação que se aceita caso a hipótese nula seja rejeitada. É ela que carrega a alegação que o estudo quer sustentar.Veja: Testes de hipótese
Hipótese nula #
A hipótese de que não há efeito ou diferença, tomada como verdadeira enquanto os dados não a contrariarem. Um teste nunca a prova: ou a rejeita, ou deixa de rejeitá-la.Veja: Testes de hipótese
Histograma #
Gráfico de barras contíguas que mostra como as observações se distribuem por faixas de valor. A largura das faixas muda a leitura, então vale testar mais de uma.Veja: Gráficos estatísticos

I

Independência #
Dois eventos são independentes quando a ocorrência de um não altera a probabilidade do outro — isto é, quando P(A ∩ B) = P(A) · P(B).Veja: Probabilidade condicional
Inferência bayesiana #
Abordagem que trata o parâmetro como incerto e o descreve por uma distribuição, atualizada pelos dados via teorema de Bayes: a priori vira posteriori.Veja: Frequentista vs bayesianoTeorema de Bayes
Intervalo de confiança #
Faixa de valores compatíveis com os dados para um parâmetro. A confiança de 95% é uma propriedade do método ao longo de amostras repetidas, não a probabilidade de o parâmetro estar naquele intervalo.Veja: Intervalos de confiançaFórmula interativa
Intervalo interquartil (IQR) #
Distância entre o primeiro e o terceiro quartil, ou seja, a amplitude dos 50% centrais. Por ignorar as caudas, resiste a outliers.Veja: Boxplot: anatomia

K

Kaplan-Meier #
Estimador não paramétrico da curva de sobrevivência que aproveita também as observações censuradas — aquelas cujo desfecho ainda não ocorreu quando o estudo terminou.Veja: Demografia das orcas

L

Lei dos grandes números #
Com muitas repetições, a média observada se aproxima da esperança. É o que faz a frequência longa convergir, e o que não garante nada sobre a próxima jogada.Veja: Cara ou coroa

M

Média aritmética #
Soma dos valores dividida pela quantidade deles. Resume bem distribuições simétricas e engana em distribuições assimétricas ou com outliers.Veja: Entendendo a médiaMedidas de tendência central
Média harmônica #
Recíproca da média das recíprocas. É a média correta para taxas e velocidades — a média de dois trechos percorridos a velocidades diferentes, por exemplo.Veja: Fórmula interativa
Mediana #
O valor que divide o conjunto ordenado em duas metades. Não se move quando um extremo se afasta, o que a torna o resumo preferível em dados assimétricos.Veja: Entendendo a mediana
Moda #
O valor mais frequente. É a única medida de tendência central aplicável a variáveis puramente categóricas, e um conjunto pode ter mais de uma.Veja: Medidas de tendência central

N

Nível de significância #
O limite α escolhido antes do teste para a probabilidade de erro tipo I. O valor 0,05 é convenção herdada, não uma propriedade da natureza.Veja: Testes de hipótese

O

Outlier #
Observação muito distante das demais. Pode ser erro de registro ou o dado mais informativo do conjunto — descartar sem investigar é que não vale.Veja: Boxplot: anatomia

P

p-valor #
Probabilidade de observar um resultado ao menos tão extremo quanto o obtido, supondo verdadeira a hipótese nula. Não é a probabilidade de a hipótese nula ser verdadeira, nem mede o tamanho do efeito.Veja: Testes de hipótese
Parâmetro #
Característica numérica da população, como μ ou σ: fixa e em geral desconhecida. O que se calcula na amostra é uma estatística, que a estima.Veja: Estimadores
Percentil #
Valor abaixo do qual cai determinada porcentagem das observações. O percentil 50 é a mediana; os percentis 25 e 75 são os quartis.Veja: Boxplot: anatomia
Permutação #
Arranjo de elementos em que a ordem importa. Trocar a ordem gera uma permutação nova — diferentemente da combinação.Veja: Triângulo de Pascal
Poder do teste #
Probabilidade de detectar um efeito que de fato existe, igual a 1 − β. Estudos pequenos demais falham em achar efeitos reais e, quando acham, superestimam o tamanho deles.Veja: Testes de hipótese
População #
O conjunto completo de unidades sobre o qual se quer concluir algo. Defini-la com precisão é o que determina a quem as conclusões se aplicam.Veja: Amostragem
Probabilidade condicional #
A probabilidade de um evento sabendo que outro ocorreu, escrita P(A|B). Ignorar o condicionamento é a origem de boa parte dos paradoxos da área.Veja: Probabilidade condicionalFórmula interativa

Q

Quartil #
Cada um dos três valores que dividem o conjunto ordenado em quatro partes iguais. O segundo quartil é a mediana.Veja: Boxplot: anatomia
Qui-quadrado #
Distribuição e família de testes usados para comparar frequências observadas com as esperadas, em testes de aderência e de independência entre variáveis categóricas.Veja: Fórmula interativa

R

Regressão linear #
Ajusta uma reta que descreve como a variável resposta muda com uma ou mais variáveis explicativas, minimizando a soma dos quadrados dos resíduos.Veja: Regressão linearFórmula interativa
Resíduo #
Diferença entre o valor observado e o previsto pelo modelo. Analisar resíduos é como se verifica se o modelo está adequado — quase sempre mais informativo que o R².Veja: Regressão linear

S

Série temporal #
Sequência de observações ordenadas no tempo, em que valores próximos costumam ser correlacionados. Essa dependência invalida os métodos que supõem observações independentes.Veja: Séries temporais
Significância estatística #
Resultado cujo p-valor ficou abaixo do nível adotado. Diz que o efeito dificilmente vem só do acaso, não que seja grande nem que importe na prática.Veja: Testes de hipótese

T

Taxa de falsas descobertas (FDR) #
Proporção esperada de falsos positivos entre as hipóteses rejeitadas. O procedimento de Benjamini-Hochberg a controla em testes múltiplos, sendo menos conservador que Bonferroni.Veja: Um contraexemplo ao método BH
Teorema central do limite #
A média de muitas variáveis independentes de mesma distribuição e variância finita tende à normal, qualquer que seja a distribuição de origem. É o que sustenta boa parte da inferência clássica.Veja: Teorema do limite centralFórmula interativa
Teorema da probabilidade total #
Decompõe a probabilidade de um evento somando suas probabilidades condicionais em cada parte de uma partição do espaço amostral.Veja: Fórmula interativa
Teorema de Bayes #
Inverte o condicionamento: converte P(B|A) em P(A|B), pesando pela probabilidade a priori. Explica por que um teste muito preciso ainda gera muitos falsos positivos quando a condição é rara.Veja: Fórmula interativaFrequentista vs bayesiano
Teste t de Student #
Compara médias quando o desvio padrão da população é desconhecido e a amostra é pequena, usando a distribuição t, de caudas mais pesadas que a normal.Veja: Teste z ou teste t?Tabela t
Teste z #
Compara médias ou proporções quando o desvio padrão populacional é conhecido, ou quando a amostra é grande o bastante para que a normal valha.Veja: Teste z ou teste t?Tabela Z

V

Variância #
Média dos quadrados dos desvios em relação à média. Por estar em unidade ao quadrado, costuma ser reportada como desvio padrão.Veja: Medidas de dispersão
Variável aleatória #
Função que associa um número a cada resultado do experimento. É discreta quando assume valores contáveis e contínua quando assume qualquer valor de um intervalo.Veja: Variáveis aleatórias
Viés #
Erro sistemático que desloca as estimativas sempre no mesmo sentido. Não diminui com amostra maior — só com mudança no processo de coleta ou no estimador.Veja: Amostragem

Z

Z-score #
Quantos desvios padrão um valor está da média, dado por (x − μ)/σ. Padroniza escalas diferentes e permite comparar valores de distribuições distintas.Veja: Fórmula interativaTabela Z