Math & Statistics

Distributions You Must Know

The probability distributions every AI/ML engineer is expected to recognize, parameterize, and apply.

🟢 beginner5 min readprobability
Probability distributions model data generation processes. Discrete distributions include Bernoulli (binary trials), Binomial (k successes in N trials), Poisson (event rates in fixed intervals), and Categorical/Multinomial. Continuous distributions include Uniform, Gaussian/Normal (central limit theorem baseline), Exponential (time between events), and Beta/Dirichlet (priors over probabilities). Selecting the right parametric distribution dictates likelihood formulations and loss functions.

Summary Matrix of Essential Distributions

                             Probability Distributions
              ┌──────────────────────────┴──────────────────────────┐
              ▼                                                     ▼
     Discrete Distributions                               Continuous Distributions
  - Bernoulli(p): Single 0/1 flip                       - Gaussian(μ, σ²): Bell curve
  - Binomial(N, p): k successes in N                    - Exponential(λ): Wait times
  - Poisson(λ): Event counts per interval               - Beta(α, β): Prior over [0,1]
  - Categorical(p_1..p_K): K-class pick                 - Dirichlet(α_1..α_K): Prior over Simplex
DistributionSupportKey ParametersMean E[X]\mathbb{E}[X]Variance Var(X)\text{Var}(X)Primary ML Application
Bernoulli{0,1}\{0, 1\}p∈[0,1]p \in [0, 1]ppp(1−p)p(1-p)Binary Classification, Dropout
Binomial{0,…,N}\{0, \dots, N\}N∈N,p∈[0,1]N \in \mathbb{N}, p \in [0,1]NpNpNp(1−p)Np(1-p)A/B Testing conversion counts
Poisson{0,1,2,… }\{0, 1, 2, \dots\}λ>0\lambda > 0 (rate)λ\lambdaλ\lambdaCall center arrivals, web traffic
Categorical{1,…,K}\{1, \dots, K\}p1,…,pKp_1, \dots, p_K∑ipi\sum i p_iMatrix formMulti-class Softmax classification
Gaussian (Normal)(−∞,+∞)(-\infty, +\infty)μ,σ2>0\mu, \sigma^2 > 0μ\muσ2\sigma^2MSE Loss, VAE latent space, Noise
Exponential[0,+∞)[0, +\infty)λ>0\lambda > 01/λ1/\lambda1/λ21/\lambda^2Time-to-failure, Survival analysis
Beta[0,1][0, 1]α,β>0\alpha, \beta > 0αα+β\frac{\alpha}{\alpha + \beta}ComplexBayesian Prior over probabilities
DirichletProbability Simplexα1,…,αK\alpha_1, \dots, \alpha_Kαi∑αk\frac{\alpha_i}{\sum \alpha_k}ComplexTopic Modeling (LDA), Bayesian GMM

Deep Dives on Critical Distributions

1. Gaussian / Normal Distribution N(μ,σ2)\mathcal{N}(\mu, \sigma^2)

Probability Density Function (PDF):

f(x)=12πσ2exp⁡(−(x−μ)22σ2)f(x) = \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left( -\frac{(x - \mu)^2}{2\sigma^2} \right)

Log-likelihood maximization yields Mean Squared Error (MSE).

2. Beta Distribution Beta(α,β)\text{Beta}(\alpha, \beta)

Supported on [0,1][0, 1]. Shape depends on pseudo-counts α\alpha (successes) and β\beta (failures):

Used in Multi-Armed Bandits (Thompson Sampling) and Bayesian A/B testing.

3. Dirichlet Distribution Dirichlet(α)\text{Dirichlet}(\boldsymbol{\alpha})

Multivariate generalization of the Beta distribution over probability vectors p=[p1,…,pK]\mathbf{p} = [p_1, \dots, p_K] where ∑pk=1.0\sum p_k = 1.0.

Core foundation for Latent Dirichlet Allocation (LDA) topic modeling.

Say this out loud

"Bernoulli models single 0/1 outcomes; Binomial models success counts in N trials; Poisson models event rates per time window with mean equal to variance λ. Gaussian N(μ, σ²) is the central limit baseline deriving MSE loss. Beta(α, β) models uncertainty over probabilities on [0,1] for Thompson Sampling, while Dirichlet generalizes Beta to multi-class probability vectors for topic modeling."

Follow-ups to expect

Check yourself

Question 1 of 3

Which continuous probability distribution is bounded strictly on [0, 1] and serves as the conjugate prior for Binomial / Bernoulli likelihoods in Bayesian modeling?

More in Math & Statistics

See all →
Bayes’ Theorem4 minCentral Limit Theorem4 minLaw of Large Numbers4 min