Distributions You Must Know
The probability distributions every AI/ML engineer is expected to recognize, parameterize, and apply.
Summary Matrix of Essential Distributions
Probability Distributions
┌──────────────────────────┴──────────────────────────┐
▼ ▼
Discrete Distributions Continuous Distributions
- Bernoulli(p): Single 0/1 flip - Gaussian(μ, σ²): Bell curve
- Binomial(N, p): k successes in N - Exponential(λ): Wait times
- Poisson(λ): Event counts per interval - Beta(α, β): Prior over [0,1]
- Categorical(p_1..p_K): K-class pick - Dirichlet(α_1..α_K): Prior over Simplex
| Distribution | Support | Key Parameters | Mean | Variance | Primary ML Application |
|---|---|---|---|---|---|
| Bernoulli | Binary Classification, Dropout | ||||
| Binomial | A/B Testing conversion counts | ||||
| Poisson | (rate) | Call center arrivals, web traffic | |||
| Categorical | Matrix form | Multi-class Softmax classification | |||
| Gaussian (Normal) | MSE Loss, VAE latent space, Noise | ||||
| Exponential | Time-to-failure, Survival analysis | ||||
| Beta | Complex | Bayesian Prior over probabilities | |||
| Dirichlet | Probability Simplex | Complex | Topic Modeling (LDA), Bayesian GMM |
Deep Dives on Critical Distributions
1. Gaussian / Normal Distribution
Probability Density Function (PDF):
Log-likelihood maximization yields Mean Squared Error (MSE).
2. Beta Distribution
Supported on . Shape depends on pseudo-counts (successes) and (failures):
- .
- Skewed toward (High confidence success).
Used in Multi-Armed Bandits (Thompson Sampling) and Bayesian A/B testing.
3. Dirichlet Distribution
Multivariate generalization of the Beta distribution over probability vectors where .
Core foundation for Latent Dirichlet Allocation (LDA) topic modeling.
Say this out loud
"Bernoulli models single 0/1 outcomes; Binomial models success counts in N trials; Poisson models event rates per time window with mean equal to variance λ. Gaussian N(μ, σ²) is the central limit baseline deriving MSE loss. Beta(α, β) models uncertainty over probabilities on [0,1] for Thompson Sampling, while Dirichlet generalizes Beta to multi-class probability vectors for topic modeling."
Follow-ups to expect
- What is the Memoryless Property of the Exponential Distribution? . The probability of waiting an additional minutes does not depend on how long you have already been waiting.
- What is the Heavy-Tailed Cauchy distribution? Ratio of two independent standard Gaussians. Has undefined mean and infinite variance, violating the Central Limit Theorem.
Check yourself
Which continuous probability distribution is bounded strictly on [0, 1] and serves as the conjugate prior for Binomial / Bernoulli likelihoods in Bayesian modeling?