Skip to main content

Docs

God shall bless us; and all the ends of the earth shall fear him.

확률

machine-learning

확률

머신러닝을 이해하려면 기본적인 확률에 대한 지식이 필수적입니다. 예를 들어, 머신러닝 알고리즘은 데이터를 기반으로 패턴을 예측하거나 새로운 데이터를 분류하는 작업을 합니다. 이때, 모델이 "얼마나 정확한가?" 또는 "이 예측이 맞을 확률은 얼마나 될까?" 등을 계산하기 위해 확률 개념이 필요합니다.

간단한 예로, 이메일 필터링 알고리즘이 스팸 메일을 예측할 때, 이 이메일이 진짜 스팸일 확률을 계산하는 과정을 생각해볼 수 있습니다. 이제 확률의 기본적인 이론부터 차근차근 배워봅시다.

확률공간

Probability space

정의
확률공간은 $(\Omega, A, \mathbb{P})$로 정의되며, 여기서 $\Omega$는 표본 공간(sample space), $A$는 사건(event)의 집합, 그리고 $\mathbb{P}: A \rightarrow \mathbb{R}$는 $A$에 대한 확률 분포를 나타냅니다.

예를 들어, 동전 던지기는 다음과 같은 표본공간$\Omega$, 사건의 집합$A$, 확률분포$P$로 표현할 수 있습니다.

표본공간$\Omega$은 앞면(Head)와 뒷면(Tail) 두개입니다.
$$ \Omega = {H, T} $$

사건$A$은 아무일도 일어나지 않을때, 앞면, 뒷면, 앞면 또는 뒷면 네가지가 있습니다.
$$ A = {\emptyset, {H}, {T}, {H, T}} $$

그럼 동전을 던졌을때 나타나는 각각에 사건의 확률 분포$\mathbb{P}$는 어떨까요? 동전이 정상적이라면 다음과 같을 것입니다.
$$ \mathbb{P}(\emptyset) = 0, \quad \mathbb{P}({H}) = \frac{1}{2}, \quad \mathbb{P}({T}) = \frac{1}{2}, \quad \mathbb{P}({H, T}) = 1 $$

  • 아무 일도 일어나지 않을 확률은 $0$입니다.
  • 앞면이 나올 확률은 $\frac{1}{2}$입니다.
  • 뒷면이 나올 확률도 $\frac{1}{2}$입니다.
  • 앞면 또는 뒷면이 나올 확률은 $1$입니다.

확률 공의

Probability axioms

Axiom 1:
모든 사건 $A$에 대해 확률 분포$\mathbb{P}$는 양수입니다. 즉 확률은 음수가 될 수 없습니다. $$ \mathbb{P}(A) \geq 0 $$

Axiom 2:
전체 표본공간 $\Omega$의 확률은 1입니다, 즉 반드시 어떤 일이 일어납니다.

$$ \mathbb{P}(\Omega) = 1 $$

Axiom 3:
서로 배타적인 여러 사건($A_i \in \mathcal{A}\ and\ A_i \in A_j = \emptyset$)들의 합집합에 대한 확률은 각 사건들의 확률을 더한 값과 같습니다.

$$ \mathbb{P}\left(\bigcup_{i=1}^{\infty} A_i\right) = \sum_{i=1}^{\infty} \mathbb{P}(A_i) $$

확률의 성질

Properties of probability

어떤 사건 $A$와 $B$에 대해, 확률은 다음과 같은 성질을 만족합니다. 이 모든 성질은 확률 공리를 통해 증명할 수 있습니다.

  • 사건 A가 일어나지 않을 확률은 사건 A가 일어날 확률의 여집합입니다. $$ \mathbb{P}(A) = 1 - \mathbb{P}(A^c) $$  
     

  • 사건 A 또는 B가 일어날 확률은 각 사건의 확률에서 둘 다 일어날 확률을 뺀 값입니다. $$ \mathbb{P}(A \cup B) = \mathbb{P}(A) + \mathbb{P}(B) - \mathbb{P}(A \cap B) $$
     
     

  • 공집합이 일어날 확률은 0입니다. $$ \mathbb{P}(\emptyset) = 0 $$  
     

  • 사건 A가 사건 B에 포함되면($A \subseteq B$), 사건 A의 확률은 사건 B의 확률보다 작거나 같습니다. $$ \mathbb{P}(A) \leq \mathbb{P}(B) $$  
     

  • 사건 A와 B가 모두 일어날 확률은 각 사건의 확률의 합에서 1을 뺀 값보다 크거나 같습니다. $$ \mathbb{P}(A \cap B) \geq \mathbb{P}(A) + \mathbb{P}(B) - 1 $$

확률 측도의 연속성

Continuity of probability measures

이벤트 $A_i$와 $B_i$를 정의하면,

$A_1 \subseteq A_2 \subseteq \cdots \subseteq A_n \subseteq \cdots$라면, $$\mathbb{P}\left(\bigcup_{i=1}^{\infty} A_i\right) = \lim_{i \to \infty} \mathbb{P}(A_i)$$

여기서 $A_1 \subseteq A_2 \subseteq \cdots \subseteq A_n \subseteq \cdots$은 사건들이 점점 커지는(포함 관계가 점점 확장되는) 사건들의 열을 의미합니다. 사건 $A_i$들이 점점 커진다면, 무한히 커질 때 그 모든 사건의 합집합에 대한 확률은 각 사건들의 확률이 어떻게 변화하는지를 보여줍니다. 즉, 사건이 점점 커지면 그 사건들이 발생할 확률도 점점 커지고, 그 확률은 사건들의 극한에서 결정됩니다.

$B_1 \supseteq B_2 \supseteq \cdots \supseteq B_n \supseteq \cdots$라면, $$\mathbb{P}\left(\bigcap_{i=1}^{\infty} B_i\right) = \lim_{i \to \infty} \mathbb{P}(B_i)$$

여기서 $B_1 \supseteq B_2 \supseteq \cdots \supseteq B_n \supseteq \cdots$은 사건들이 점점 작아지는(포함 관계가 점점 축소되는) 사건들의 열을 의미합니다. 사건 $B_i$들이 점점 작아진다면, 무한히 작아질 때 그 모든 사건의 교집합에 대한 확률은 각 사건들의 확률이 어떻게 변화하는지를 보여줍니다. 즉, 사건이 점점 작아지면 그 사건들이 발생할 확률도 점점 줄어들고, 그 확률은 사건들의 극한에서 결정됩니다.

문제
$\Omega = [0, 1]$이고, $\mathbb{P}((a, b]) = b - a , (a < b)$일 때, 한 점의 확률은 얼마일까요?

직관적으로 생각해 보면, 한 점 $c$에서 확률은 0입니다. 정의에 따라 확률은 a와 b의 구간으로 정해지고, 한 점에서 구간은 0이기 때문입니다.
$$ \mathbb{P}({c})=\mathbb{P}((c,c])=0 $$

수식을 좀더 살펴봅시다. 앞에서 본 것 처럼, 위 확률은 구간의 길이에 따라 정해지고 감소하는 사건들입니다. 따라서 한점 $c$에서 확률은 $$ \mathbb{P}({c}) = \mathbb{P}\left( \bigcap_{n=1}^{\infty} \left( c - \frac{1}{n}, c \right] \right) $$

즉, 한 점 $c$에서의 확률은 구간 $\left( c - \frac{1}{n}, c \right]$이 점점 줄어들어 $c$에 수렴하는 것을 의미합니다.

이때, 구간의 길이가 점점 작아지므로, 그 확률은 다음과 같이 계산됩니다:

$$ \mathbb{P}({c}) = \lim_{n \to \infty} \frac{1}{n} = 0 $$

조건부 확률

Conditional probability

우리는 사건 $B$가 발생한 상황에서 사건 $A$가 발생할 확률을 구하고자 합니다.

예를 들어, 이메일에 "$$$" 기호가 포함되어 있을 때, 해당 이메일이 스팸일 확률은 얼마일까요?

정의
만약 $\mathbb{P}(B) \neq 0$이라면, 모든 사건 $A$에 대해
$$ \mathbb{P}(A|B) = \dfrac{\mathbb{P}(A \cap B)}{\mathbb{P}(B)} $$

확률변수

Random variable

정의
확률 변수(random variable) $X$는 표본 공간 $\Omega$에서 실수 집합 $\mathbb{R}$로 가는 함수입니다. 즉, $X : \Omega \to \mathbb{R}$입니다. 확률 변수 $X$의 확률 분포 $P_X$는 다음과 같이 정의됩니다:
$B = [a, b] \subseteq \mathbb{R}$ 일때, $$ P_X(B) \equiv \mathbb{P}(X \in B) = \mathbb{P}({\omega | X(\omega) \in B}) $$

다변수 확률 변수 $X = (X_1, \dots, X_n)$는 확률 벡터(random vector)라고 불립니다.

예를 들어, 동전 던지기에서 $X(T) = 0$, $X(H) = 1$일때 $X : \Omega \to \mathbb{R}$로 정의된 확률 변수 $X$는 다음과 같습니다:

$$ P_X({0}) = \mathbb{P}({\omega | X(\omega) \in {0}}) = \mathbb{P}({T}) = \frac{1}{2}\ \ P_X({1}) = \mathbb{P}({\omega | X(\omega) \in {1}}) = \mathbb{P}({H}) = \frac{1}{2} $$

확률 질량 함수(PMF)와 확률 밀도 함수(PDF)

Probability Mass/Density Function

이산 확률 변수는 특정한 개별 값들을 가질 수 있습니다. 예를 들어, 주사위를 던졌을 때 나오는 값은 1, 2, 3, 4, 5, 6과 같이 고정된 값들이며, 각각의 값이 나올 확률이 정의됩니다.

연속 확률 변수는 특정 값이 아니라 구간에 걸쳐 분포합니다. 예를 들어, 온도와 같이 실수 값 범위에서 연속적으로 변할 수 있는 값들이 이에 해당합니다.

이산 확률 질량 함수(PMF)

Discrete Probability Mass Function

$\exists {x_1, x_2, \dots}$는 이산 확률 변수가 가질 수 있는 값들의 집합입니다.
각 값 $x_i$에 대해 확률 $p(x_i)$가 주어지며, 모든 값들의 확률을 더한 값은 항상 1이어야 합니다.

즉, 모든 가능한 값에서 확률을 더하면 1이 됩니다. 이는 전체 사건의 확률이 1이라는 기본적인 확률 규칙을 따릅니다. $$ \sum_{i=1}^{\infty} p(x_i) = 1 $$

또한, 특정 사건 $A$가 발생할 확률은 그 사건에 해당하는 값들의 확률을 모두 더해 계산됩니다. $$ \mathbb{P}(A) = \sum_{x_i \in A} p(x_i) $$

연속 확률 밀도 함수(PDF)

Continuous Probability Density Function

연속 확률 변수가 가지는 확률은 특정한 값에 대해 정의되기보다는 확률 밀도 함수 $f(x)$로 표현됩니다.
$f(x)$는 항상 0 이상이며, 함수 $f(x)$의 전체 구간에서의 적분값은 1이 되어야 합니다. 이는 연속 변수에 대한 전체 확률이 1임을 의미합니다. $$ \int_{\mathbb{R}} f(x)dx = 1 $$

특정 구간 $A$에서의 확률은 해당 구간에 대해 $f(x)$를 적분한 값으로 계산됩니다. $$ \mathbb{P}(A) = \int_A f(x)dx $$

기댓값

Expectation

정의
확률 변수(vector) $X$와 함수 $g(X)$에 대해,
$\sum_x |g(x)| p_X(x)$ 또는 $\int_{\mathbb{R}} |g(x)| f_X(x)dx < \infty$ 일때 $g(X)$의 기댓값은 다음과 같이 정의됩니다:

  • 이산 확률 변수 $$ E[g(X)] = \sum_x g(x) p_X(x) $$
  • 연속 확률 변수 $$ E[g(X)] = \int_{\mathbb{R}} g(x) f_X(x)dx $$

이산 확률 변수는 각 값에 해당하는 확률 $p_X(x)$과 그 값 $g(x)$을 곱한 뒤 모두 더해줍니다. 연속 확률 변수는 해당 값을 나타내는 함수 $g(x)$와 확률 밀도 $f_X(x)$의 곱을 실수 범위에서 적분한 값입니다.

 
 

기댓값이 정의되지 않는 경우도 있습니다. 예를 들어,

  • 이산 확률 변수 $X$의 확률 질량 함수(pmf)가
    $$ p_X(x) = \frac{1}{x(x + 1)}, \quad (x = 1, 2, \dots) $$
    일 때,

$$ \sum_{x=1}^{\infty} \frac{1}{x(x+1)} = \sum_{x=1}^{\infty} \left( \frac{1}{x} - \frac{1}{x+1} \right)\ = \left( \frac{1}{1} - \frac{1}{2} \right) + \left( \frac{1}{2} - \frac{1}{3} \right) + \left( \frac{1}{3} - \frac{1}{4} \right) + \cdots $$ 이므로 $\sum p_X(x)=1$ 입니다.

그러나 $$ \sum_x |x| p_X(x) = \sum_x \frac{1}{x + 1} = \infty $$
이므로, 기댓값이 존재하지 않습니다. 이는 특정 값들이 기댓값을 계산할 때 너무 큰 영향을 미쳐 무한대로 발산하기 때문입니다.

  • 연속 확률 변수 $X$의 확률 밀도 함수(pdf)가
    $$ f_X(x) = \frac{1}{\pi(1 + x^2)}, \quad (x \in \mathbb{R}) $$
    일 때,
    $$ \int_{\mathbb{R}} |x| f_X(x)dx = \left[\frac{1}{\pi} \log(1 + x^2)\right]^\infty_0 = \infty $$
    입니다. 이 확률 분포는 코시 분포(Cauchy distribution)라고 불립니다.

기댓값의 성질

Properties of expectation

선형성
선형성은 기대값(기댓값, 기대치)이 선형 연산에 대해 보존되는 성질을 말합니다. 이는 확률 변수의 가중합에 대한 기대값이 각 성분의 기대값의 가중합과 같다는 것을 의미합니다.
$$ \mathbb{E}[aX + bY + c] = a\mathbb{E}[X] + b\mathbb{E}[Y] + c $$

단조성
단조성은 한 함수가 다른 함수보다 항상 작거나 같을 때, 그 함수들의 기대값도 그 순서를 유지한다는 성질입니다. 즉, 함수 $g_1(X)$가 함수 $g_2(X)$보다 작거나 같으면, 기대값도 동일한 관계를 따릅니다. $$ g_1(X) \leq g_2(X) \Rightarrow \mathbb{E}[g_1(X)] \leq \mathbb{E}[g_2(X)] $$

분산

Variance

정의
확률 변수 $X$에 대해 분산은 $$ V(X) = \sigma_X^2 = E[(X - E[X])^2] $$

확률 변수 $X$의 분산은 $X$가 그 평균값 주위에서 얼마나 흩어져 있는지를 나타냅니다.
이는 확률 변수 $(X - \mathbb{E}[X])^2$의 기댓값으로 정의됩니다.

표준편차 $\sigma_X$는 분산의 제곱근입니다.

Covariance

Measure of the linear relationship between two random variables. Varies depending on the unit of measurement

For random vectors X and Y , the covariance matrix is defined as Cov(X,Y ) = E[(X −E[X])(Y −E[Y ])ᵀ]. Cov(X,Y ) > 0, then Y tends to increase with X. Cov(X,Y ) < 0, then Y tends to decrease with X. Cov(X,Y ) = 0, then Y has no linear relationship with X

Properties of variance/covariance

V(aX + b) = a2 V(X) V(X) = E[X2] −E[X]2 V(X + Y ) = V(X) + V(Y ) + 2Cov(X,Y ) Cov(X,Y ) = Cov(Y,X) Cov(aX + b,cY + d) = acCov(X,Y ) Cov(X,Y ) = E[XY ] −E[X] E[Y ]

Correlation coefficient

Measure of the linear relationship between two random variables. I Invariant for the unit of measurement by normalizing covariance

정의 For any two random variables X and Y with non-zero variance, the correlation coefficient ρ(X,Y ) is ρ(X,Y ) = Cov(X,Y )√V(X) V(Y )

Let X and Y be random variables with expectation μX,μY , variance σ2X,σ2Y , and their correlation coefficient be ρ. I V( Y −μY σY −ρX−μX σX ) = 1 −ρ2 I −1 6ρ 61 I ρ = 1 ⇔ Y −μY σY = X−μX σX I ρ = −1 ⇔ Y −μY σY = −X−μX σx

Independence

If two events A and B are independent, the probability of event A should not be affected by event B, i.e., P(A |B) = P(A). Independence can be defined as follows. Definition Two events A and B are independent if P(A ∩B) = P(A)P(B). Two random variables X and Y are independent if P(X ∈A and Y ∈B) = P(X ∈A)P(Y ∈B), for all events A and B.

Properties of independent random variables

If two random variables X and Y are independent, the following properties hold. I fX,Y (x,y) = fX(x)fY (y) I E[g(X)h(Y )] = E[g(X)] E[h(Y )] I V(X + Y ) = V(X) + V(Y )

Covariance and independence

ndependence implies zero covariance, i.e. X |= Y =⇒ Cov(X,Y ) = 0. I Zero covariance does not imply independence, i.e. Cov(X,Y ) = 0 6=⇒ X |= Y . I For example, if X is a random variable which can take -1 or 1 with probability 1 2 , and Y is 0 if X = −1 and randomly takes -1 or 1 if X = 1 with probability 1 2 . In this case, Cov(X,Y ) = 0, but X and Y are dependent. I However, if X and Y follow jointly normal (bivariate1) distribution with zero covariance, they are independent.

X는 확률 1/2로 -1 또는 1을 가질 수 있는 랜덤 변수이고, Y는 X가 -1일 때 0이며, X가 1일 때는 확률 1/2로 -1 또는 1을 무작위로 갖습니다.

이 경우, Cov(X, Y) = 0입니다. X와 Y 사이에 선형 관계가 없다는 것을 뜻합니다. 즉, X의 값이 변할 때 Y의 값이 선형적으로 변하지 않는다는 뜻입니다.

그러나 X와 Y의 종속성을 확인할 수 있습니다.

  • X = -1일 때, Y는 항상 0입니다.
  • X = 1일 때, Y는 확률 1/2로 -1 또는 1을 가집니다.

X와 Y가 종속적(dependent)이라는 것은 X의 값에 따라 Y의 분포가 달라진다는 것입니다. 따라서 Cov(X, Y) = 0이지만, X와 Y는 종속적입니다.

그러나 X와 Y가 공분산이 0인 이변량 정규 분포(jointly normal (bivariate) distribution)를 따른다면, 이들은 독립적입니다.

Conditional independence

Since A |C and B |C are events, it is possible for them to be independent: P(A ∩B |C) = P(A |C)P(B |C) When C has known to have occurred, the occurrence of A does not give any information about the occurrence of B. Denote as A |= B |C. Note, I Two events that are unconditionally dependent may be conditionally independent. I Two events that are independent may be conditionally dependent

Conditional Expectation

정의 Conditional expectation of the variable X given Y = y is defined as E[X |Y = y] = {∑ x xpX|Y (x |y) (discrete case)∫ xfX|Y (x |y)dx (continuous case) , which is a function of y. If the particular value of Y is not specified, we can interpret E[X |Y ] as a function of Y , which is a random variable

Properties of conditional expectation

E[αX1 + βX2 |Y = y] = αE[X1 |Y = y] + β E[X2 |Y = y] E[g(X,Y ) |Y = y] = E[g(X,y) |Y = y] E[g(X)h(Y ) |Y = y] = h(y) E[g(X) |Y = y] E[E[Y |X]] = E[Y ] Cov(Y −E(Y |X),X) = 0 V(Y ) = E[V(Y |X)] + V(E[Y |X])

Conditioning on a random variable

문제 Random variables X and Y are i.i.d. (independent and identically distributed) samples drawn from some distribution. Compute E[X | X + Y ].

동일 분포라는 것은 X와 Y가 똑같이 분포되어 있다는 뜻입니다. 동일 분포로 E[X | X+Y]는 E[Y | X+Y]이다.

독립적이기 때문에 E[X|X+Y] + E[Y|X+Y] = E[X+Y|X+Y] = X+Y이다.

따라서 E[X|X+Y] + E[Y|X+Y] = X+Y = 2E[X|X+Y] E[X|X+Y] = X+Y / 2

Bayes’ rule

P(Ai | B) = P(Ai)P(B | Ai) / P(B)

문제 99.9%가 건강, 0.1%는 감염. 감염자는 정확하게 판별. 미감염자는 1%에게 감염되었다고 나온다. 이 테스트가 맞을 확률은?

P(감염자 | 테스트결과) = P(감염자) * P(테스트결과|감염자) / P(테스트결과) = 1 * 0.001 / (0.999 * 0.01) + (0.001 * 1)

테스트 결과 중 실제 감염자는 9.1%

=> 응용. 다양한 테스트를 했을때

Naive Bayes spam filter 하지만 단어사전에 전혀 등록되지 않는 것이면? la place smothing