예측 모델 이야기7/28 (화) 12:35

베이지안 추정과 shrinkage로 불확실성 줄이기

목차

1.사전 지식과 데이터의 결합 원리

베이지안 추정은 기존에 알고 있는 사전 정보(사전 확률)와 새로 수집된 데이터를 결합하여 사후 확률을 갱신해 나가는 통계적 방법입니다. 관측된 데이터의 양이 적을 때 발생하는 불확실성을 다루는 데 특히 유용합니다.

이 기법은 스스로 학습하는 AI 개념이 아니며, 사전 정보와 데이터를 조합해 파라미터를 추정하는 정통 통계 모델입니다. 데이터가 점차 쌓이면서 사후 확률은 실제 관측 데이터에 수렴하게 됩니다. 정밀한 불확실성 추정 원리에 대한 상세 설명은 방법론 페이지에서도 확인할 수 있습니다.

2.소표본 문제를 해결하는 shrinkage

시즌 초반처럼 경기 표본이 적을 때는 몇 번의 연승이나 연패로 인해 특정 팀의 전력이 지나치게 높거나 낮게 평가될 위험이 있습니다. 베이지안 관점에서는 이를 방지하기 위해 추정치를 리그 평균 방향으로 당겨주는 shrinkage 기법을 사용합니다.

구분표본이 적을 때 문제점베이지안 shrinkage 적용 후
전력 평가극단적인 수치로 과대/과소평가리그 평균으로 당겨 추정 안정화
불확실성데이터 부족으로 오차 가능성 큼사전 정보를 활용해 편차 완화

스탯굿 모델 역시 표본이 적은 상황에서 '팬텀 경기'(리그 평균)를 도입하는 shrinkage 방식을 적용하여 팀 세기 추정치를 안정화합니다.

3.베이지안 추정의 한계

베이지안 추정 기법을 활용할 때는 몇 가지 한계점을 명심해야 합니다.

  • 사전 설정의 편향: 초기 사전 확률을 잘못 설정할 경우 추정 결과에 편향이 발생할 수 있습니다.
  • 적용 방식의 한계: 현재 스탯굿 모델은 복잡한 풀 베이지안 기법 전체가 아닌, 단순 shrinkage 수준으로만 적용하고 있습니다.

4.자주 묻는 질문

베이지안 추정이 스스로 학습하는 AI인가요?

아닙니다. 베이지안 추정은 사전 정보와 관측 데이터를 결합해 파라미터를 추정하는 통계 방법입니다. 데이터가 축적됨에 따라 사후 확률이 데이터에 수렴하는 구조입니다.

shrinkage 기법은 왜 필요한가요?

시즌 초반과 같이 표본 데이터가 적을 때 과도한 전력 추정이 나오는 것을 막기 위해 필요합니다. 팀 세기를 리그 평균 쪽으로 당겨 추정치를 안정적으로 유지해 줍니다.

사전 확률을 잘못 잡으면 어떻게 되나요?

초기 사전 지식을 잘못 설정하면 모델 결과에 편향이 생길 수 있다는 한계가 있습니다.

본 글은 공개 데이터와 자체 모델을 바탕으로 한 정보 제공 목적이며, 특정 베팅을 권유하지 않습니다. 예측은 빗나갈 수 있으며 투자·베팅의 책임은 본인에게 있습니다. 만 19세 미만 이용 불가. 도박 문제 상담: 한국도박문제예방치유원 1336.

관련 글

정보 제공 목적 · 베팅 권유가 아니에요 · 만 19세 미만 이용 불가