IT用語を超やさしく理解する
確率分布
別名: 確率分布 / 確率変数 / ベルヌーイ分布 / 二項分布 / ポアソン分布 / 正規分布 / 指数分布 / probability distribution
先に知っておくと分かりやすいことば(2語)
必要なら先に確認できます。知っていることばは、そのまま読み進めて大丈夫です。
- 場合の数・順列・組合せ場合の数の数え方、階乗、順列と組合せの違い、nPrとnCrの基本的な使い分けを初心者向けに説明します。
- 確率の基本標本空間と事象、基本的な確率の求め方、余事象、加法定理、独立な事象の乗法と同時確率を初心者向けに説明します。
30秒で思い出す
確率分布は「どの値が、どれくらいの確率で現れるか」を整理したものです。
たとえばコインを2回投げたとき、「表が出た回数」をXとすると、
X=0 → 1/4
X=1 → 1/2
X=2 → 1/4
となります。
このように、値とその起こりやすさを対応させたものが確率分布です。
確率変数とは?
ランダムな結果を数値に対応させたものを確率変数と呼びます。
コインを2回投げる例なら、
- 裏・裏 → X=0
- 表・裏 / 裏・表 → X=1
- 表・表 → X=2
のように、「表の回数」を数値として扱えます。
確率分布は、この確率変数Xがそれぞれの値を取る確率を整理したものです。
離散分布と連続分布
確率分布は、大きく離散分布と連続分布に分けて考えます。
離散分布
取り得る値を1つずつ数えられる分布です。
例:
- 成功したか失敗したか
- 10回中の成功回数
- 1時間に発生した障害件数
連続分布
ある区間の中で連続的な値を取る分布です。
例:
- 処理時間
- 応答時間
- 温度
- 部品寿命
連続分布では、特定の1点そのものより「ある区間に入る確率」を考えます。
ベルヌーイ分布
1回の試行で、成功 / 失敗の2結果だけを考える分布です。
成功確率をpとすると、
成功 → p
失敗 → 1-p
です。
たとえば、
- パケットが正常 / エラー
- 認証が成功 / 失敗
- 部品が故障 / 正常
のような1回の二者択一を表す基本モデルです。
二項分布
同じ成功確率pを持つ独立な試行をn回行ったときの成功回数を表します。
成功回数がちょうどk回になる確率は、
P(X=k)
= nCk × p^k × (1-p)^(n-k)
です。
たとえば公平なコインを3回投げて、表がちょうど2回出る確率は、
3C2 × (1/2)^2 × (1/2)
= 3/8
です。
二項分布を使う典型条件は、
- 試行回数nが決まっている
- 各試行は成功 / 失敗に分けられる
- 成功確率pが同じ
- 各試行が独立
です。
ポアソン分布
一定の時間や範囲の中で、ある出来事が何回起こるかを表す代表的な離散分布です。
典型的には、出来事が互いに独立に起こり、平均的な発生率を一定とみなせる状況をモデル化します。
例:
- 1時間あたりの障害件数
- 1分間の着信件数
- 一定範囲で発生する欠陥数
「決まった回数だけ試す」のではなく、一定の時間・空間内で発生回数を数える点が二項分布との大きな違いです。
ただし、「一定時間に件数を数える」だけで必ずポアソン分布になるわけではありません。独立性や発生率など、問題で与えられた前提を確認します。
まずは「何を数える分布か」と「どのような前提があるか」を見分けることが重要です。
正規分布
平均の周りに値が集まり、左右対称の山型になる代表的な連続分布です。
多くの測定値や誤差を扱う場面で現れます。
特徴:
- 平均付近が最も多い
- 平均から離れるほど少なくなる
- 左右対称
- 平均と標準偏差で形を表す
標準偏差の詳しい計算や統計分析は、後続の統計Routeで扱います。
指数分布
一定の平均発生率で独立に出来事が起こるとみなせるとき、次の出来事が起こるまでの待ち時間を表す代表的な連続分布です。
例:
- 次の障害が発生するまでの時間
- 次の要求が到着するまでの時間
ポアソン分布が「一定時間に何回起こるか」を数えるのに対し、指数分布は同じような発生モデルで「次に起こるまでどれくらい待つか」を扱う、と整理すると区別しやすくなります。
すべての待ち時間が指数分布になるわけではないため、問題の前提を確認します。
どの分布を選ぶ?
問題文で、何を数えているかを確認します。
1回の成功 / 失敗
→ ベルヌーイ分布
n回の独立試行で成功した回数
→ 二項分布
独立に、ほぼ一定の平均発生率で起こる出来事の発生回数
→ ポアソン分布
平均の周りに連続値が山型に分布
→ 正規分布
一定率で起こる出来事の、次の発生までの待ち時間
→ 指数分布
分布名を暗記するだけでなく、確率変数が何を表しているかを見ることが重要です。
どこで使う?
確率分布は、ばらつきのある結果をモデル化するときに使います。
ITでは、たとえば、
- エラー回数
- 障害件数
- リクエスト到着数
- 応答時間
- 部品寿命
- 成功回数
などを確率として扱う基礎になります。
よくある勘違い
二項分布とポアソン分布は同じ?
違います。
二項分布は「n回試したうち何回成功したか」、ポアソン分布は「一定時間や範囲で何回起きたか」を扱います。
正規分布はどんなデータにも使える?
違います。
正規分布は代表的なモデルですが、すべてのデータが正規分布になるわけではありません。問題の前提やデータの性質を確認します。
指数分布は発生回数を表す?
基本的には待ち時間を表します。
発生回数を扱うポアソン分布と混同しないようにします。
一定時間の件数なら必ずポアソン分布、待ち時間なら必ず指数分布?
違います。
どちらも、出来事の独立性や平均発生率などの前提を置く代表的なモデルです。問題文の条件を確認して使います。
確率分布は全部公式まで暗記する必要がある?
まずは、各分布が何を表すモデルなのかを見分けることが優先です。
このKnowledgeでは二項分布の基本計算まで扱い、他の分布の高度な計算や導出は扱いません。
このKnowledgeで扱わないこと
ここでは、確率変数、離散 / 連続の違い、代表的な確率分布の意味と使い分け、二項分布の基本計算を扱います。
次は後続Knowledgeへ分けます。
- 期待値の計算
- 分散 / 標準偏差の詳細
- 正規分布の標準化
- 高度な分布計算
- マルコフ過程
- 統計的推定 / 仮説検定
ここまで分かればOK
- 確率変数と確率分布の意味を説明できる
- 離散分布と連続分布を区別できる
- ベルヌーイ / 二項 / ポアソン / 正規 / 指数分布が何を表すか説明できる
- 問題の状況から適切な代表分布を選べる
- 二項分布で成功回数の基本確率を求められる
資格との関係
基本情報技術者試験
- シラバス
- Ver.9.2
- 必要な理解
- 問題で応用できる
- 重要度
- 高
- 分野
- テクノロジ
関連するIT用語
次に読む
理解できたか確認しよう
答えを選んで、なぜそうなるのかまで確認できます。
確認問題 1
3回中ちょうど2回成功する確率を求める
成功確率が0.5の独立な試行を3回行います。
ちょうど2回成功する確率として正しいものはどれですか?
確認問題 2
エラー回数に合う確率分布を選ぶ
10個のパケットを送信します。各パケットは独立に送信され、どのパケットも同じ確率でエラーになるものとします。
10個のうちエラーになったパケット数を表すのに最も適した確率分布はどれですか?