分散計算機
データの「散らばり」を数学的に解明し、背後にある意味を読み解く
分散(Variance)とは何か?統計学の羅針盤
分散(ぶんさん)とは、データの散らばり具合を数値で表した統計量です。平均値が「データの中心がどこにあるか」を示すのに対し、分散は「それぞれのデータが平均からどの程度離れているか」を示します。
例えば、平均点が同じ「80点」の2つのクラスがあったとします。一方は全員が75点〜85点の間に収まっているクラス、もう一方は0点から100点まで激しく散らばっているクラス。この2つのクラスの性質の違いを明確に記述するために、分散という指標が必要になります。
標準偏差との違いは?
分散は偏差(データと平均の差)を2乗して平均したものであるため、単位も「元の単位の2乗」になってしまいます。これをもとの単位に戻すために、分散の正の平方根をとったものが標準偏差(Standard Deviation)です。実務ではこちらの方が直感的に理解しやすいため多用されます。
「母分散」と「不偏分散」の違いに注意!
分散には、計算目的によって2つの種類があります。ここの使い分けを間違えると、特に小さなサンプルサイズにおいて計算が不正確になります。
1. 母分散 (Population Variance)
目の前にあるデータが「対象のすべて(母集団)」である場合に使用します。例えば「クラス全員のテスト結果」から分散を出す場合はこちらです。偏差平方和をデータ数 N で割ります。
2. 不偏分散 (Sample Variance / Unbiased Variance)
一部のデータ(標本)から、まだ見ぬ全体(母集団)の分散を推測する場合に使用します。この場合、単に標本数で割ると分散を過小評価してしまうことが数学的に証明されています。そのため、n - 1 で割ることで補正を行います。これを「ベッセルの補正」と呼びます。
分散がビジネスや科学で重要な理由
分散は、単なる数学のテストの問題ではありません。現代社会の意思決定の根幹を支えています。
- 金融・投資: 株式投資において、価格変動の分散(または標準偏差)は「リスク」そのものとして定義されます。分散が大きいほど、大きな利益を得るチャンスもあれば、大損するリスクも高いことを意味します。
- 品質管理: 工場で製造される製品の寸法の分散を計算します。分散が大きい、つまり製品ごとのバラツキが大きいということは、製造工程に異常があるかもしれないというサインになります(6シグマなどの手法)。
- 医療・治験: 新薬の効果を測定する際、平均的な改善度だけでなく、患者ごとの効果の分散を確認します。一部の人に劇的に効き、一部の人には全く効かない薬は、管理が難しいからです。
計算ステップ:手計算で分散を出す方法
- すべてのデータの合計を出し、データ数で割って平均値を求めます。
- 各データから平均値を引き、偏差を求めます。
- 偏差をそれぞれ2乗します(これによりマイナスの値が消えます)。
- 2乗した偏差をすべて足し合わせます(偏差平方和)。
- 偏差平方和を、母分散ならN、不偏分散ならn-1で割ります。
よくある質問 (FAQ)
Q. なぜ偏差を2乗するのですか?そのまま足してはいけないのですか?
A. 偏差をそのまま足すと、プラスとマイナスが相殺されてしまい、合計は必ず「0」になってしまいます。ばらつきの大きさを絶対的な量として扱うために、2乗(または絶対値)をとる必要があります。
Q. 不偏分散で「n-1」で割るのはなぜですか?
A. 標本から平均を推定すると、各データは標本平均に「引っ張られる」ため、真の母分散よりもデータが平均に近いように見えてしまいます。n-1で割ることで、この偏り(バイアス)を打ち消し、より正確な母分散の推定値を得ることができるからです。
Q. 分散が 0 になることはありますか?
A. はい、すべてのデータが全く同じ値(例:全員が80点)の場合、偏差はすべて0になり、分散も0になります。これは「ばらつきが全くない」状態を意味します。