データサイエンスの基礎 – 4.統計分布を理解する

統計学はデータサイエンスの基本です。したがって、線形回帰やロジスティック回帰、主成分分析(PCA)、因子分析などの統計モデルを適切に使用するためには、統計分布を理解することが不可欠です。実際、SciPyパッケージのマニュアルには、統計分布に関連する関数が140以上掲載されています。

我々は皆、統計学を学び、正規分布、t分布、カイ二乗分布、F分布について学びました。私がデータサイエンティストになって数年、データサイエンティストが最も繰り返し質問することの1つが、「それぞれの分布はいつ使うのか?」「例えば、カイ二乗分布ではなくF分布を使うのはいつが適切なのか?」です。これに、この記事ではなるべく簡単に答えようと思います。

図1:どの分布をいつ使うのが適切なのか?

適切な分布を選択するためのレシピを説明する前に最もよく使われる分布、正規分布、(スチューデント)t分布、カイ二乗分布、F分布の定義と、それぞれを何に使うかを復習し、ます。

1.確率分布の特徴と使い方

確率分布には色々ありますが、それらには共通の特徴があります:

  1. これらはすべて、0と1の間の値を持つ値(または事象)の確率を与える。
  2. 考慮する変数(または事象)の値の範囲にわたるすべての確率の和、つまり確率分布の曲線下の積分は、正確に1に等しい。これは、可能性のある値(または事象)の確率をすべて足すと、すべて確実性に等しい値、つまり1の値にならなければならないという性質によるものである。
  3. ほとんどの場合、確率を計算するために分布を使うのではなく、値の信頼度を計算するために分布関数の累積形式を使います。例えば、変数xが分布p(x)に従う場合、値yがx以下である信頼度は、-infinityからxまでの関数p(.)の積分によって与えられる。

図2は、ある地区の高校生の年齢の確率の累積分布を示しています。この図から、高校生の年齢が18歳以下であることの信頼水準は0.9(すなわち90%)であることがわかります。

高校生の年齢の累積分布と信頼度計算

図2:高校生の年齢の累積分布と信頼度計算

高校生の年齢が18歳以下であるという仮説を立てれば、90%の信頼度でこの「仮説」を確認することができます。このように累積確率分布を使う方法を「仮説検定」といいます。

私たちは今、よく使われる確率分布を調べる立場にあります。

2.正規分布

この分布は、最も一般的なデータの分布です。例えば、学生の年齢、身長、学業成績は、ほとんどの県でこの分布に従います。正規分布の式は通常次のように書かれます:

ここでギリシャ文字のμは母集団における変数xの平均値、記号σはその標準偏差でです。

高校生の年齢の正規分布(平均17歳、標準偏差0.8)

図3:高校生の年齢の正規分布(平均17歳、標準偏差0.8)

以前に信頼度の概念を示すために使った図2は、この分布の累積形式です。

ほとんどの連続変数は正規分布として扱われますが、多くの場合、値の分布を調べると、そうではないことがわかります。変数の “正規性 “を検定する確立された手法があります。たとえば、線形回帰モデルの残差(誤差)が正規分布していることを確認するために、後でこれらの検定を使用します。変数が正規分布していない状況では、それらを(ほぼ)正規分布値に変換するために、いくつかの変換を用いることができます。そのような変換として最もよく使われるのは、Box-Cox 変換です。変数の分布を探索し変更する方法に関する今後の記事で、これらのテクニックを探索します。

3.スチューデントのt分布

t分布は正規分布とよく似ていますが、母集団ではなく「標本」の標準偏差と平均を用いる点が異なります。仮説検定では、小さな標本しかデータがないときに使われます。標本サイズが大きくなると、t分布は正規分布に近づきます。t分布は標本サイズ(n)に依存するので、n-1に等しい自由度で定義されます。

4.カイ二乗分布

カイ2乗(またはカイ2乗、X²)分布は、正規分布変数の2乗の合計を調査することから得られます。たとえば、3つの正規分布変数x1、x2、x3があるとすると、その和

はカイ2乗分布になります。また、変数の数である自由度は3であると言います。しかし、カイ2乗分布の自由度は2度しかありません。したがって、この場合のZの振る舞いは、自由度2のカイ2乗分布の振る舞いとなります。

5.F分布

それぞれ自由度nとmのカイ2乗分布を持つ2つの変数xとyから始めます。比

は、自由度(n、m)のF分布に従うため、F分布は、正規分布変数の2つの平方和の比の振る舞いを調査するのに使用できます。

6.どの分布を使うべきか?

前述したように、予測モデルを構築するとき、あるいは仮説検定を行うときに、我々は統計分布を使って関心のある量の信頼度を計算します。例えば、パラメトリックモデルを適合させるとき、我々はモデルパラメータが無作為に得られたものではなく、ある程度確実に真のパラメータであることを確認することに関心がります。その場合に、確率分布が重要になります。

さて、以下の表1のように、さまざまなモデルを構築するときに得られるさまざまな量の信頼水準(および区間)を計算するために、上記の3つの分布をどのように使うかをまとめることができます。

状況 使用する分布
連続変数があり、その平均と標準偏差がわかっている、または計算できる。 正規分布
我々は連続変数を持っており、限られたサイズの標本からその平均と標準偏差を計算した。 t分布
我々は値の2乗和を持っており、それらの各々は正規分布していると仮定できる。 カイ二乗分布
我々は2つの量の比を持っており,それらの各々は値の2乗和である-つまり,それらの各々はカイ二乗分布に従う。 F分布

表1連続変数の検定にどの分布を使用するかを決定するレシピ

上記のレシピは、連続量のモデリングにおけるデータサイエンティストのニーズのほとんどをカバーしています。もちろん、問題の性質上、他の分布を使う必要がある場合もあります。例えば、「故障するまでの時間」を研究する場合、ワイブル分布が最も適切です。別の例として、死亡率や富の分布のような非負のランダム値をモデル化するときは、対数ロジスティック(フィスクとしても知られている)分布が使われます。これらの分布や他の多くの分布は、狭い範囲の問題を表すために開発されていますが、最も広く適用できるのは、表1に挙げた4つの分布です。

まとめ

この記事では、4つの具体的な分布を検討することによって確率分布の重要な概念を探求し、それらを使用する場合の簡単なレシピを示しました。また、仮説検定の基本概念と信頼度の計算についても簡単に復習しました。これらの概念は、統計モデルや機械学習モデルの評価において不可欠です。

*この記事は、「Data Science Basics — (4) Understanding Statistical Distributions」を翻訳したものです。


データ分析・AIプラットフォームAltair® RapidMiner®


3.決定木とシンプソンのパラドックス << >> 5. 最小二乗法と最尤法の比較

0 0 votes
Article Rating

カテゴリー: Altair Global Blog, データアナリティクス

Subscribe
Notify of
0 Comments
Oldest
Newest