コンテンツにスキップ

箱ひげ図計算ツール - 無料の箱ひげ図生成器

データセットの最小値、第1四分位数、中央値、第3四分位数、最大値からなる五数要約を計算し、1.5×IQR則を用いて外れ値を検出したうえで箱ひげ図として視覚的に表示する無料ツール。統計分析やデータサイエンスの授業、研究資料の作成に、誰でも無料で幅広く役立てられる。

箱ひげ図計算ツール

ローディング計算機...
📚

ドキュメンテーション

箱ひげ図とは何か?

箱ひげ図(ボックス・アンド・ウィスカー・プロットとも呼ばれます)は、最小値、第1四分位数、中央値、第3四分位数、最大値という5つの値を使って数値の集合を要約するグラフです。すべてのデータ点を列挙せずに、データの大部分がどこに位置するかを示し、外れ値と呼ばれる異常な値を見つけやすくします。

箱ひげ図は、複数の数値グループをひと目で比較できるため、統計、科学、ビジネスレポートでよく使われます。

5数要約

箱ひげ図は、データを小さい順から大きい順に並べ替えた後で計算する5つの数値から作られます。

  • 最小値:外れ値ではない最小の値。この計算機では「最小値(外れ値を除く)」と表示されます。
  • 第1四分位数(Q1):データのおよそ4分の1がこの値未満になる値。
  • 中央値(Q2):データセットの中央の値。
  • 第3四分位数(Q3):データのおよそ4分の3がこの値未満になる値。
  • 最大値:外れ値ではない最大の値。この計算機では「最大値(外れ値を除く)」と表示されます。

データセットに外れ値がない場合、この2つの値は入力された数値の単純な最小値と最大値です。外れ値がある場合は、これらがひげの端となるため、入力された数値のうち最小または最大の値は外れ値の一覧に別途表示されます。

グラフの箱はQ1からQ3まで広がります。箱の内部の線は中央値を示します。ひげと呼ばれる細い線が箱から最小値と最大値の方向へ伸びます。外れ値は、ひげの外側に別々の点として描かれます。

箱ひげ図の公式

n個の値を昇順に並べたデータセットの場合:

中央値。 個数が奇数のとき、中央値は中央の値です:

M=x(n+1)/2M = x_{(n+1)/2}

個数が偶数のとき、中央値は中央にある2つの値の平均です:

M=xn/2+xn/2+12M = \dfrac{x_{n/2} + x_{n/2+1}}{2}

ここで、Mは中央値、位置番号の付いたxは、並べ替えたデータにおけるその位置の値です。

四分位数。 並べ替えたデータを下半分と上半分に分けます。nが奇数の場合は、中央値そのものをどちらの半分からも除きます。そのうえで:

Q1=Ml,Q3=MuQ_1 = M_l, \qquad Q_3 = M_u

ここで、MlM_lは下半分の中央値、MuM_uは上半分の中央値です。

これは排他的手法と呼ばれることがよくあります。ほかの手法もあり、小さなデータセットではQ1とQ3がわずかに異なることがありますが、この計算機では排他的手法を使用しています。

四分位範囲(IQR)

IQR=Q3−Q1IQR = Q_3 - Q_1

境界値とひげ。 境界値は外れ値の境界を示します:

Fl=Q1−1.5×IQR,Fu=Q3+1.5×IQRF_l = Q_1 - 1.5 \times IQR, \qquad F_u = Q_3 + 1.5 \times IQR

ここで、FlF_lは下側境界値、FuF_uは上側境界値です。

ひげは境界値の位置で正確に止まるわけではありません。境界値の内側にあるデータ点のうち、最も端にある点で止まります:

Wl=min⁡{xi:xi≥Fl},Wu=max⁡{xi:xi≤Fu}W_l = \min\{x_i : x_i \geq F_l\}, \qquad W_u = \max\{x_i : x_i \leq F_u\}

ここで、WlW_lは下ひげ、WuW_uは上ひげです。

**外れ値。**下側境界値未満または上側境界値超の値は外れ値であり、ひげに含めず、個別の点としてプロットします。

箱ひげ図の計算方法

  1. データを小さい順から大きい順に並べます。
  2. 中央値を求めます。個数が奇数なら中央の値、偶数なら中央にある2つの値の平均です。
  3. Q1を求めます。データの下半分の中央値です(個数が奇数の場合、中央値そのものは除きます)。
  4. Q3を求めます。同じ規則を使い、データの上半分の中央値を求めます。
  5. IQRをQ3からQ1を引いて計算します。
  6. IQRに1.5を掛けて、下側境界値と上側境界値を計算します。
  7. 境界値の範囲外にある値を外れ値として示します。
  8. 境界値の範囲内に残る値のうち、最小値と最大値をひげの端に設定します。

計算例

11個の値からなる次のデータセットを考えます:6、7、15、36、39、40、41、42、43、47、49。すでに並べ替えられています。

11個の値(奇数)では、中央値は6番目の値である40です。

下半分は6、7、15、36、39です(5個の値で、中央値は除外)。中央値は中央の値なので、Q1 = 15です。

上半分は41、42、43、47、49です。中央値は中央の値なので、Q3 = 43です。

IQR = 43 − 15 = 28。

下側境界値 = 15 − 1.5 × 28 = −27。上側境界値 = 43 + 1.5 × 28 = 85。データセットのすべての値が−27から85の間にあるため、外れ値はなく、ひげは実際の最小値と最大値まで伸びます:最小値 = 6、最大値 = 49。

次に、外れ値を含むデータセットと比較します:1、2、3、4、5、6、7、8、9、10、11、50。ここではQ1 = 3.5、Q3 = 9.5、IQR = 6であり、上側境界値は9.5 + 1.5 × 6 = 18.5となります。50はこの境界値を超えるため外れ値としてプロットされ、上ひげは50ではなく、境界値の範囲内にある最大値11で止まります。

箱ひげ図の読み方

箱はデータの中央50%を表すため、箱が広い場合はデータの中央部分が広く分散しており、箱が狭い場合は密集しています。中央値の線が箱の一方の端に近い場合、データは長い側に偏っています。片方のひげがもう一方よりかなり長い場合、その側に向かってデータがより長く尾を引いていることを示します。ひげの外側にある点は外れ値であり、実際の極端な値やデータ上の誤りである可能性があるため、詳しく確認することがあります。

一般的な用途

箱ひげ図は、複数のクラスのテスト得点、2社の供給業者の配達時間、実験の測定値と対照群の測定値など、グループを横に並べて比較するために使われます。箱ひげ図は分布全体を5つの数値に要約するため、1つのグラフに複数の箱ひげ図を並べられ、元の数値を並べた表よりもグループ間のばらつきや典型的な値を比較しやすくなります。

箱ひげ図とほかのグラフの比較

ヒストグラムは分布の全体的な形をより詳しく示しますが、多数のグループを一度に比較する用途には向きません。バイオリンプロットは箱の周囲に密度曲線を加え、値がどこに集中しているかをより正確に示します。散布図は2つの変数の関係を示しますが、箱ひげ図ではそれを示せません。適切なグラフは目的によって異なり、グループの比較には箱ひげ図、1つの分布の形の詳細な確認にはヒストグラムまたはバイオリンプロット、関係の分析には散布図を使います。

歴史

統計学者ジョン・テューキーは1970年代に箱ひげ図を導入し、1977年の著書『探索的データ解析』で説明しました。原型の箱ひげ図は、図式プロットと呼ばれることもあり、中央値、四分位数、極値を示していました。1978年には、統計学者のロバート・マギル、テューキー、ウェイン・ラーセンが、中央値の周囲に信頼区間を加えた切れ込み付きの形式を説明しました。外れ値を示す1.5 × IQRの規則は、その後まもなく標準的な慣例になりました。

よくある質問

箱ひげ図は何に使われますか? 最小値、Q1、中央値、Q3、最大値を使って、数値の集合がどのように分散しているかを示し、外れ値の可能性がある値を見つけやすくします。1つのグラフで複数のグループを比較するときに特に役立ちます。

箱ひげ図はどのように読みますか? 箱はQ1からQ3まで広がり、データの中央半分を表します。箱の内部の線は中央値です。ひげは外れ値ではない最も端の値まで伸び、ひげの外側にある値は別々の点として描かれます。

箱ひげ図で外れ値を特定するにはどうしますか? Q1 − 1.5 × IQR未満、またはQ3 + 1.5 × IQRを超える値は外れ値です。

箱ひげ図とヒストグラムの違いは何ですか? 箱ひげ図は分布を5つの数値と外れ値に要約するため、コンパクトでグループ比較に適しています。ヒストグラムは範囲ごとの値の度数を示し、1つの分布の形をより詳しく表します。

この計算機は小さなデータセットに対応していますか? この計算機で5数要約を作成するには、少なくとも5個の数値が必要です。少数の値ではばらつきや外れ値を把握しにくいため、箱ひげ図はより大きなデータセットで使うほうが情報量が多くなります。

計算機はどのような入力を受け付けますか? コンマ、スペース、または改行で区切った数値を受け付けるため、スプレッドシートから列を貼り付けることもできます。数値でないものは読み飛ばされずに拒否されるため、入力ミスによって結果が気づかないうちに変わることはありません。

箱ひげ図が歪んで見える場合、それは何を意味しますか? 中央値がQ1に近い場合、データは高い側に長い裾を持ちます。中央値がQ3に近い場合、データは低い側に長い裾を持ちます。