본문으로 건너뛰기

박스 플롯 계산기 - 무료 박스 및 위스커 플롯 생성기

박스 플롯 계산기는 데이터 집합을 입력하면 최솟값, 1사분위수, 중앙값, 3사분위수, 최댓값으로 이루어진 다섯 수치 요약을 구하는 도구다. 1.5 IQR 규칙으로 이상치를 찾아내고 상자 수염 그림으로 시각화해 통계 분석에 활용할 수 있다.

박스 플롯 계산기

로딩 계산기...
📚

문서화

상자수염그림이란?

상자수염그림이라고도 하는 상자그림은 최솟값, 제1사분위수, 중앙값, 제3사분위수, 최댓값의 다섯 값으로 숫자 집합을 요약하는 차트입니다. 모든 데이터 점을 나열하지 않고 데이터 대부분이 어디에 분포하는지 보여 주며, 이상치라고 하는 특이한 값도 표시합니다.

상자그림은 여러 숫자 집단을 한눈에 비교할 수 있어 통계, 과학 및 비즈니스 보고서에서 흔히 사용됩니다.

다섯 수치 요약

상자그림은 데이터를 가장 작은 값부터 가장 큰 값까지 정렬한 다음 계산한 다섯 숫자로 만듭니다.

  • 최솟값: 이상치가 아닌 값 중 가장 작은 값입니다. 이 계산기는 이를 "이상치 제외 최솟값"으로 표시합니다.
  • 제1사분위수(Q1): 데이터의 약 4분의 1이 그 값보다 작은 값입니다.
  • 중앙값(Q2): 데이터 집합의 가운데 값입니다.
  • 제3사분위수(Q3): 데이터의 약 4분의 3이 그 값보다 작은 값입니다.
  • 최댓값: 이상치가 아닌 값 중 가장 큰 값입니다. 이 계산기는 이를 "이상치 제외 최댓값"으로 표시합니다.

데이터 집합에 이상치가 없으면 이 두 값은 입력한 숫자 중 가장 작은 값과 가장 큰 값입니다. 이상치가 있으면 대신 수염의 끝점이 되므로, 입력한 값 중 가장 작거나 큰 숫자는 이상치 목록에 별도로 표시됩니다.

차트의 상자는 Q1에서 Q3까지 뻗습니다. 상자 안의 선은 중앙값을 나타냅니다. 수염이라고 하는 가느다란 선은 상자에서 최솟값과 최댓값 방향으로 뻗어 나갑니다. 이상치는 수염 바깥에 별도의 점으로 표시됩니다.

상자그림 공식

n개의 값이 오름차순으로 정렬된 데이터 집합의 경우:

중앙값. 개수가 홀수이면 중앙값은 가운데 값이다:

M=x(n+1)/2M = x_{(n+1)/2}

개수가 짝수이면 중앙값은 가운데에 있는 두 값의 평균이다:

M=xn/2+xn/2+12M = \dfrac{x_{n/2} + x_{n/2+1}}{2}

여기서 M은 중앙값이고, 위치 번호가 붙은 x는 정렬된 데이터에서 해당 위치의 값이다.

사분위수. 정렬된 데이터를 하위 절반과 상위 절반으로 나눕니다. n이 홀수이면 중앙값 자체는 두 절반에서 제외합니다. 그런 다음:

Q1=Ml,Q3=MuQ_1 = M_l, \qquad Q_3 = M_u

여기서 MlM_l은 하위 절반의 중앙값이고, MuM_u는 상위 절반의 중앙값이다.

이를 배타적 방법이라고 흔히 부릅니다. 다른 방법도 있으며, 작은 데이터 집합에서는 Q1과 Q3가 약간 다르게 계산될 수 있지만 이 계산기는 배타적 방법을 사용합니다.

사분위범위(IQR)

IQR=Q3−Q1IQR = Q_3 - Q_1

경계와 수염. 경계는 이상치의 경계를 표시합니다.

Fl=Q1−1.5×IQR,Fu=Q3+1.5×IQRF_l = Q_1 - 1.5 \times IQR, \qquad F_u = Q_3 + 1.5 \times IQR

여기서 FlF_l은 하한 경계이고, FuF_u는 상한 경계이다.

수염은 경계에서 정확히 멈추지 않습니다. 경계 안에 있으면서 가장 바깥쪽에 있는 데이터 점에서 멈춥니다.

Wl=min⁡{xi:xi≥Fl},Wu=max⁡{xi:xi≤Fu}W_l = \min\{x_i : x_i \geq F_l\}, \qquad W_u = \max\{x_i : x_i \leq F_u\}

여기서 WlW_l은 하위 수염이고, WuW_u는 상위 수염이다.

이상치. 하위 경계보다 작거나 상위 경계보다 큰 값은 이상치이며, 수염에 포함하지 않고 개별 점으로 표시합니다.

상자그림을 단계별로 계산하는 방법

  1. 데이터를 가장 작은 값부터 가장 큰 값까지 정렬합니다.
  2. 중앙값을 찾습니다. 개수가 홀수이면 가운데 값이고, 짝수이면 가운데 두 값의 평균입니다.
  3. Q1을 찾습니다. 데이터 하위 절반의 중앙값이며, 개수가 홀수일 때는 중앙값 자체를 제외합니다.
  4. 같은 규칙을 사용하여 Q3을 찾습니다. 이는 데이터 상위 절반의 중앙값입니다.
  5. IQR을 Q3에서 Q1을 뺀 값으로 계산합니다.
  6. IQR에 1.5를 곱하여 하위 경계와 상위 경계를 계산합니다.
  7. 경계 밖에 있는 모든 값을 이상치로 표시합니다.
  8. 경계 안에 남은 값 중 가장 작은 값과 가장 큰 값으로 수염을 설정합니다.

풀이 예시

11개의 값으로 이루어진 다음 데이터 집합을 살펴보겠습니다: 6, 7, 15, 36, 39, 40, 41, 42, 43, 47, 49. 이미 정렬되어 있습니다.

11개의 값은 홀수 개이므로 중앙값은 6번째 값인 40입니다.

하위 절반은 6, 7, 15, 36, 39입니다(다섯 값이며 중앙값은 제외). 중앙값은 가운데 값이므로 Q1 = 15입니다.

상위 절반은 41, 42, 43, 47, 49입니다. 중앙값은 가운데 값이므로 Q3 = 43입니다.

IQR = 43 − 15 = 28입니다.

하위 경계 = 15 − 1.5 × 28 = −27입니다. 상위 경계 = 43 + 1.5 × 28 = 85입니다. 데이터 집합의 모든 값이 −27과 85 사이에 있으므로 이상치는 없으며, 수염은 실제 최솟값과 최댓값까지 뻗습니다: 최솟값 = 6, 최댓값 = 49.

이제 이상치가 있는 데이터 집합과 비교해 보겠습니다: 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 50. 여기서 Q1 = 3.5, Q3 = 9.5, IQR = 6이므로 상위 경계는 9.5 + 1.5 × 6 = 18.5입니다. 50은 이 경계보다 크므로 이상치로 표시되며, 상위 수염은 50이 아니라 경계 안에 있는 가장 큰 값인 11에서 멈춥니다.

상자그림 읽는 방법

상자는 데이터의 가운데 50%를 포함하므로, 상자가 넓으면 데이터 가운데 부분이 넓게 퍼져 있고 상자가 좁으면 촘촘하게 모여 있다는 뜻입니다. 중앙값 선이 상자 한쪽 가장자리에 더 가까우면 데이터는 더 긴 쪽을 향해 치우쳐 있습니다. 한쪽 수염이 다른 쪽보다 훨씬 길면 데이터가 그쪽에서 더 길게 이어진다는 뜻입니다. 수염 바깥의 점은 이상치이며, 실제 극단값일 수도 있고 데이터 오류일 수도 있으므로 자세히 살펴볼 필요가 있습니다.

일반적인 사용 사례

상자그림은 여러 학급의 시험 점수, 두 공급업체의 배송 시간, 대조군과 비교한 실험 측정값처럼 집단을 나란히 비교하는 데 사용됩니다. 상자그림은 전체 분포를 다섯 숫자로 압축하므로 여러 개를 하나의 차트에 배열할 수 있으며, 원자료 숫자 표보다 집단 간 산포와 대표적인 값을 쉽게 비교할 수 있습니다.

다른 차트와 비교한 상자그림

히스토그램은 분포의 전체 형태를 더 자세히 보여 주지만 여러 집단을 한 번에 비교하기는 어렵습니다. 바이올린 플롯은 상자 주위에 밀도 곡선을 추가하여 값이 어디에 더 정확하게 모여 있는지 보여 줍니다. 산점도는 상자그림으로는 알 수 없는 두 변수 사이의 관계를 보여 줍니다. 목적이 집단 비교인지(상자그림), 한 분포의 형태를 자세히 파악하는 것인지(히스토그램 또는 바이올린 플롯), 관계를 연구하는 것인지(산점도)에 따라 적절한 차트가 달라집니다.

역사

통계학자 존 튜키는 1970년대에 상자그림을 소개했으며, 1977년에 출간한 저서 탐색적 자료 분석에서 이를 설명했습니다. 때로 도식적 플롯이라고도 하는 그의 원래 방식은 중앙값, 사분위수 및 극단값을 보여 주었습니다. 1978년에는 통계학자 로버트 맥길, 튜키, 웨인 라슨이 중앙값 주위에 신뢰구간을 추가한 노치형을 설명했습니다. 이상치를 표시하는 1.5 × IQR 규칙은 얼마 지나지 않아 표준 관례가 되었습니다.

자주 묻는 질문

상자그림은 어디에 사용하나요? 최솟값, Q1, 중앙값, Q3 및 최댓값을 사용하여 숫자 집합이 어떻게 퍼져 있는지 보여 주고 예상되는 이상치를 표시합니다. 특히 여러 집단을 하나의 차트에서 비교할 때 유용합니다.

상자그림은 어떻게 읽나요? 상자는 Q1에서 Q3까지 이어지며 데이터의 가운데 절반을 포함합니다. 상자 안의 선은 중앙값입니다. 수염은 이상치가 아닌 가장 극단적인 값까지 이어지고, 수염 바깥의 값은 별도의 점으로 표시됩니다.

상자그림에서 이상치는 어떻게 식별하나요? 값이 Q1 − 1.5 × IQR보다 작거나 Q3 + 1.5 × IQR보다 크면 이상치입니다.

상자그림과 히스토그램의 차이는 무엇인가요? 상자그림은 분포를 다섯 숫자와 이상치로 압축하므로 간결하고 집단 비교에 적합합니다. 히스토그램은 구간별 값의 빈도를 보여 주어 하나의 분포 형태를 더 자세히 나타냅니다.

이 계산기는 작은 데이터 집합도 처리할 수 있나요? 이 계산기는 다섯 수치 요약을 만들기 위해 최소 다섯 개의 숫자가 필요합니다. 값이 몇 개뿐이면 산포나 이상치를 파악하기 어렵기 때문에 상자그림은 더 큰 데이터 집합에서 정보를 더 잘 보여 줍니다.

계산기는 어떤 입력을 받나요? 쉼표, 공백 또는 줄 바꿈으로 구분된 숫자를 받으므로 스프레드시트에서 열을 붙여 넣어도 됩니다. 숫자가 아닌 항목은 건너뛰지 않고 거부하므로 오타 때문에 결과가 조용히 바뀌는 일이 없습니다.

상자그림이 치우쳐 보인다는 것은 무슨 뜻인가요? 중앙값이 Q1에 더 가까우면 데이터의 높은 쪽 꼬리가 더 깁니다. 중앙값이 Q3에 더 가까우면 데이터의 낮은 쪽 꼬리가 더 깁니다.