15.17
연구자들은 종종 중심 경향에 대한 특정 척도(전체 데이터 포인트 집합을 나타내는 하나의 점수)를 사용하여 데이터를 요약합니다.
가장 간단한 측정은 가장 자주 발생하는 점수인 최빈번한 방법으로, 전문직과 같은 범주형 데이터의 총계를 계산할 때 유용합니다. 여기서 모드는 보고된 직업의 대부분을 구성하기 때문에 작가로 표시됩니다.
또 다른 측정값은 중앙값으로, 크기 순으로 정렬된 숫자 데이터 집합의 실제 중간점입니다. 여기서 급여의 중간값은 $65,000이며, 직원의 절반은 이 중간 수준 이하로 급여를 받습니다. 값의 수가 짝수인 경우 두 중간 숫자의 평균이 중앙값을 결정합니다.
마지막으로, 숫자 데이터에 대한 가장 일반적인 측정값은 평균(산술 평균)이며, 이는 모든 숫자 점수의 총 합을 데이터 포인트의 수로 나눈 값과 같습니다.
예를 들어, 모든 소득의 총합을 고용된 사람의 수로 나누면 이 경우 평균 $140,000가 됩니다. 이 측정값은 계산을 위해 데이터 세트의 모든 값을 고려하기 때문에 연구자들은 일반적으로 평균을 보고하는 것을 선호합니다.
정규 분포에서 최빈값, 평균, 중위수는 거의 동일한 값을 가지며 곡선의 중심에 정확히 배치됩니다. 그러나 치우친 분포에서는 매우 높거나 매우 낮은 점수가 더 널리 퍼져 있고 가중치가 더 높을 때 이러한 측정값이 동일하지 않습니다.
참가자의 대다수가 낮은 소득을 보고한 경우, 소수의 매우 높은 소득 점수로 인해 평균이 상승할 것입니다. 따라서 극한 값에 대한 평균의 민감도는 데이터가 인위적으로 높거나 낮게 표현되는 결과를 초래할 수 있습니다. 이 경우 중앙값 또는 최빈값이 더 정확한 측정 역할을 합니다.
결국, 중심 경향을 가장 잘 측정하는 방법은 현재 데이터의 분포 패턴을 고려하는 것입니다.
데이터 세트의 "중심"은 위치를 설명하는 방법이기도 합니다. 데이터의 "중심"에 대해 가장 널리 사용되는 두 가지 측정값은 평균(평균)과 중앙값입니다. "평균"과 "평균"이라는 단어는 종종 같은 의미로 사용됩니다. 한 단어를 다른 단어로 대체하는 것이 일반적인 관행입니…