15.18
In the field of psychology, there are several ways to organize measurements of a trait, feature, or characteristic (i.e., variables). Qualitative data…
Dans le cadre d’un projet de collecte de données, un étudiant s’intéresse à la taille des hommes adultes dans leur ville.
De retour en classe, les élèves représentent graphiquement la fréquence des tailles dans l’échantillon de population. La courbe résultante est en forme de cloche, avec un seul pic au centre duquel se trouve la moyenne.
Si un seul point de données, tel que la moyenne, est crucial pour l’analyse de ces résultats, la variation l’est tout autant. Définie comme la dispersion des mesures au sein d’un ensemble de données, cette grandeur décrit la dispersion des résultats, donnant une idée de la distance entre les points.
De plus, le graphique est symétrique, la moitié des individus présentant une stature supérieure à la moyenne et l’autre moitié plus petite que la moyenne. C’est ce qu’on appelle une distribution normale ou une courbe.
Pour évaluer la variation, ils calculent d’abord la plage des résultats, c’est-à-dire la différence entre les hauteurs les plus hautes et les plus basses.
Bien que la plage décrive la répartition des données, elle peut être considérablement affectée par des valeurs aberrantes, comme le plus grand joueur de basket-ball de l’école, et n’explique pas comment les mesures sont positionnées autour de la moyenne.
Pour résoudre ce problème, l’étudiant utilise une équation pour calculer un deuxième indicateur de variation, appelé écart-type, c’est-à-dire l’écart moyen entre les mesures et la moyenne.
Ici, l’écart-type est de deux pouces et demi, de sorte que les mâles sont, en moyenne, deux pouces et demi plus courts ou plus grands que la moyenne. Sur la base des propriétés d’une distribution normale, à l’intérieur de cet écart-type négatif et positif, 68 % des individus tomberont.
Ce nombre passera à 95 % pour deux écarts-types, ici cinq pouces au-dessus ou en dessous de la hauteur moyenne, et à 99,7 % pour trois écarts-types. Il est important de noter que plus l’écart-type est faible, plus les résultats se regroupent étroitement autour de la moyenne, ce qui produit une courbe normale haute et étroite.
Ainsi, si un ensemble de données a un petit écart-type, il aura une faible variation. Ainsi, les moyennes des mesures à faible variabilité sont plus susceptibles d’être une représentation fiable de la population de l’échantillon que celles dérivées des résultats à forte variabilité, qui peuvent être influencées de manière disproportionnée par les valeurs aberrantes.
View the full transcript and gain access to JoVE Core videos
Q1: What is a normal distribution and why does it matter in data analysis?
A normal distribution is a bell-shaped curve where data clusters symmetrically around the mean, with half the values above and half below the average. This pattern is important because it allows researchers to predict how measurements spread across a population and assess the reliability of the mean as a representative value for the sample.
Q2: How does standard deviation differ from range when measuring data spread?
Range measures only the difference between the highest and lowest values, making it vulnerable to outliers. Standard deviation calculates the average distance all measurements differ from the mean, providing a more comprehensive view of how tightly data clusters around the center and better reflecting true variation in the dataset.
Q3: What does it mean when data has a low standard deviation?
Low standard deviation indicates measurements cluster tightly around the mean, producing a tall and narrow normal curve. This means results have low variation and the mean is a more reliable representation of the sample population, whereas high variation may be disproportionally affected by outliers.
Q4: How do you calculate standard deviation from deviation scores?
First, subtract the mean from each raw score to create deviation scores. Square these deviations to convert negatives to positives, then sum them to get the sum of squares. Divide by the number of data points or degrees of freedom, then take the square root of that result to obtain the standard deviation.
Q5: What percentage of data falls within one standard deviation in a normal distribution?
Within one standard deviation above and below the mean, approximately 68% of individuals fall in a normal distribution. This percentage increases to 95% for two standard deviations and 99.7% for three standard deviations, allowing researchers to predict where most measurements will cluster.
Q6: Why is variance an important step before calculating standard deviation?
Variance estimates the average distance of all scores around the mean by squaring deviations, which converts negative values to positive and prevents them from canceling out. Taking the square root of variance yields standard deviation, which returns the measurement to its original units and makes it more interpretable for describing data spread.
Q7: How can outliers affect the reliability of the range as a measure of variation?
Outliers like an exceptionally tall basketball player can dramatically inflate the range, making it appear that data spreads more widely than it actually does. This misrepresentation makes range a less precise method for measuring variation compared to standard deviation, which accounts for all data points rather than just extremes.