Application des statistiques descriptives à la recherche sociale
Les statistiques descriptives constituent l'un des fondements essentiels de la recherche sociale. Avant de procéder à une analyse inférentielle – comme la vérification d'hypothèses, la régression ou la modélisation des relations entre variables – les chercheurs doivent appréhender la nature des données recueillies. C'est là que les statistiques descriptives entrent en jeu : elles permettent de résumer, de présenter et de décrire systématiquement les caractéristiques des données afin d'en faciliter la compréhension. Dans le contexte de la recherche sociale, qui porte souvent sur les comportements, les attitudes, les opinions et les conditions sociétales, les statistiques descriptives aident les chercheurs à saisir les tendances générales ainsi que les variations au sein d'une population ou d'un échantillon.
Définition et objectif des statistiques descriptives
En termes simples, les statistiques descriptives regroupent un ensemble de méthodes permettant de traiter des données et d'en extraire des informations concises et pertinentes. L'objectif n'est pas de tirer des conclusions générales applicables à une population plus large, mais plutôt de décrire les données disponibles. En recherche sociale, cet objectif est important car les données sont souvent complexes : les répondants sont divers, les variables peuvent être de nature mixte (nominales, ordinales, d'intervalle, de rapport) et le contexte social est dynamique.
Grâce aux statistiques descriptives, les chercheurs peuvent répondre à des questions fondamentales telles que : Qui sont les répondants à cette étude ? Quelle est leur répartition par âge, niveau d’éducation ou revenu ? Quel est le niveau d’approbation d’une politique ? Quelle est l’ampleur des variations d’opinion entre les groupes ? Ces réponses aident les chercheurs à construire un récit cohérent et à jeter les bases d’analyses plus approfondies.
Types de données en recherche sociale
L'application des statistiques descriptives dépend du type de données recueillies. La recherche sociale utilise généralement :
1. Données nominales, telles que le sexe, la situation professionnelle, la zone de résidence ou l'appartenance à une organisation. Ces données sont simplement des catégories sans aucun ordre.
2. Données ordinales, par exemple le niveau d'éducation ou une échelle d'attitude (de « tout à fait d'accord » à « tout à fait en désaccord »). Il existe un ordre, mais la distance entre les catégories n'est pas toujours la même.
3. Données d'intervalle, par exemple les scores d'indices de satisfaction ou les résultats de tests. La distance entre les valeurs est considérée comme égale, mais il n'y a pas de zéro absolu.
4. Données de ratio, par exemple le revenu, le nombre d'enfants ou la durée de service, qui ont un zéro absolu et permettent des comparaisons de ratio.
Comprendre l'échelle des données aide les chercheurs à choisir la mesure appropriée : la moyenne convient aux données d'intervalle/de rapport, tandis que la médiane ou le mode sont souvent plus appropriés aux données ordinales, et la fréquence est dominante pour les données nominales.
Mesures de centralisation : moyenne, médiane et mode
Les mesures de tendance centrale servent à décrire les valeurs « typiques » des données.
La moyenne est très souvent utilisée pour les données d'intervalle et de rapport, comme le revenu moyen des ménages ou le nombre moyen d'heures travaillées par semaine. Cependant, elle est sensible aux valeurs extrêmes. En sciences sociales, les valeurs aberrantes, telles que les revenus très élevés, peuvent fausser la moyenne et donner une image moins représentative.
La médiane est la valeur centrale après le tri des données. Plus robuste face aux valeurs aberrantes, elle est souvent utilisée pour des variables comme les revenus ou les dépenses, dont la distribution est généralement asymétrique.
– Le mode est la valeur qui apparaît le plus fréquemment. Il est particulièrement utile pour les données nominales, comme la catégorie professionnelle la plus fréquemment détenue par les répondants.
En combinant ces trois éléments, les chercheurs peuvent interpréter les données de manière plus équilibrée et ne pas se focaliser sur une seule mesure.
Mesures de dispersion : variance, écart type et étendue
La recherche sociale nécessite des informations non seulement sur la moyenne, mais aussi sur la variabilité des réponses. Deux groupes peuvent présenter la même satisfaction moyenne, mais des niveaux de variation différents : l’un homogène, l’autre très diversifié.
L'étendue indique la différence entre la valeur maximale et la valeur minimale. C'est une mesure simple, mais facilement influencée par les valeurs aberrantes.
La variance et l'écart type mesurent la dispersion des données autour de la moyenne. L'écart type est plus couramment utilisé car il a les mêmes unités que les données d'origine, ce qui facilite son interprétation.
– L’écart interquartile (EIQ), qui est la distance entre le troisième quartile et le premier quartile, est souvent utilisé lorsque les données ne sont pas normalement distribuées ou contiennent des valeurs aberrantes.
Dans les enquêtes sociales, un écart type important sur une échelle d'attitude peut indiquer une polarisation des opinions au sein de la société, tandis qu'un écart type faible peut indiquer un consensus.
Distribution des données et formulaires de distribution
Les statistiques descriptives prennent également en compte la distribution des données. Deux concepts fréquemment abordés sont :
– Asymétrie : une distribution est asymétrique à droite ou à gauche. Par exemple, la distribution des revenus est généralement asymétrique à droite car un faible pourcentage de la population perçoit des revenus très élevés.
– Kurtosis : décrit la netteté des pics et l’épaisseur des queues de la distribution. Dans un contexte social, le kurtosis permet de comprendre si les données sont concentrées autour de certaines valeurs ou dispersées vers des valeurs extrêmes.
Comprendre les distributions permet de choisir les techniques d'analyse et de visualisation appropriées et d'éviter les erreurs d'interprétation.
Présentation des données : tableaux et visualisations
La force des statistiques descriptives réside non seulement dans les calculs, mais aussi dans la manière dont les données sont présentées. Une bonne présentation permet aux lecteurs, aux décideurs politiques et au grand public de comprendre facilement les résultats de la recherche sociale.
1. Tableau de fréquences : il indique le nombre et le pourcentage de répondants dans chaque catégorie. Par exemple, la répartition des niveaux d’éducation ou des préférences politiques.
2. Diagramme à barres : convient aux données catégorielles telles que le type d’emploi ou l’état civil.
3. Diagramme circulaire : souvent utilisé, bien qu’il faille être prudent car il est difficile de comparer des parties similaires.
4. Histogramme : idéal pour les données numériques, par exemple la répartition par âge ou la durée d'utilisation d'Internet.
5. Diagramme en boîte : très utile pour comparer les distributions entre groupes, par exemple les revenus entre les zones urbaines et rurales, ainsi que pour détecter les valeurs aberrantes.
La visualisation n'est pas qu'un simple élément décoratif ; elle accélère la compréhension des modèles, des tendances et des anomalies.
Application en sciences sociales : exemples de cas
Supposons qu'un chercheur étudie le « niveau de confiance du public envers les services publics » dans une ville. Il recueille des données auprès de 400 répondants à l'aide d'une échelle de 1 à 5 (de très méfiant à très confiant), ainsi que des données démographiques telles que l'âge, le niveau d'études et la profession.
Étapes descriptives pouvant être suivies :
– Établir des tableaux de fréquences pour les catégories d'éducation et de profession.
– Calculer le niveau de confiance global moyen.
– Calculez la médiane pour identifier la valeur centrale lorsque la distribution n'est pas symétrique.
– Calculez l’écart type pour déterminer la variation du niveau de confiance.
– Créez un diagramme en boîte des niveaux de confiance en fonction du niveau d'éducation (lycée, diplôme, licence) pour voir s'il existe des différences dans les tendances.
– Créez un histogramme pour voir si la plupart des répondants ont des scores faibles, moyens ou élevés.
D'après les résultats descriptifs, les chercheurs pourraient constater que le score de confiance moyen se situe dans la catégorie « acceptable », mais que l'écart type est important, ce qui indique la présence de groupes très confiants et de groupes très méfiants. Ce constat pourrait servir de base à une analyse plus approfondie : quels facteurs influencent ces différences ?
Limitations et précautions
Bien qu'utiles, les statistiques descriptives présentent des limites. Elles ne permettent pas d'établir de relations de cause à effet, ni de garantir la signification statistique des différences entre les groupes, et ne sont pas nécessairement représentatives de la population si l'échantillon est biaisé. De plus, présenter des moyennes hors contexte peut induire en erreur, notamment avec des données asymétriques ou comportant des valeurs aberrantes. Par conséquent, les chercheurs en sciences sociales doivent présenter plusieurs mesures simultanément, expliquer le contexte et faire preuve de transparence quant au processus de collecte des données.
Clôture
L'application des statistiques descriptives en recherche sociale est une étape cruciale pour permettre aux chercheurs de comprendre pleinement les données. Grâce aux mesures de tendance centrale, aux mesures de dispersion, à l'analyse de la distribution et à la présentation des données sous forme de tableaux et de graphiques, les chercheurs peuvent décrire les conditions sociales de manière plus objective et communicative. Les statistiques descriptives facilitent non seulement la compréhension du contexte général, mais aident également les chercheurs à identifier de nouvelles tendances et à formuler de nouvelles questions à approfondir. Dans un monde social diversifié, la capacité à synthétiser les données avec précision est essentielle à la production de recherches rigoureuses, pertinentes et significatives.