Descriptif
Dans de nombreuses recherches en sciences sociales, les données ne prennent pas nécessairement la forme de mesures numériques. Elles peuvent correspondre à des catégories, des types, des choix, des réponses, des comportements ou encore à des caractéristiques observées dans des documents, des enquêtes ou des corpus. Comment comparer ces données ? Comment identifier des tendances ou des associations ? Comment savoir si une différence observée est importante, ou si elle pourrait simplement être due au hasard ?
Le séminaire sera entièrement pratique. Nous apprendrons à utiliser R pour explorer des données qualitatives, repérer des régularités, comparer des catégories et produire des visualisations claires. R se chargera des calculs ; notre travail sera surtout de poser les bonnes questions, de choisir les outils adaptés et d'interpréter les résultats.
L'atelier s'adresse aux doctorant.e.s en sciences humaines et sociales, notamment en histoire, science politique, sociologie et disciplines voisines. Il est conçu pour des participant.e.s sans expérience préalable en statistique ou en programmation. Aucune compétence particulière en mathématiques ou en informatique n'est nécessaire : l'accent sera mis sur l'exploration des données, leur visualisation et l'interprétation des résultats.
L’objectif n’est pas de maîtriser la théorie statistique, mais de savoir utiliser quelques outils utiles dans R et comprendre ce qu’ils permettent de dire sur vos données.
Matériaux nécessaires
Ordinateur avec accès Internet
Programme
1. Introduction - Données qualitatives et R
a. Fondamentaux de la statistique
Population et échantillon - pourquoi nous ne pouvons pas utiliser les pourcentages
Signification et intervalle de confiance - comment tester et généraliser
Paternes et prédictions – pourquoi utiliser la statistique
b. R : un logiciel libre, multiplateforme et très sympa !
Données - propres et structurées
Statistique descriptive - les camemberts et plus
Chi-2 – un avant-goût de signification et de prédiction
2- Analyse des correspondances - Identifier les paternes dans les données complexes
a. MCA – Trouver les interactions qui structurent le monde complexe et varié.
b. FA – Distinguer les structures dans un monde complexe et varié
3- Analyse de clusters – Trier les observations à partir de leurs caractéristiques
a. HCA – Classification exploratoire : combien de clusters se voit dans les données
b. K-Means – Classification confirmatoire : Dans quelle mesure les clusters trient les données.
4. Régression logistique binaire
a. Régression logistique binaire - Tester les hypothèses et calculer l'importance des effets
b. Modèles linéaires généralisés - Au-delà d'une prédiction binaire
Slides
Slides 1 - Présuppositions théoriques
Slides 2 - Examples de techniques étudiés
Liens - Commandes pour R - SVP, téléchargez les fichiers
R-Commandes - Analyse de correspondance
R-Commandes - Analyse de clusters
R-Commandes - Régression logistique
R-Commands - Extra Commands for Régression
Liens - Données pour jouer
Le destin en anglais et russe
Le bonheur en anglais, tchèque, et polonais
Les femmes en Vogue, Cosmo et Closer
Les temps du futur - proche et distal
Exprimer l'avis - "croire" vs. "penser"
Logiciel
R: https://www.r-project.org/
Mac Only - BBEdit (free version) : https://www.barebones.com/products/bbedit/
Win Only - NotePad++ https://notepad-plus-plus.org/
Références
Baayen 2008 - Analyzing Linguistic Data. A practical introduction to statistics using R. CUP
Glynn & Robinson 2014 - Corpus Methods for Semantics. Quantitative studies in polysemy and synonymy. JBs.
Gries 2009 - Quantitative Corpus Linguistics with R. A practical introduction. Routledge.
Gries 2013 - Statistics for Linguistics with R. A practical introduction. Mouton.