Statistiques descriptives automatiques
Mis à jour le 29 juillet 2026
Comprendre vos données en un instant
Les statistiques descriptives sont le socle de toute analyse. Moyenne, médiane, écart-type, distribution : ces indicateurs disent ce que contiennent vos données avant que vous ne cherchiez à expliquer quoi que ce soit. Sauter cette étape, c’est bâtir une recommandation sur une moyenne tirée par trois valeurs extrêmes, puis la défendre avec une conviction que les chiffres ne méritaient pas. Avec ChatGPT, ce diagnostic tient en une phrase et l’interprétation vient dans la foulée.
Le résumé statistique express
La commande la plus simple pour démarrer :
Donne-moi un résumé statistique complet de ce jeu de données.
ChatGPT exécute df.describe() et enrichit le résultat avec des commentaires. Pour chaque colonne numérique, vous obtenez les indicateurs suivants :
- count — nombre de valeurs non vides
- mean — moyenne
- std — écart-type (mesure de dispersion)
- min / max — valeurs extrêmes
- 25% / 50% / 75% — quartiles (médiane = 50%)
La lecture croisée de ces lignes est déjà riche. Si count vaut 8 400 sur un fichier de 10 000 lignes, 16 % des données manquent et toute moyenne calculée dessus ne porte que sur une partie du portefeuille ; si la moyenne s’écarte nettement de la médiane, la distribution est asymétrique. Plutôt que de faire ce travail de tête, demandez-le :
Interprète ces statistiques : quelles colonnes ont une forte dispersion ?
Y a-t-il des valeurs aberrantes ? Quelles distributions semblent asymétriques ?
Statistiques par catégorie
Les moyennes globales masquent presque toujours des disparités. Un panier moyen de 180 euros peut recouvrir un segment entreprise à 900 euros et un segment particulier à 60 : la moyenne ne décrit alors aucun client réel, et la décision prise sur cette base rate les deux populations.
Calcule la moyenne, la médiane et l'écart-type du montant des commandes
pour chaque catégorie de produit.
Encore faut-il choisir l’indicateur qui répond à votre question, car chacun mesure autre chose.
| Indicateur | Ce qu’il mesure | Quand l’utiliser |
|---|---|---|
| Moyenne | Valeur centrale | Données symétriques, sans valeurs extrêmes |
| Médiane | Valeur du milieu | Données asymétriques ou avec outliers |
| Écart-type | Dispersion autour de la moyenne | Évaluer la variabilité des performances |
| Mode | Valeur la plus fréquente | Données catégorielles ou discrètes |
| Corrélation | Relation linéaire entre deux variables | Identifier les facteurs liés entre eux |
Distributions et fréquences
Sur une variable numérique, la forme de la distribution en dit plus long que la moyenne : un histogramme montre si vos montants se concentrent autour d’une valeur ou s’étalent sur deux pics distincts, signe de deux comportements d’achat superposés dans un même fichier.
Montre la distribution de la colonne "montant_commande"
avec un histogramme et indique si elle suit une loi normale.
ChatGPT génère l’histogramme et peut appliquer un test de normalité (Shapiro-Wilk) pour trancher, ce qui conditionne les tests utilisables ensuite. Pour les variables catégorielles, le raisonnement passe par les fréquences :
Quelle est la répartition des clients par secteur d'activité ?
Affiche les fréquences absolues et relatives.
Vous obtenez le nombre d’occurrences et le pourcentage de chaque catégorie — de quoi repérer qu’un secteur pèse 60 % du portefeuille, donc 60 % du risque le jour où ce secteur ralentit.
Corrélations entre variables
Les corrélations révèlent les relations entre vos colonnes numériques et ouvrent les pistes d’analyse suivantes.
Calcule la matrice de corrélation et identifie les paires
de variables les plus corrélées (positivement et négativement).
ChatGPT génère la matrice, met en évidence les corrélations significatives et explique ce que chacune signifie dans votre contexte métier. Trois précautions s’imposent à la lecture. D’abord, corrélation ne signifie pas causalité : la hausse conjointe du budget publicitaire et des ventes peut n’être que l’effet commun de la saison. Ensuite, les valeurs extrêmes déforment le coefficient — demandez le calcul avec et sans outliers, l’écart est souvent instructif. Enfin, les variables catégorielles ne sont pas incluses par défaut ; pour y intégrer le segment client ou le canal de vente, demandez un encodage préalable.
Détection des valeurs aberrantes
Un outlier n’est pas nécessairement une erreur. Une commande à 95 000 euros peut être une faute de saisie comme le premier contrat grand compte de l’année, et le traitement diffère du tout au tout : dans un cas on corrige, dans l’autre on met en avant.
Identifie les valeurs aberrantes dans "montant_commande"
en utilisant la méthode IQR. Liste les lignes concernées
et indique si elles semblent être des erreurs ou des cas légitimes.
ChatGPT calcule les bornes IQR (Q1 - 1.5 * IQR et Q3 + 1.5 * IQR) et liste les valeurs hors limites avec leur contexte. Vous tranchez alors ligne par ligne plutôt que d’écarter le lot en bloc — et de supprimer justement les clients qui font votre année.
Automatiser le rapport descriptif
Une fois la démarche maîtrisée, condensez-la en une seule requête :
Génère un rapport statistique descriptif complet de ce fichier.
Inclus : vue d'ensemble, statistiques par colonne numérique,
répartition des catégorielles, corrélations principales,
valeurs aberrantes détectées et recommandations pour l'analyse suivante.
Ce prompt produit un document structuré, directement partageable. Gardez-le sous la main : appliqué au même export chaque mois, il devient votre point de départ standard et rend les périodes comparables.
Points clés à retenir
- Le résumé statistique est votre première étape après le nettoyage
- Segmentez toujours par catégorie — les moyennes globales cachent des disparités
- La médiane est souvent plus fiable que la moyenne pour les données réelles
- Les corrélations révèlent des pistes d’analyse, pas des certitudes
- Demandez à ChatGPT d’interpréter les chiffres, pas seulement de les calculer