Nettoyage et transformation de données
Mis à jour le 29 juillet 2026
Des données brutes aux données exploitables
Les données réelles sont rarement propres. Doublons issus d’un double import, valeurs manquantes parce qu’un champ était facultatif, formats de date qui changent selon la personne qui a saisi, colonnes héritées d’un ancien outil : avant d’analyser quoi que ce soit, il faut nettoyer. Cette étape a longtemps été la plus ingrate du métier. ChatGPT la transforme en conversation : vous décrivez le problème, il génère le code de nettoyage, l’exécute et vous montre le résultat avant que vous ne validiez.
Diagnostiquer la qualité de vos données
Nettoyer sans diagnostic revient à réparer à l’aveugle. Commencez donc chaque session par un audit :
Analyse la qualité de ce fichier : valeurs manquantes par colonne,
doublons, types de données détectés, et valeurs aberrantes éventuelles.
Le rapport donne le pourcentage de valeurs manquantes colonne par colonne, le nombre de lignes dupliquées, les colonnes au type incohérent — un mélange de texte et de nombres trahit presque toujours une saisie manuelle — et les valeurs extrêmes susceptibles d’être des erreurs de frappe. Sur un fichier de commandes ordinaire, cet audit révèle typiquement qu’un client sur cinq n’a pas de code postal et qu’une commande affiche 950 000 euros au lieu de 950.
Gérer les valeurs manquantes
C’est le problème le plus fréquent, et il n’admet pas de solution unique : la bonne stratégie dépend de ce que le vide signifie dans votre contexte. Un montant absent n’est pas un e-mail absent.
La suppression des lignes incomplètes convient quand les données manquantes sont peu nombreuses et non critiques. Une campagne d’e-mailing n’a que faire d’un contact sans adresse : la ligne n’est pas récupérable.
Supprime toutes les lignes où la colonne "email" est vide.
Le remplissage par une valeur par défaut s’impose lorsque vous connaissez la valeur logique. Si votre activité est franco-française et que le champ pays n’était pas obligatoire, l’absence signifie « France » ; un montant vide sur une ligne de remise signifie zéro, pas « inconnu ».
Remplace les valeurs manquantes de "pays" par "France"
et celles de "montant" par 0.
L’interpolation, enfin, convient aux séries temporelles et aux données continues, là où une valeur nulle creuserait un trou artificiel dans la courbe.
Pour les valeurs manquantes de "ca_mensuel", utilise la moyenne
des mois précédent et suivant du même client.
Supprimer les doublons
Les doublons faussent toutes les statistiques en aval : un client compté deux fois double sa contribution au chiffre d’affaires et remonte artificiellement dans vos classements. Encore faut-il définir ce qui en constitue un, car deux commandes du même client le même jour peuvent être légitimes.
Identifie et supprime les doublons basés sur les colonnes
"nom_client" et "date_commande". Garde la première occurrence.
ChatGPT vous montre les lignes concernées avant de les retirer. Prenez le temps de les parcourir : c’est à ce moment précis que vous verrez si vous supprimez un vrai doublon d’import ou une seconde commande réelle.
Standardiser les formats
Les dates sont le premier chantier. Un fichier alimenté par plusieurs sources contient volontiers « 15/03/2026 », « 2026-03-15 » et « 15 mars 2026 », que pandas ne saura pas trier ensemble : votre courbe mensuelle restera muette tant que ce point n’est pas réglé.
Convertis toutes les dates de la colonne "date_achat"
au format AAAA-MM-JJ et signale celles qui ne peuvent pas être converties.
Le texte pose des difficultés plus insidieuses, car elles restent lisibles à l’œil humain. « Paris », « PARIS » et « paris » comptent pour trois villes distinctes ; un espace résiduel derrière « Lyon » en crée une quatrième ; « Saint-Étienne » face à « St Etienne » scinde vos ventes régionales en deux lignes dont aucune n’est juste.
Normalise la colonne "ville" : première lettre en majuscule,
supprime les espaces en trop, et regroupe les variantes
(Saint/St, tirets manquants).
Les nombres, enfin, arrivent souvent formatés pour l’affichage et non pour le calcul. Tant que la colonne contient « 1 250,50 € », aucune somme n’est possible.
La colonne "prix" contient des valeurs comme "1 250,50 €".
Convertis-la en nombre décimal (1250.50) et supprime le symbole euro.
Créer de nouvelles colonnes
La transformation ne se limite pas à réparer : elle enrichit. Une colonne de dates devient un axe trimestriel sur lequel comparer les périodes, une colonne de montants devient un segment commercial exploitable dans vos analyses.
Crée une colonne "trimestre" à partir de "date_commande"
et une colonne "tranche_ca" qui catégorise le CA en :
"Petit" (< 1000), "Moyen" (1000-5000), "Grand" (> 5000).
ChatGPT génère le code pandas correspondant, avec pd.cut() ou des conditions logiques, et l’exécute. Vérifiez ensuite la répartition obtenue : si 90 % de vos clients tombent dans « Petit », vos seuils sont mal calibrés et la segmentation ne vous apprendra rien.
Exporter les données nettoyées
Une fois le nettoyage terminé, récupérez le fichier propre :
Exporte le DataFrame nettoyé en CSV (UTF-8, séparateur point-virgule)
pour que je puisse le télécharger.
ChatGPT génère un lien de téléchargement. Vous repartez avec un fichier exploitable ailleurs — Excel, outil de BI, prochaine session — sans avoir à tout refaire la semaine suivante.
Points clés à retenir
- Commencez toujours par un audit qualité avant d’analyser
- ChatGPT gère valeurs manquantes, doublons et formats incohérents en quelques messages
- Vérifiez systématiquement les résultats intermédiaires — demandez un aperçu après chaque opération
- Exportez le fichier nettoyé pour le réutiliser dans d’autres outils si nécessaire
- Le code Python est visible : vous pouvez le copier et le réutiliser dans vos propres scripts