Aller au contenu principal

Extraire et transformer des données

Mis à jour le 29 juillet 2026

Extraire et transformer des données

Lire un fichier n’est qu’un premier niveau. ChatGPT sait aussi extraire des données structurées depuis des documents qui ne le sont pas, les reformater, les croiser entre eux et les exporter dans le format de votre choix. C’est cette capacité de transformation qui en fait un véritable outil de traitement de données, et non un simple lecteur de documents.

Extraire du structuré depuis du non structuré

L’extraction structurée consiste à prendre une information dispersée dans un document et à la ranger dans un format exploitable. Sur un lot de factures en PDF, la demande tient en une phrase : « Extrais de chaque facture : le numéro de facture, la date, le fournisseur, le montant HT, la TVA et le montant TTC. Présente le tout dans un tableau. » Sur un rapport annuel, le même principe s’applique à des chiffres noyés dans des paragraphes : « Extrais tous les chiffres financiers mentionnés dans ce rapport : chiffre d’affaires, bénéfice net, marge, effectifs. Organise-les par année dans un tableau comparatif. » Et sur un document purement textuel : « Ce document contient 15 contacts mentionnés dans le texte. Extrais les noms, entreprises et fonctions de chaque personne dans un tableau structuré. » Le point commun de ces trois demandes est la liste explicite des champs attendus : c’est elle qui transforme un flux de texte en données tabulaires utilisables, et c’est l’une des capacités les plus rentables de ChatGPT.

Changer de format

Une fois les données en main, le changement de forme se demande aussi simplement. Un CSV brut devient lisible : « Crée un tableau lisible avec des en-têtes clairs. Traduis les noms de colonnes de l’anglais au français. » Un tableau devient un visuel : « À partir de ces données, génère un graphique en barres montrant la répartition des ventes par région. » Des chiffres deviennent un support de réunion : « Transforme ces données trimestrielles en 3 slides de synthèse : vue d’ensemble, top performers, et points d’alerte. » Et une structure technique bascule vers une autre : « Ce fichier JSON contient des données produit. Convertis-le en tableau CSV avec les colonnes : nom, prix, catégorie, stock. »

Croiser deux sources

Envoyez deux fichiers dans la même conversation et le croisement devient une simple phrase. Imaginez une liste de clients avec leurs achats dans un Excel, et une enquête de satisfaction dans un CSV : « Croise ces deux fichiers sur le nom du client. Pour chaque client, montre le montant total d’achat et le score de satisfaction. Trie par score de satisfaction décroissant. Identifie les clients à fort potentiel (achats élevés + satisfaction élevée) et les clients à risque (achats élevés + satisfaction basse). »

Cette opération demanderait normalement des formules Excel complexes ou un script Python ; elle se fait ici en une demande conversationnelle. Raison de plus pour vérifier le résultat : la correspondance se fait sur des noms, et les homonymes comme les fautes de frappe suffisent à fausser silencieusement les appariements. Contrôlez quelques lignes à la main avant de fonder une décision commerciale dessus.

Nettoyer et normaliser

Les données du monde réel arrivent rarement propres, et c’est un terrain où ChatGPT est particulièrement à l’aise. Sur des formats hétérogènes : « Dans cette colonne de numéros de téléphone, certains sont au format 06.12.34.56.78, d’autres au format +33612345678, d’autres au format 06 12 34 56 78. Normalise-les tous au format international +33 6 12 34 56 78. » Sur des dates douteuses : « Analyse cette colonne de dates. Identifie les dates invalides, les formats incohérents et les valeurs aberrantes. » Sur des doublons approximatifs, ceux qu’aucune formule ne rattrape : « Ce fichier contient des doublons probables (mêmes noms avec des orthographes légèrement différentes). Identifie-les et propose une version consolidée. » Et pour du classement de masse : « Voici 200 descriptions de dépenses. Catégorise chacune dans l’une de ces catégories : Transport, Restauration, Hébergement, Fournitures, Services, Autre. »

Sur ce dernier cas comme sur les croisements, la relecture d’un échantillon reste la règle : une catégorisation automatique se trompe rarement beaucoup, mais elle se trompe. Au-delà de dix mille lignes, ne lancez pas le traitement complet d’emblée : demandez d’abord une analyse sur un échantillon, validez la méthode, puis passez au fichier entier.

Récupérer le résultat

Sans consigne de sortie, ChatGPT affichera les résultats en texte dans la conversation, et vous vous retrouverez à faire des copier-coller. Demandez explicitement le fichier : « Génère un fichier CSV téléchargeable avec ces résultats », « Crée un fichier Excel avec deux onglets : les données brutes et le résumé », ou « Formate ces données en JSON pour intégration dans notre API ». Le fichier est produit et un lien de téléchargement apparaît dans la conversation.

Industrialiser les traitements récurrents

Si le même type de fichier revient chaque mois, écrivez le prompt une fois et réutilisez-le : « Je vais t’envoyer un relevé bancaire PDF chaque mois. Pour chaque relevé, je veux que tu : (1) extraies toutes les transactions, (2) les catégorises en 6 catégories (Logement, Alimentation, Transport, Loisirs, Santé, Autre), (3) calcules le total par catégorie, (4) compares avec le mois précédent si disponible, (5) exportes le résultat en CSV. » Conservé dans vos notes, ce prompt garantit un traitement identique d’un mois sur l’autre, donc des comparaisons qui ont un sens.

Pour vous faire la main, prenez un fichier de votre travail courant — export CRM, feuille de temps, liste de contacts, relevé financier — et demandez : « Analyse ce fichier. Identifie les problèmes de qualité des données (doublons, valeurs manquantes, formats incohérents). Propose un plan de nettoyage. Puis applique le nettoyage et génère un fichier corrigé téléchargeable. » Choisissez ce fichier en connaissance de cause : données de santé, numéros de sécurité sociale, informations bancaires appellent une évaluation du risque avant tout envoi.

Points clés à retenir

  • ChatGPT peut extraire des données structurées depuis des documents non structurés en une seule demande
  • Le croisement de fichiers et la normalisation de données se font de manière conversationnelle
  • Demandez explicitement un export (CSV, Excel, JSON) pour récupérer les données traitées
  • Créez des prompts réutilisables pour les traitements mensuels ou récurrents
  • Vérifiez toujours les résultats, surtout pour les croisements et les catégorisations automatiques