Guides pratiques approfondis

Diagnostiquer un fichier CSV avant son exploitation

Contrôler la structure, les valeurs manquantes, les doublons et les clés sans modifier le fichier original.

Mise à jour :

Rapports et graphiques sur un bureau de contrôle des données. Scène illustrative, sans données réelles.

Illustration générée par IA · Rapports et graphiques sur un bureau de contrôle des données. Scène illustrative, sans données réelles.

Le tableau est-il exploitable pour la question posée ?

Un fichier qui s’ouvre dans un tableur peut perdre des zéros initiaux, transformer des dates ou masquer des lignes irrégulières. Le contrôle commence sur une copie et décrit les anomalies avant toute correction. RFC 4180 documente un format CSV courant ; le modèle CSVW du W3C permet de décrire séparateur, types, valeurs nulles et clés. Le profil ci-dessous porte sur la structure observée, pas sur la véracité des données.

  1. Conserver l’original

    Noter la provenance, la date de téléchargement, la licence et l’empreinte du fichier. Garder séparément le fichier reçu et les transformations. Une ouverture suivie d’un enregistrement dans un tableur peut déjà changer les identifiants.

  2. Fixer le dialecte

    Choisir explicitement virgule, point-virgule ou tabulation. Les champs entre guillemets peuvent contenir un séparateur ou un saut de ligne ; compter les lignes physiques ne suffit donc pas. L’outil exige UTF-8 et une ligne d’en-tête aux noms distincts.

  3. Profiler les colonnes

    Mesurer les cellules vides, les valeurs distinctes et les espaces en bordure. Une cellule vide n’est pas nécessairement zéro. Les chaînes NA, null ou - restent des valeurs tant qu’un dictionnaire ne les définit pas comme manquantes.

  4. Tester la clé composée et le nettoyage envisagé

    Pour des observations répétées, utiliser plusieurs colonnes : station et date, par exemple. L’outil contrôle les tuples de valeurs exactes, sans les concaténer. Une composante vide rend la clé incomplète. Le remplissage n’est pas un taux de validité ; sans ligne, il est non calculable. Avant de retirer les espaces, examiner les collisions : A et « A » entouré d’espaces deviendraient identiques.

  5. Décider avant de corriger

    Une répétition de ligne et une clé répétée ne sont pas la même anomalie. Identifier le grain attendu : une entreprise, un établissement ou une observation datée. Documenter ensuite chaque règle de correction et comparer les effectifs avant et après.

Profiler un fichier CSV

Traitement local dans votre navigateur : aucun envoi du fichier au serveur. UTF-8, 2 Mo, 10 000 lignes de données et 200 colonnes maximum. Le rapport exporté contient le nom du fichier et des colonnes, mais aucune valeur de cellule.

Pour une clé station + date, saisir station ci-dessus et date ici. Chaque composante doit être non vide. Ne pas retirer les espaces des noms.

Prêt pour l’analyse.

Situations et arbitrages

Situations types pour préparer un contrôle. Elles ne décrivent pas des missions ou observations réalisées.

Identifiants avec zéros

Exemple fictif : 0012 et 12 sont deux chaînes distinctes dans cet outil. Ne convertir en nombres que si la définition de la colonne le permet ; vérifier les rapprochements qui dépendaient du zéro.

Clé répétée, observations différentes

Dans un tableau illustratif, une station apparaît chaque jour. Le code station seul n’est pas unique ; une clé station + date peut convenir. Une clé répétée ne justifie pas la suppression d’une observation.

Preuve à conserver

  • Provenance, licence et empreinte de l’original
  • Dialecte et dictionnaire des valeurs manquantes
  • Grain, clé choisie et anomalies observées
  • Règles de transformation et effectifs comparés

Références officielles

Fiches de sources associées

Protocoles connexes

Points à vérifier avant de conclure

  • Les identifiants ont-ils gardé leurs zéros ?
  • Les vides sont-ils distingués des zéros ?
  • Le grain rend-il la clé choisie pertinente ?
  • Les corrections sont-elles traçables et réversibles ?

Un profil JSON exportable, sans valeurs des cellules, accompagné d’une décision sur les transformations à réaliser.

Questions fréquentes

Faut-il supprimer tous les doublons ?

Non. Vérifiez le grain, les versions et les colonnes avant de dédupliquer. Deux lignes identiques peuvent aussi correspondre à deux événements distincts si un identifiant d’événement manque.

Une colonne vide peut-elle être supprimée ?

Seulement après avoir vérifié le schéma et l’usage prévu. Elle peut être obligatoire pour un import ou signaler une variable non collectée. Notez la décision dans le dictionnaire.