Dédupliqueur CSV

Les doublons s’infiltrent dans les exports CSV de manière agaçante : livraisons de webhook répétées, deux rapports concaténés à la main, ou une jointure qui a étalé des lignes que vous ne vous attendiez pas. Ce dédupliqueur hache chaque ligne de données et ne conserve que la première occurrence, de sorte que la sortie préserve votre ordre de ligne original tout en supprimant discrètement les copies. La ligne d’en-tête est optionnelle, activez le commutateur si votre fichier commence directement par des données.

Comment fonctionne la déduplication

  1. 1

    Collez le CSV

    Incluez ou excluez la ligne d'en-tête ; utilisez la case à cocher pour indiquer à l'outil ce qu'il en est.

  2. 2

    Chaque ligne est hachée

    Les lignes sont analysées en tableaux et un MD5 de leur représentation JSON est utilisé comme clé d'unicité.

  3. 3

    Le premier vu gagne

    La première ligne avec un hachage donné est conservée. Les lignes suivantes avec le même contenu sont silencieusement ignorées.

  4. 4

    En-tête préservé

    Si le mode en-tête est activé, la ligne 1 est toujours transmise sans être dédupliquée par rapport aux données.

Ce qui compte comme un doublon

Le dédupliqueur utilise l’égalité de ligne complète. Deux lignes sont des doublons lorsque chaque cellule correspond, position par position, après l’analyse standard du CSV.

Ce qui compte encore comme différent

Ligne A Ligne B Traité comme
Alice,30,Paris Alice, 30, Paris Différent (espaces supplémentaires)
Bob,25 Bob,25, Différent (cellule vide à la fin)
"Jane Smith",42 Jane Smith,42 Identique (les guillemets sont au niveau du parseur)
TRUE,1 true,1 Différent (sensible à la casse)

Quand une déduplication au niveau des colonnes serait plus appropriée

La correspondance de ligne complète est stricte, ce qui est généralement ce que vous voulez, mais parfois vous voulez en fait “une ligne par e-mail indépendamment des autres colonnes”. Dans ce cas, utilisez d’abord l’Extracteur de Colonnes CSV pour réduire le fichier à juste la colonne clé, dédupliquez cela, et utilisez le résultat comme recherche. Ou optez pour SQL : SELECT DISTINCT ON (email) * FROM users ORDER BY email, created_at DESC; dans PostgreSQL, ou un GROUP BY avec des agrégats MIN() ailleurs.

Conseils pratiques

  • Normalisez avant de dédupliquer. Éliminez les espaces et standardisez la casse sur les colonnes clés d’abord, sinon ALICE@EXAMPLE.COM et alice@example.com survivront tous les deux.
  • Triez, puis dédupliquez, pour des résultats audités. Si vous devez savoir quelle copie a été conservée, triez le CSV par votre critère de départ préféré (timestamp le plus récent, ID le plus bas) avant d’exécuter le dédupliqueur.
  • Vérifiez le nombre de lignes. Utilisez le Compteur de Lignes CSV sur l’original et la sortie pour confirmer combien de doublons ont été supprimés.

Questions fréquentes

Non, il hache des lignes complètes analysées. Pour l’unicité d’une seule colonne, réduisez d’abord le CSV à cette colonne en utilisant l’Extracteur de Colonnes, puis exécutez le dédupliqueur.

La première occurrence dans le fichier. Triez le CSV au préalable si vous voulez qu’une copie spécifique (le plus récent enregistrement, le plus bas ID, etc.) gagne.

Oui. Les lignes sont analysées selon les règles CSV standard, donc "Jane, Smith" reste une seule cellule et est comparée comme telle.

Le CSV est envoyé à notre serveur pour calculer la déduplication. Il n’est pas stocké ni partagé et n’est pas ajouté au lien de la page.

Outils similaires

Outil disponible dans d’autres langues