Repérer les URL d’image répétées dans un CSV produit

ImageDup analyse l’export CSV d’un catalogue et regroupe les lignes qui pointent vers la même URL d’image, pour que vous voyiez quels produits réutilisent une photo. Conçu pour les marchands en ligne, les responsables de catalogue et toute personne qui gère des données produit.

Gratuit. Sans compte. Importez un export CSV, pas des fichiers image. Tout s’exécute dans votre navigateur.

Votre CSV est traité dans votre navigateur. Il n’est envoyé à aucun serveur.

Repérer les URL d’image en double dans des CSV produittext/csv · ≤ 20 MB

Un export CSV de vos produits comportant au moins un identifiant de produit et une URL d’image par ligne.

Déposez ici un CSV de produits, ou choisissez un fichier

.csv, jusqu’à ~20 Mo, la première ligne est traitée comme l’en-tête

ImageDup compare le texte de l’URL d’image, pas les pixels. Pour une même image servie depuis des URL différentes, il vous faut une colonne de hash d’image déjà présente.

Un export de catalogue de vêtements de 20 lignes contenant des répétitions volontaires : des variantes de couleur qui partagent une même photo, un produit présent sur deux lignes, et des produits distincts pointant vers la même image. Certaines lignes comportent aussi une colonne image_hash que vous pouvez associer.

Fonctionnement

  1. Associez vos colonnes

    Indiquez à l’outil quelle colonne contient l’identifiant de produit et laquelle contient l’URL de l’image. Le titre du produit et le hash d’image sont facultatifs.

  2. Regroupez les lignes par URL d’image

    Chaque ligne est regroupée d’après son URL d’image, ou d’après la colonne de hash si vous en associez une. Toute adresse utilisée par plus d’une ligne est signalée, et les cas les plus nets — une image utilisée par plusieurs identifiants de produit différents — apparaissent en premier.

  3. Exportez les lignes signalées

    Téléchargez un CSV de toutes les lignes signalées, étiquetées avec un numéro de groupe et un motif, pour savoir exactement quoi vérifier dans vos données d’origine.

Ce qui compte comme un doublon

Par défaut, cet outil compare des URL d’image, pas le contenu des images. Deux lignes correspondent lorsque leur URL d’image est identique après une normalisation délibérément minime et sûre : les espaces autour sont supprimés, le schéma et l’hôte sont mis en minuscules, et le #fragment est retiré.

Tout le reste est laissé tel quel, car le modifier pourrait fusionner des images en réalité différentes. Le chemin conserve sa casse (/IMG/A.JPG et /img/a.jpg restent distincts), la chaîne de requête est conservée entière (?v=2 diffère de ?v=1), et http face à https, un www. en tête et un / final sont tous traités comme distincts.

Ce n’est pas de la détection visuelle de doublons. Deux URL différentes qui renvoient la même photo ne sont pas signalées. Pour repérer ces cas, ajoutez une colonne de hash d’image (par exemple un MD5 ou un hash perceptuel, en hexadécimal) et associez-la : la comparaison utilise alors le hash pour chaque ligne qui en a un, et se rabat sur l’URL pour celles qui n’en ont pas.

Une valeur utilisée par deux identifiants de produit différents ou plus est signalée comme DOUBLON. Une valeur qui se répète sur des lignes qui ne correspondent pas à deux identifiants distincts ou plus — un même produit sur plusieurs lignes, ou des lignes sans identifiant — est marquée À EXAMINER plutôt que qualifiée de doublon.

Les URL d’image en double dans les données produit

Ce qu’est une URL d’image en double

Une URL d’image en double est une seule adresse d’image qui apparaît sur plus d’une ligne d’un fichier produit. Si deux lignes indiquent toutes deux https://cdn.exemple/img/chemise-bleue.jpg dans la colonne image, ces lignes partagent une URL d’image. ImageDup regroupe les lignes d’après cette adresse et vous montre chaque groupe où la même adresse est utilisée plus d’une fois.

C’est une comparaison de texte. ImageDup lit la chaîne de l’URL, applique quelques ajustements sûrs — retirer les espaces, mettre le schéma et le domaine en minuscules, supprimer le #fragment — puis vérifie si le résultat est identique. Il n’ouvre pas l’image, ne la télécharge pas et ne compare pas les pixels. Deux lignes ne correspondent que lorsque leurs adresses d’image correspondent.

Pourquoi les catalogues finissent avec des URL d’image répétées

La plupart des URL d’image répétées sont un effet secondaire de la façon dont les données produit sont produites et exportées, pas des choix délibérés :

  • Lignes de variantes. Beaucoup de plateformes exportent une ligne par taille ou par couleur. Une chemise en cinq tailles, ce sont cinq lignes, et si les variantes de taille n’ont jamais reçu leurs propres photos, les cinq pointent vers la même image.
  • Création de produit par copier-coller. Un nouveau produit est dupliqué à partir d’un produit existant pour gagner du temps, et le champ image n’est jamais changé.
  • Images provisoires. Une image « bientôt disponible » ou une image de catégorie générique est attribuée à chaque produit sans vraie photo. Des centaines de lignes peuvent partager une même image provisoire.
  • Jointures de flux et réexports. Quand un flux est construit en joignant plusieurs tables, ou exporté à répétition depuis un système qui ajoute au lieu de remplacer, le même produit peut apparaître sur plusieurs lignes avec la même image.
  • Restes de migration. Changer de plateforme fait souvent correspondre plusieurs anciens champs à une seule nouvelle colonne image, ce qui produit des répétitions.

Quand une URL d’image répétée n’est pas un problème

Une URL d’image répétée n’est pas automatiquement un problème. Il y a des raisons ordinaires à cela :

  • Un produit et ses variantes partagent réellement une photo parce que les variantes sont identiques sur l’image — une bague en trois tailles, un livre en relié et en poche avec la même couverture.
  • Un coffret ou un pack cadeau réutilise volontairement la photo d’un composant.
  • Deux fiches pour le même article physique, par exemple un SKU standard et un SKU promotionnel, utilisent une seule image de façon intentionnelle.
  • Une marque utilise une seule image d’ambiance sur une petite gamme coordonnée.

ImageDup ne tranche pas ces cas à votre place. Il vous montre où une image est réutilisée et combien d’identifiants de produit distincts sont concernés, et vous jugez si cette réutilisation est voulue.

DOUBLON et À EXAMINER

ImageDup classe chaque URL d’image répétée dans l’un de deux groupes :

  • DOUBLON — la même URL d’image est rattachée à deux identifiants de produit différents et non vides ou plus. C’est le cas le plus susceptible de nécessiter une correction, car des produits distincts partagent une même photo.
  • À EXAMINER — la même URL d’image se répète, mais les lignes n’établissent pas deux identifiants de produit différents ou plus. Cela arrive quand un identifiant est présent sur plusieurs lignes, quand des lignes sont des doublons exacts, ou quand l’identifiant est vide. Ce sont souvent des lignes de variantes sans conséquence, mais elles peuvent aussi masquer un problème de données : elles sont donc listées plutôt qu’ignorées.

Les lignes sans identifiant de produit ne créent jamais un DOUBLON à elles seules, car ImageDup ne peut pas savoir si elles appartiennent à un produit ou à plusieurs.

Les fichiers CSV produit

Un CSV produit est un tableau en texte brut exporté depuis une plateforme e-commerce, un PIM, une marketplace ou un outil de flux. Chaque ligne est un produit ou une variante ; chaque colonne est un champ comme le SKU, le titre, le prix ou l’URL d’image. ImageDup lit la première ligne comme l’en-tête, puis vous laisse associer vos colonnes aux deux champs dont il a besoin — un identifiant de produit et une URL d’image — plus deux champs facultatifs : un titre pour rendre les résultats lisibles, et un hash d’image.

Les noms de colonnes varient d’un système à l’autre — image_link, Image Src, main_image, photo_url — donc ImageDup devine l’association à partir du texte des en-têtes et marque une supposition que vous devriez confirmer. Si une supposition est fausse, choisissez la bonne colonne dans la liste déroulante.

Nettoyage de catalogue et audit de flux

Vérifier les URL d’image répétées est une étape d’une revue de catalogue plus large. Une passe typique regarde aussi les images manquantes, les liens d’image cassés, les titres ou descriptions absents, les prix incohérents et les SKU en double. ImageDup se concentre sur la question de l’URL d’image et vous donne un CSV téléchargeable de toutes les lignes signalées, étiquetées avec un numéro de groupe et un motif, pour que vous puissiez transmettre la liste à la personne qui gère les données d’origine.

Lancer la vérification après chaque export, ou avant chaque envoi de flux, permet d’attraper les répétitions introduites par de nouveaux produits ou par un réglage d’export modifié avant qu’elles n’atteignent une boutique ou un canal de vente.

Les limites de la comparaison exacte d’URL

La comparaison exacte est précise mais littérale. Elle passera à côté de :

  • La même image à deux adresses. Les URL https://cdn.exemple/a.jpg et https://images.exemple/a.jpg, ou une URL de CDN et son URL d’origine, renvoient une seule photo mais sont des chaînes différentes. ImageDup les traite comme différentes.
  • La même image avec un paramètre anti-cache. Les URL photo.jpg?v=1 et photo.jpg?v=2 restent distinctes, car une chaîne de requête peut légitimement changer la réponse.
  • Des copies redimensionnées ou réencodées. Une vignette et une version pleine taille d’une même photo sont des fichiers différents à des URL différentes.

Par conception, il ne fusionne pas non plus http avec https, ni www avec le domaine nu, ni un / final, car cela peut pointer vers des ressources différentes.

Pour attraper la même photo servie depuis des URL différentes, ajoutez à votre export une colonne de hash d’image — un MD5 du fichier, ou un hash perceptuel comme pHash ou dHash, en hexadécimal — et associez-la. ImageDup compare alors sur le hash pour chaque ligne qui en a un et se rabat sur l’URL pour celles qui n’en ont pas. Il ne calcule toujours pas les hash lui-même et ne compare pas les images visuellement ; il fait confiance aux valeurs de hash que vous fournissez.

Questions

Que détecte ImageDup ?

Les lignes de votre CSV produit qui pointent vers la même URL d’image. Il regroupe chaque adresse d’image répétée et indique combien d’identifiants de produit distincts la partagent. Si vous associez une colonne de hash d’image, il regroupe par hash les lignes qui en ont un.

ImageDup envoie-t-il mon CSV ?

Non. Le fichier est lu et analysé par du JavaScript qui s’exécute dans votre navigateur. Il n’est pas envoyé à un serveur. Le bouton « Utiliser des données d’exemple » charge un petit fichier d’exemple fourni avec cette page.

Qu’est-ce qu’une URL d’image en double ?

Une adresse d’image qui apparaît sur plus d’une ligne. ImageDup compare le texte de l’adresse après avoir retiré les espaces, mis le schéma et le domaine en minuscules et supprimé le #fragment. Il ne compare pas les images elles-mêmes.

Plusieurs produits peuvent-ils légitimement utiliser la même image ?

Oui. Des variantes identiques sur la photo, un coffret qui réutilise l’image d’un composant, ou deux fiches pour un seul article physique peuvent partager une image à dessein. ImageDup signale la réutilisation ; décider si elle est voulue vous revient.

ImageDup détecte-t-il les images visuellement proches ?

Non. Il n’ouvre ni ne compare les photos. Deux URL différentes qui renvoient la même image ne sont pas rapprochées, sauf si vous fournissez pour elles une même valeur de hash.

Quelles colonnes de CSV puis-je utiliser ?

Une colonne d’identifiant de produit (SKU, handle ou ID) et une colonne d’URL d’image sont obligatoires. Une colonne de titre de produit et une colonne de hash d’image sont facultatives. Le titre rend le tableau de résultats plus lisible ; le hash permet à ImageDup de rapprocher la même image sur des URL différentes.

Et si mon CSV utilise d’autres noms de colonnes ?

ImageDup devine l’association à partir de votre ligne d’en-tête et marque toute supposition incertaine. Vous confirmez ou changez chaque association avec une liste déroulante de vos vrais noms de colonnes avant de lancer la vérification : les en-têtes personnalisés ne posent donc pas de problème.

Quelle est la différence entre DOUBLON et À EXAMINER ?

DOUBLON signifie que la même URL d’image est utilisée par deux identifiants de produit différents et non vides ou plus. À EXAMINER signifie que l’URL se répète mais que les lignes n’établissent pas deux identifiants de produit différents ou plus — un même produit sur plusieurs lignes, des lignes en double exactes, ou des lignes sans identifiant.

Puis-je télécharger les résultats ?

Oui. « Télécharger les résultats » vous donne un CSV contenant chaque ligne signalée avec ses colonnes d’origine, plus un numéro duplicate_group et un duplicate_reason valant DUPLICATE ou REVIEW.