Wiederholte Bild-URLs in einer Produkt-CSV finden
ImageDup prüft einen CSV-Export deines Katalogs und gruppiert Zeilen, die auf dieselbe Bild-URL verweisen, damit du siehst, welche Produkte ein Foto mehrfach verwenden. Gemacht für Onlinehändler, Katalogverantwortliche und alle, die Produktdaten pflegen.
Kostenlos. Kein Konto. Lade einen CSV-Export hoch, keine Bilddateien. Alles läuft in deinem Browser.
Deine CSV wird in deinem Browser verarbeitet. Sie wird an keinen Server übertragen.
Ein CSV-Export deiner Produkte mit mindestens einer Produktkennung und einer Bild-URL pro Zeile.
Eine Produkt-CSV hier ablegen oder eine Datei auswählen
.csv, bis ca. 20 MB, die erste Zeile gilt als Kopfzeile
ImageDup vergleicht den Text der Bild-URL, nicht die Bildpixel. Für dasselbe Bild unter verschiedenen URLs brauchst du eine vorhandene Bild-Hash-Spalte.
Ein Bekleidungskatalog-Export mit 20 Zeilen und absichtlichen Wiederholungen: Farbvarianten, die sich ein Foto teilen, ein Produkt auf zwei Zeilen und getrennte Produkte, die auf dasselbe Bild verweisen. Einige Zeilen haben zusätzlich eine Spalte image_hash, die du zuordnen kannst.
Datei wird gelesen…
Ordne deine Spalten zu
Weise jedes Feld einer Spalte aus deiner Datei zu. Die Vorschau zeigt die ersten Zeilen, damit du siehst, was jede Spalte enthält.
Scrollen, um alle Spalten zu sehen →
So funktioniert es
Ordne deine Spalten zu
Sag dem Werkzeug, welche Spalte die Produktkennung enthält und welche die Bild-URL. Produkttitel und Bild-Hash sind optional.
Gruppiere Zeilen nach Bild-URL
Jede Zeile wird nach ihrer Bild-URL gruppiert, oder nach der Hash-Spalte, wenn du eine zuordnest. Jede Adresse, die von mehr als einer Zeile verwendet wird, wird markiert, wobei die klarsten Fälle — ein Bild, das von mehreren verschiedenen Produkt-IDs genutzt wird — zuerst erscheinen.
Exportiere die markierten Zeilen
Lade eine CSV mit allen markierten Zeilen herunter, versehen mit einer Gruppennummer und einem Grund, damit du genau weißt, was du in deinen Quelldaten prüfen musst.
Was als Duplikat zählt
Standardmäßig vergleicht dieses Werkzeug Bild-URLs, nicht Bildinhalte. Zwei Zeilen stimmen überein, wenn ihre Bild-URL nach einer bewusst kleinen, sicheren Normalisierung identisch ist: umgebende Leerzeichen werden entfernt, Schema und Host werden kleingeschrieben und das #Fragment wird verworfen.
Alles andere bleibt unangetastet, weil eine Änderung Bilder zusammenführen könnte, die in Wahrheit verschieden sind. Der Pfad behält seine Groß- und Kleinschreibung (/IMG/A.JPG und /img/a.jpg bleiben getrennt), die vollständige Query bleibt erhalten (?v=2 unterscheidet sich von ?v=1), und http gegenüber https, ein führendes www. und ein abschließender / gelten alle als verschieden.
Das ist keine visuelle Duplikaterkennung. Zwei verschiedene URLs, die dasselbe Bild liefern, werden nicht markiert. Um solche Fälle zu erfassen, füge eine Spalte mit Bild-Hashes hinzu (zum Beispiel ein MD5 oder ein perzeptueller Hash, in Hex) und ordne sie zu — der Abgleich nutzt dann für jede Zeile mit Hash den Hash und fällt für Zeilen ohne Hash auf die URL zurück.
Ein Wert, der von zwei oder mehr verschiedenen Produkt-IDs verwendet wird, wird als DUPLIKAT gemeldet. Ein Wert, der sich über Zeilen wiederholt, die nicht zwei oder mehr eindeutige IDs ergeben — ein Produkt auf mehreren Zeilen oder Zeilen mit fehlender ID — wird als PRÜFEN markiert und nicht als Duplikat bezeichnet.
Doppelte Bild-URLs in Produktdaten
Was eine doppelte Bild-URL ist
Eine doppelte Bild-URL ist eine einzelne Bildadresse, die in mehr als einer Zeile einer Produktdatei vorkommt. Wenn zwei Zeilen beide https://cdn.beispiel/img/blaues-hemd.jpg in der Bildspalte führen, teilen sich diese Zeilen eine Bild-URL. ImageDup gruppiert Zeilen nach dieser Adresse und zeigt dir jede Gruppe, in der dieselbe Adresse mehr als einmal verwendet wird.
Das ist ein Textvergleich. ImageDup liest die URL-Zeichenkette, wendet ein paar sichere Anpassungen an — Leerzeichen entfernen, Schema und Domain kleinschreiben, das #Fragment verwerfen — und prüft dann, ob das Ergebnis identisch ist. Es öffnet das Bild nicht, lädt es nicht herunter und vergleicht keine Pixel. Zwei Zeilen stimmen nur überein, wenn ihre Bildadressen übereinstimmen.
Warum in Katalogen wiederholte Bild-URLs entstehen
Die meisten wiederholten Bild-URLs sind ein Nebeneffekt davon, wie Produktdaten erzeugt und exportiert werden, keine bewusste Entscheidung:
- Variantenzeilen. Viele Plattformen exportieren eine Zeile pro Größe oder Farbe. Ein Hemd in fünf Größen sind fünf Zeilen, und wenn die Größenvarianten nie eigene Fotos erhalten haben, verweisen alle fünf auf dasselbe Bild.
- Produktanlage per Kopieren. Ein neues Produkt wird zur Zeitersparnis aus einem bestehenden dupliziert, und das Bildfeld wird nie geändert.
- Platzhalterbilder. Ein „demnächst verfügbar“-Bild oder ein generisches Kategoriebild wird jedem Produkt ohne echtes Foto zugewiesen. Hunderte Zeilen können sich einen Platzhalter teilen.
- Feed-Joins und Re-Exporte. Wird ein Feed durch das Verbinden mehrerer Tabellen erstellt oder wiederholt aus einem System exportiert, das anhängt statt zu ersetzen, kann dasselbe Produkt auf mehreren Zeilen mit demselben Bild erscheinen.
- Migrationsreste. Ein Plattformwechsel bildet oft mehrere alte Felder auf eine neue Bildspalte ab und erzeugt so Wiederholungen.
Wann eine wiederholte Bild-URL in Ordnung ist
Eine wiederholte Bild-URL ist nicht automatisch ein Problem. Es gibt gewöhnliche Gründe dafür:
- Ein Produkt und seine Varianten teilen sich tatsächlich ein Foto, weil die Varianten auf dem Bild identisch aussehen — ein Ring in drei Ringgrößen, ein Buch als Hardcover und Taschenbuch mit demselben Cover.
- Ein Bundle oder Geschenkset verwendet bewusst das Foto einer Komponente erneut.
- Zwei Einträge für denselben physischen Artikel, etwa eine Standard- und eine Aktions-SKU, nutzen absichtlich ein Bild.
- Eine Marke verwendet ein einziges Lifestyle-Bild über eine kleine abgestimmte Reihe hinweg.
ImageDup entscheidet diese Fälle nicht für dich. Es zeigt dir, wo ein Bild wiederverwendet wird und wie viele eindeutige Produkt-IDs beteiligt sind, und du beurteilst, ob diese Wiederverwendung beabsichtigt ist.
DUPLIKAT und PRÜFEN
ImageDup ordnet jede wiederholte Bild-URL einer von zwei Gruppen zu:
- DUPLIKAT — dieselbe Bild-URL hängt an zwei oder mehr verschiedenen, nicht leeren Produkt-IDs. Das ist der Fall, der am ehesten eine Korrektur braucht, weil sich getrennte Produkte ein Bild teilen.
- PRÜFEN — dieselbe Bild-URL wiederholt sich, aber die Zeilen belegen nicht zwei oder mehr verschiedene Produkt-IDs. Das passiert, wenn eine Produkt-ID auf mehreren Zeilen steht, wenn Zeilen exakte Duplikate sind oder wenn die Produkt-ID leer ist. Oft sind das harmlose Variantenzeilen, sie können aber auch ein Datenproblem verbergen, deshalb werden sie aufgeführt statt ignoriert.
Zeilen ohne Produkt-ID erzeugen für sich genommen nie ein DUPLIKAT, weil ImageDup nicht erkennen kann, ob sie zu einem Produkt oder zu mehreren gehören.
Produkt-CSV-Dateien
Eine Produkt-CSV ist eine Klartext-Tabelle, die aus einer E-Commerce-Plattform, einem PIM, einem Marktplatz oder einem Feed-Tool exportiert wird. Jede Zeile ist ein Produkt oder eine Produktvariante; jede Spalte ist ein Feld wie SKU, Titel, Preis oder Bild-URL. ImageDup liest die erste Zeile als Kopfzeile und lässt dich dann deine Spalten den beiden Feldern zuordnen, die es braucht — eine Produktkennung und eine Bild-URL — plus zwei optionale Felder: einen Titel für lesbarere Ergebnisse und einen Bild-Hash.
Spaltennamen unterscheiden sich zwischen Systemen — image_link, Image Src, main_image, photo_url — deshalb rät ImageDup die Zuordnung aus dem Kopfzeilentext und markiert eine Vermutung, die du bestätigen solltest. Ist eine Vermutung falsch, wähle die richtige Spalte aus der Auswahlliste.
Katalogpflege und Feed-Prüfung
Die Prüfung auf wiederholte Bild-URLs ist ein Schritt einer umfassenderen Katalogprüfung. Ein typischer Durchgang schaut außerdem auf fehlende Bilder, defekte Bildlinks, fehlende Titel oder Beschreibungen, uneinheitliche Preise und doppelte SKUs. ImageDup konzentriert sich auf die Bild-URL-Frage und gibt dir eine herunterladbare CSV aller markierten Zeilen, versehen mit Gruppennummer und Grund, damit du die Liste an die Person weitergeben kannst, die die Quelldaten pflegt.
Die Prüfung nach jedem Export oder vor jeder Feed-Übermittlung fängt Wiederholungen ab, die durch neue Produkte oder eine geänderte Export-Einstellung entstehen, bevor sie einen Shop oder einen Verkaufskanal erreichen.
Die Grenzen des exakten URL-Abgleichs
Der exakte Abgleich ist präzise, aber wörtlich. Er übersieht:
- Dasselbe Bild unter zwei Adressen. Die URLs
https://cdn.beispiel/a.jpgundhttps://images.beispiel/a.jpg, oder eine CDN-URL und ihre Ursprungs-URL, liefern ein Bild, sind aber verschiedene Zeichenketten. ImageDup behandelt sie als verschieden. - Dasselbe Bild mit einem Cache-Busting-Parameter. Die URLs
photo.jpg?v=1undphoto.jpg?v=2bleiben getrennt, weil eine Query die Antwort berechtigterweise ändern kann. - Skalierte oder neu codierte Kopien. Ein Thumbnail und eine Vollversion eines Fotos sind verschiedene Dateien unter verschiedenen URLs.
Er führt außerdem bewusst nicht http mit https, www mit der bloßen Domain oder einen abschließenden Schrägstrich zusammen, weil diese auf verschiedene Ressourcen verweisen können.
Um dasselbe Bild unter verschiedenen URLs zu erfassen, füge deinem Export eine Spalte mit Bild-Hashes hinzu — ein MD5 der Datei oder einen perzeptuellen Hash wie pHash oder dHash, in Hex — und ordne sie zu. ImageDup gleicht dann für jede Zeile mit Hash über den Hash ab und fällt für Zeilen ohne Hash auf die URL zurück. Es berechnet weiterhin keine Hashes selbst und vergleicht Bilder nicht visuell; es vertraut den Hash-Werten, die du bereitstellst.
Fragen
Was erkennt ImageDup?
Zeilen in deiner Produkt-CSV, die auf dieselbe Bild-URL verweisen. Es gruppiert jede wiederholte Bildadresse und zeigt, wie viele eindeutige Produkt-IDs sie teilen. Wenn du eine Bild-Hash-Spalte zuordnest, gruppiert es Zeilen mit Hash nach dem Hash.
Lädt ImageDup meine CSV hoch?
Nein. Die Datei wird von JavaScript gelesen und analysiert, das in deinem Browser läuft. Sie wird an keinen Server gesendet. Die Schaltfläche „Beispieldaten verwenden“ lädt eine kleine Beispieldatei, die dieser Seite beiliegt.
Was ist eine doppelte Bild-URL?
Eine Bildadresse, die in mehr als einer Zeile vorkommt. ImageDup vergleicht den Adresstext, nachdem Leerzeichen entfernt, Schema und Domain kleingeschrieben und das #Fragment verworfen wurden. Es vergleicht nicht die Bilder selbst.
Können mehrere Produkte dasselbe Bild berechtigt verwenden?
Ja. Varianten, die auf dem Foto identisch aussehen, ein Bundle, das ein Komponentenbild wiederverwendet, oder zwei Einträge für einen physischen Artikel können sich ein Bild absichtlich teilen. ImageDup meldet die Wiederverwendung; ob sie beabsichtigt ist, entscheidest du.
Erkennt ImageDup optisch ähnliche Bilder?
Nein. Es öffnet oder vergleicht keine Bilder. Zwei verschiedene URLs, die dasselbe Bild liefern, werden nicht zusammengeführt, es sei denn, du gibst für sie einen gemeinsamen Hash-Wert an.
Welche CSV-Spalten kann ich nutzen?
Eine Spalte mit einer Produktkennung (SKU, Handle oder ID) und eine Bild-URL-Spalte sind erforderlich. Eine Produkttitel-Spalte und eine Bild-Hash-Spalte sind optional. Der Titel macht die Ergebnistabelle lesbarer; der Hash lässt ImageDup dasselbe Bild über verschiedene URLs hinweg abgleichen.
Was, wenn meine CSV andere Spaltennamen nutzt?
ImageDup rät die Zuordnung aus deiner Kopfzeile und markiert jede unsichere Vermutung. Du bestätigst oder änderst jede Zuordnung mit einer Auswahlliste deiner tatsächlichen Spaltennamen, bevor die Prüfung läuft — eigene Kopfzeilen sind also kein Problem.
Was ist der Unterschied zwischen DUPLIKAT und PRÜFEN?
DUPLIKAT bedeutet, dass dieselbe Bild-URL von zwei oder mehr verschiedenen, nicht leeren Produkt-IDs verwendet wird. PRÜFEN bedeutet, dass sich die URL wiederholt, die Zeilen aber nicht zwei oder mehr verschiedene Produkt-IDs belegen — ein Produkt auf mehreren Zeilen, exakte doppelte Zeilen oder Zeilen mit leerer ID.
Kann ich die Ergebnisse herunterladen?
Ja. „Ergebnisse herunterladen“ gibt dir eine CSV mit jeder markierten Zeile samt ihren ursprünglichen Spalten, plus einer duplicate_group-Nummer und einem duplicate_reason von DUPLICATE oder REVIEW.