Encuentra URLs de imagen repetidas en un CSV de productos

ImageDup analiza la exportación CSV de tu catálogo y agrupa las filas que apuntan a la misma URL de imagen, para que veas qué productos reutilizan una misma foto. Pensado para tiendas online, responsables de catálogo y cualquier persona que trabaje con datos de producto.

Gratis. Sin cuenta. Sube una exportación CSV, no archivos de imagen. Todo se ejecuta en tu navegador.

Tu CSV se procesa en el navegador. No se sube a ningún servidor.

Encuentra URLs de imagen duplicadas en CSV de productostext/csv · ≤ 20 MB

Una exportación CSV de tus productos con al menos un identificador de producto y una URL de imagen por fila.

Arrastra aquí un CSV de productos o elige un archivo

.csv, hasta ~20 MB, la primera fila se toma como encabezados

ImageDup compara el texto de la URL de imagen, no los píxeles. Para la misma imagen servida desde URLs distintas, necesitas una columna de hash de imagen ya existente.

Una exportación de catálogo de ropa de 20 filas con repeticiones deliberadas: variantes de color que comparten una foto, un producto listado en dos filas y productos distintos que apuntan a la misma imagen. Algunas filas también incluyen una columna image_hash que puedes asignar.

Cómo funciona

  1. Asigna tus columnas

    Indica qué columna contiene el identificador de producto y cuál la URL de la imagen. El título del producto y el hash de imagen son opcionales.

  2. Agrupa las filas por URL de imagen

    Cada fila se agrupa por su URL de imagen, o por la columna de hash si asignas una. Cualquier dirección usada en más de una fila se marca, y los casos más claros —una imagen usada por varios identificadores de producto distintos— aparecen primero.

  3. Exporta las filas marcadas

    Descarga un CSV con todas las filas marcadas, etiquetadas con un número de grupo y un motivo, para saber exactamente qué revisar en tus datos de origen.

Qué cuenta como duplicado

De forma predeterminada, esta herramienta compara URLs de imagen, no el contenido de las imágenes. Dos filas coinciden cuando su URL de imagen es idéntica tras una normalización mínima y segura: se recortan los espacios sobrantes, se pasan a minúsculas el esquema y el host, y se descarta el #fragmento.

Todo lo demás se deja intacto, porque modificarlo podría unir imágenes que en realidad son distintas. La ruta conserva sus mayúsculas y minúsculas (/IMG/A.JPG y /img/a.jpg siguen separadas), la cadena de consulta se mantiene completa (?v=2 es distinto de ?v=1) y http frente a https, un www. inicial y una / final se tratan como direcciones diferentes.

Esto no es detección visual de duplicados. Dos URLs distintas que muestran la misma foto no se marcan. Para detectar esos casos, añade una columna de hashes de imagen (por ejemplo un MD5 o un hash perceptual, en hexadecimal) y asígnala: la comparación usará entonces el hash en las filas que lo tengan y recurrirá a la URL en las que no.

Un valor usado por dos o más identificadores de producto distintos se marca como DUPLICADO. Un valor que se repite en filas que no corresponden a dos o más identificadores distintos —un mismo producto en varias filas, o filas sin identificador— se marca como REVISAR en lugar de considerarse un duplicado.

URLs de imagen duplicadas en los datos de producto

Qué es una URL de imagen duplicada

Una URL de imagen duplicada es una única dirección de imagen que aparece en más de una fila de un archivo de productos. Si dos filas indican https://cdn.ejemplo/img/camisa-azul.jpg en la columna de imagen, esas filas comparten una URL de imagen. ImageDup agrupa las filas por esa dirección y te muestra cada grupo en el que la misma dirección se usa más de una vez.

Es una comparación de texto. ImageDup lee la cadena de la URL, aplica unos pocos ajustes seguros —recortar espacios, pasar a minúsculas el esquema y el dominio, descartar el #fragmento— y luego comprueba si el resultado es idéntico. No abre la imagen, no la descarga ni compara píxeles. Dos filas solo coinciden cuando coinciden sus direcciones de imagen.

Por qué los catálogos acaban con URLs de imagen repetidas

La mayoría de las URLs de imagen repetidas son un efecto secundario de cómo se generan y exportan los datos de producto, no una decisión deliberada:

  • Filas de variantes. Muchas plataformas exportan una fila por talla o color. Una camisa en cinco tallas son cinco filas y, si las variantes de talla nunca tuvieron fotos propias, las cinco apuntan a la misma imagen.
  • Alta de productos por copia. Un producto nuevo se duplica a partir de otro existente para ahorrar tiempo y el campo de imagen nunca se cambia.
  • Imágenes de marcador. Una imagen de «próximamente» o una imagen genérica de categoría se asigna a cada producto que aún no tiene foto real. Cientos de filas pueden compartir un mismo marcador.
  • Uniones de feeds y reexportaciones. Cuando un feed se construye uniendo varias tablas, o se exporta repetidamente desde un sistema que añade en lugar de reemplazar, el mismo producto puede aparecer en varias filas con la misma imagen.
  • Restos de migraciones. Cambiar de plataforma a menudo asigna varios campos antiguos a una sola columna de imagen nueva, lo que genera repeticiones.

Cuándo una URL de imagen repetida no es un problema

Una URL de imagen repetida no es automáticamente un problema. Hay motivos habituales para ello:

  • Un producto y sus variantes comparten realmente una foto porque en la imagen se ven idénticas: un anillo en tres tallas, un libro en tapa dura y en rústica con la misma portada.
  • Un pack o un set de regalo reutiliza a propósito la foto de uno de sus componentes.
  • Dos fichas del mismo artículo físico, por ejemplo un SKU estándar y otro promocional, usan una sola imagen de forma intencionada.
  • Una marca usa una única imagen de ambiente en una pequeña gama coordinada.

ImageDup no decide estos casos por ti. Te muestra dónde se reutiliza una imagen y cuántos identificadores de producto distintos intervienen, y tú juzgas si esa reutilización es intencionada.

DUPLICADO y REVISAR

ImageDup clasifica cada URL de imagen repetida en uno de dos grupos:

  • DUPLICADO: la misma URL de imagen está asociada a dos o más identificadores de producto distintos y no vacíos. Es el caso con más probabilidades de necesitar corrección, porque productos separados comparten una misma foto.
  • REVISAR: la misma URL de imagen se repite, pero las filas no establecen dos o más identificadores de producto distintos. Ocurre cuando un identificador aparece en varias filas, cuando hay filas exactamente iguales o cuando el identificador está vacío. Suelen ser filas de variantes inofensivas, pero también pueden ocultar un problema de datos, así que se listan en lugar de ignorarse.

Las filas sin identificador de producto nunca generan por sí solas un DUPLICADO, porque ImageDup no puede saber si pertenecen a un producto o a varios.

Archivos CSV de productos

Un CSV de productos es una tabla de texto plano exportada desde una plataforma de comercio electrónico, un PIM, un marketplace o una herramienta de feeds. Cada fila es un producto o una variante; cada columna es un campo como el SKU, el título, el precio o la URL de imagen. ImageDup lee la primera fila como encabezados y luego te permite asignar tus columnas a los dos campos que necesita —un identificador de producto y una URL de imagen— más dos campos opcionales: un título para que los resultados se lean mejor y un hash de imagen.

Los nombres de columna varían entre sistemas —image_link, Image Src, main_image, photo_url—, así que ImageDup deduce la asignación a partir del texto de los encabezados y marca las deducciones que conviene confirmar. Si una deducción es incorrecta, elige la columna adecuada en el desplegable.

Limpieza de catálogo y auditoría de feeds

Comprobar las URLs de imagen repetidas es un paso dentro de una revisión de catálogo más amplia. Una revisión típica también busca imágenes que faltan, enlaces de imagen rotos, títulos o descripciones ausentes, precios incoherentes y SKU duplicados. ImageDup se centra en la cuestión de las URLs de imagen y te da un CSV descargable con todas las filas marcadas, etiquetadas con un número de grupo y un motivo, para que puedas pasar la lista a quien mantenga los datos de origen.

Ejecutar la comprobación después de cada exportación, o antes de cada envío de feed, detecta las repeticiones que introducen los productos nuevos o un cambio en la configuración de exportación antes de que lleguen a una tienda o a un canal de venta.

Los límites de la coincidencia exacta de URLs

La coincidencia exacta es precisa, pero literal. No detectará:

  • La misma imagen en dos direcciones. Las URLs https://cdn.ejemplo/a.jpg y https://images.ejemplo/a.jpg, o una URL de CDN y su URL de origen, muestran la misma foto pero son cadenas distintas. ImageDup las trata como diferentes.
  • La misma imagen con un parámetro anticaché. Las URLs photo.jpg?v=1 y photo.jpg?v=2 se mantienen separadas, porque una cadena de consulta puede cambiar legítimamente la respuesta.
  • Copias redimensionadas o recodificadas. Una miniatura y la versión a tamaño completo de una misma foto son archivos distintos en URLs distintas.

Tampoco une, por diseño, http con https, ni www con el dominio a secas, ni una barra final, porque pueden apuntar a recursos diferentes.

Para detectar la misma foto servida desde URLs distintas, añade a tu exportación una columna de hashes de imagen —un MD5 del archivo o un hash perceptual como pHash o dHash, en hexadecimal— y asígnala. ImageDup usará entonces el hash en las filas que lo tengan y recurrirá a la URL en las que no. Aun así, no calcula los hashes por su cuenta ni compara las imágenes visualmente: confía en los valores de hash que le proporcionas.

Preguntas

¿Qué detecta ImageDup?

Filas de tu CSV de productos que apuntan a la misma URL de imagen. Agrupa cada dirección de imagen repetida y muestra cuántos identificadores de producto distintos la comparten. Si asignas una columna de hash de imagen, agrupa por hash las filas que lo tengan.

¿ImageDup sube mi CSV?

No. El archivo lo lee y lo analiza el JavaScript que se ejecuta en tu navegador. No se envía a ningún servidor. El botón «Usar datos de ejemplo» carga un archivo de muestra pequeño incluido en esta página.

¿Qué es una URL de imagen duplicada?

Una dirección de imagen que aparece en más de una fila. ImageDup compara el texto de la dirección tras recortar los espacios, pasar a minúsculas el esquema y el dominio, y descartar el #fragmento. No compara las imágenes en sí.

¿Pueden varios productos usar legítimamente la misma imagen?

Sí. Variantes que se ven idénticas en la foto, packs que reutilizan la imagen de un componente o dos fichas de un mismo artículo físico pueden compartir una imagen a propósito. ImageDup informa de la reutilización; decidir si es intencionada es cosa tuya.

¿ImageDup detecta imágenes visualmente parecidas?

No. No abre ni compara las fotos. Dos URLs distintas que muestran la misma imagen no se emparejan salvo que les proporciones un mismo valor de hash.

¿Qué columnas del CSV puedo usar?

Se requieren una columna de identificador de producto (SKU, handle o ID) y una columna de URL de imagen. Una columna de título de producto y una de hash de imagen son opcionales. El título hace la tabla de resultados más legible; el hash permite a ImageDup emparejar la misma imagen en URLs distintas.

¿Y si mi CSV usa otros nombres de columna?

ImageDup deduce la asignación a partir de tu fila de encabezados y marca cualquier deducción dudosa. Confirmas o cambias cada asignación con un desplegable que contiene tus nombres de columna reales antes de ejecutar la comprobación, así que los encabezados personalizados no son ningún problema.

¿Cuál es la diferencia entre DUPLICADO y REVISAR?

DUPLICADO significa que la misma URL de imagen la usan dos o más identificadores de producto distintos y no vacíos. REVISAR significa que la URL se repite, pero las filas no establecen dos o más identificadores distintos: un mismo producto en varias filas, filas exactamente iguales o filas con el identificador vacío.

¿Puedo descargar los resultados?

Sí. «Descargar resultados» te da un CSV con todas las filas marcadas y sus columnas originales, más un número duplicate_group y un duplicate_reason con valor DUPLICATE o REVIEW.