← Torna al blog

Come le piattaforme social rilevano i contenuti duplicati

MetaGhost
Team MetaGhost

In breve

Il rilevamento dei duplicati combina più segnali: hash percettivi delle immagini (pHash/PDQ), impronte video e audio (TMK+PDQF, Content ID) e metadati dei file. Ogni caricamento viene ridotto a un'impronta e confrontato con un ampio indice di contenuti noti. Basta una corrispondenza vicina, non esatta, per identificarlo come repost: ecco perché salvare di nuovo un file o modificarlo leggermente non azzera il rilevamento.

Come le piattaforme social rilevano i contenuti duplicati

Ogni foto o video che carichi sui social attraversa una serie invisibile di sistemi di rilevamento prima che qualcuno lo veda. Questi sistemi confrontano i tuoi contenuti con miliardi di file noti per stabilire se siano originali o copie.

Le piattaforme non si affidano a una sola tecnologia. Combinano tre livelli di rilevamento distinti, ciascuno dedicato a una dimensione diversa del contenuto. Devi superarli tutti e tre contemporaneamente.

Capire come funzionano è il primo passo per comprendere perché la maggior parte dei metodi per superare il rilevamento fallisce e cosa funziona davvero.

Livello 1: analisi dei metadati, la prima cosa che leggono le piattaforme

Prima ancora di guardare cosa contiene un'immagine, una piattaforma legge i metadati del file. Ogni foto scattata con uno smartphone incorpora decine di campi di dati nascosti nel file stesso (i cosiddetti dati EXIF). Comprendono il modello della fotocamera (per esempio «iPhone 15 Pro Max»), un identificatore univoco dell'obiettivo, le coordinate GPS del luogo dello scatto, data e ora precise al secondo, il software usato per elaborarla, informazioni sullo spazio colore e impostazioni di compressione.

I file video contengono metadati simili nel formato contenitore (intestazioni MP4, atomi QuickTime): dispositivo di registrazione, versione dell'encoder, frequenza dei fotogrammi, codec audio e data di creazione.

Come li usano le piattaforme

Quando carichi un file, la piattaforma legge tutti questi metadati prima di rimuoverne la maggior parte dalla versione visibile al pubblico. I metadati forniscono un rapido segnale di autenticità. Un file con dati EXIF completi e coerenti di un modello recente di iPhone, scattato due minuti prima in una posizione GPS plausibile, è quasi certamente originale. Un file senza metadati, o con metadati che indicano «Adobe Photoshop» senza informazioni sulla fotocamera, segnala che è stato scaricato da internet, modificato o acquisito tramite screenshot.

Le piattaforme usano i metadati anche per identificare i caricamenti. Se lo stesso identificatore di dispositivo carica più volte lo stesso hash di file, oppure se i metadati di un file corrispondono esattamente a un altro caricamento da un account diverso, scatta un segnale sospetto. Instagram, per esempio, registra le firme di dispositivi e software nella sua pipeline di caricamento.

Cosa intercetta e cosa le sfugge

L'analisi dei metadati intercetta i repost più ingenui: chi scarica una foto e la ricarica senza modifiche. I metadati mancanti o incoerenti contrassegnano subito il file come sospetto. Tuttavia, i metadati da soli non possono stabilire se il contenuto visivo sia una copia. Due foto completamente diverse scattate con lo stesso modello di telefono avranno metadati simili, mentre una foto identica con metadati alterati sembrerà originale. Ecco perché serve il livello successivo.

Livello 2: hashing percettivo, l'impronta dei pixel

L'hashing percettivo è il pilastro del rilevamento dei duplicati su larga scala. A differenza di un hash crittografico (come SHA-256), in cui cambiare un solo bit produce un risultato completamente diverso, un hash percettivo è progettato per produrre risultati simili per immagini visivamente simili. Quindi ritagliare, comprimere o modificare leggermente una foto non cambia abbastanza il suo hash percettivo da sfuggire al rilevamento.

Come funziona l'hashing percettivo

Esistono diverse varianti, ma seguono tutte un processo simile. Prendiamo pHash (perceptual hash), il più diffuso:

  • Ridimensionamento: l'immagine viene ridotta a una risoluzione molto piccola, in genere 32x32 pixel. Questo elimina i dettagli fini e normalizza le dimensioni.
  • Conversione in scala di grigi: vengono rimosse le informazioni sul colore, perché l'hash deve restare invariato rispetto a variazioni cromatiche e filtri.
  • Applicazione della DCT (Discrete Cosine Transform): viene applicata una trasformazione in frequenza, simile a quella della compressione JPEG, che estrae le strutture visive dominanti.
  • Estrazione delle componenti a bassa frequenza: viene conservato solo il blocco 8x8 in alto a sinistra dei coefficienti DCT, che rappresenta la struttura visiva principale dell'immagine.
  • Generazione dell'hash binario: ogni coefficiente viene confrontato con il valore medio: sopra la media = 1, sotto = 0. Si ottiene così un'impronta binaria a 64 bit.

Altre varianti come dHash (difference hash) calcolano i gradienti tra pixel, mentre aHash (average hash) confronta semplicemente la luminosità dei pixel con la media. Tutte producono impronte compatte confrontabili in microsecondi tramite la distanza di Hamming.

Perché resiste alle modifiche comuni

Poiché l'hashing percettivo lavora su rappresentazioni ridotte, in scala di grigi e a bassa frequenza, è intrinsecamente resistente a molte trasformazioni comuni:

  • Compressione: ricodificare in JPEG a diversi livelli di qualità influisce pochissimo sulla struttura a bassa frequenza.
  • Ritaglio: ritagli moderati conservano comunque gran parte della disposizione visiva. L'hash cambia, ma in genere resta entro la soglia di corrispondenza.
  • Filtri e regolazioni del colore: luminosità, contrasto, saturazione e filtri in stile Instagram agiscono soprattutto sui livelli di colore e luminanza, eliminati durante la conversione in scala di grigi.
  • Cambiamenti di risoluzione: l'immagine viene comunque ridimensionata a 32x32, quindi caricarla a una risoluzione diversa ha un impatto minimo.

Limiti

L'hashing percettivo fatica con le trasformazioni geometriche: rotazioni significative, cambiamenti di prospettiva o ritagli pesanti che rimuovono importanti elementi strutturali possono portare l'hash oltre la soglia di corrispondenza. Inoltre, non comprende il significato: due foto della stessa scena da angolazioni diverse producono hash diversi, anche se una persona riconoscerebbe lo stesso soggetto. Qui entra in gioco il terzo livello.

Livello 3: rilevamento delle copie con IA, il deep learning che comprende il significato

Il livello di rilevamento più potente è anche il più recente. Le grandi piattaforme usano ormai reti neurali profonde addestrate appositamente per identificare copie, a prescindere dalle modifiche superficiali applicate. Questi modelli non guardano pixel o hash. Comprendono il significato visivo di un'immagine.

SSCD (Self-Supervised Copy Detection) di Meta

Meta (Facebook/Instagram) ha sviluppato SSCD, un modello basato su ResNet50. È stato addestrato con un approccio auto-supervisionato su milioni di immagini per imparare quali caratteristiche visive restano costanti tra copie e quali cambiano tra immagini scollegate. Per ogni immagine elaborata, SSCD produce un vettore di embedding a 512 dimensioni, una rappresentazione numerica dell'identità visiva dell'immagine.

Due immagini vengono confrontate calcolando la similarità coseno tra i loro vettori di embedding. La ricerca di Meta mostra che una similarità coseno superiore a 0.75 raggiunge una precisione del 90% nel benchmark DISC2021: a questa soglia, 9 coppie segnalate su 10 sono vere copie. In produzione, alla scala di Facebook (miliardi di immagini), le piattaforme operano con soglie ancora più elevate per la precisione, accettando alcuni falsi negativi per evitare falsi positivi.

Ciò che rende SSCD così efficace è la sua invarianza. Il modello è stato addestrato appositamente per produrre embedding quasi identici per immagini ritagliate, filtrate, con testi sovrapposti, ricodificate, specchiate, acquisite tramite screenshot o con bordi aggiunti. Tutti i «trucchi» che potrebbero ingannare l'hashing percettivo sono irrilevanti per SSCD, perché ha imparato a guardare oltre le modifiche superficiali al contenuto visivo sottostante.

Il sistema di rilevamento di TikTok

TikTok usa una pipeline di deep learning a più livelli che opera con una soglia di similarità dell'85%. Il sistema analizza sia le caratteristiche visive sia quelle temporali dei video, resistendo a ricodifica, cambiamenti di velocità e riordinamento dei fotogrammi. TikTok ha dichiarato pubblicamente di usare «più livelli di rilevamento», comprese sia l'identificazione tradizionale tramite impronte sia l'analisi basata sull'IA.

Content ID di YouTube

Content ID di YouTube è il sistema più vecchio e consolidato e mantiene un database di riferimento fornito dai titolari dei diritti. Genera separatamente impronte delle tracce audio e video, confrontando i caricamenti con oltre 100 milioni di file di riferimento. Content ID intercetta i ricaricamenti anche quando il video è stato ricodificato, ritagliato, accelerato o ha ricevuto audio sovrapposto, perché usa sia il confronto percettivo sia quello basato sull'IA su canali audio e video separati.

TMK+PDQF per i video

Per i contenuti video, Meta ha sviluppato TMK+PDQF (Temporal Match Kernel + PDQ Features), che estende il rilevamento delle copie alla dimensione temporale. Genera impronte dalle sequenze di fotogrammi che resistono a ricodifica, conversione della frequenza dei fotogrammi e clip parziali. Alla scala di Facebook, questo sistema genera circa 20000 falsi positivi al giorno (una piccolissima parte dei miliardi di caricamenti quotidiani), a dimostrazione dell'estrema precisione necessaria per operare a questo livello.

Perché nessun livello basta da solo

Ogni livello di rilevamento ha un punto cieco coperto dagli altri:

  • L'analisi dei metadati intercetta file con firme dei dispositivi mancanti o incoerenti, ma non può confrontare il contenuto visivo. Un file con metadati alterati perfetti ma pixel identici supera i controlli dei metadati, fallendo quelli di hash e IA.
  • L'hashing percettivo intercetta somiglianze a livello di pixel su vasta scala, ma cede di fronte a trasformazioni geometriche e modifiche pesanti. Inoltre, non può comprendere che una versione filtrata, ritagliata e con sovrapposizioni sia la stessa immagine.
  • Il rilevamento delle copie con IA intercetta la similarità semantica a prescindere dalle modifiche visive, ma richiede molte risorse di calcolo. Le piattaforme non possono eseguirlo per ogni caricamento contro ogni immagine di riferimento, quindi usano metadati e hashing come filtri preliminari rapidi per ridurre i candidati da analizzare con IA.

Questa architettura a livelli significa che superarne uno non basta. Se alteri i metadati ma lasci i pixel invariati, ti intercetta l'hashing. Se modifichi i pixel abbastanza da ingannare l'hashing ma mantieni intatto il significato visivo, ti intercetta l'IA. Se riesci a cambiare abbastanza il significato visivo da ingannare l'IA ma lasci i metadati originali, la piattaforma segnala il caricamento come sospetto fin dall'inizio.

Come MetaGhost supera tutti e tre i livelli contemporaneamente

MetaGhost è l'unico strumento progettato per affrontare ogni livello di rilevamento in un unico processo automatico. Applica tre modifiche coordinate:

  • Inserimento di metadati autentici: sostituisce i metadati del file con firme di dispositivi complete e realistiche, provenienti da modelli reali di fotocamere. Coordinate GPS, data e ora, identificatori dei dispositivi e campi software corrispondono tutti a schemi di acquisizione autentici. Alla piattaforma, il file appare appena scattato con un vero smartphone.
  • Modifica dell'impronta a livello di pixel: altera parametri di compressione, valori dei colori e dati dei pixel in modi che interrompono la corrispondenza degli hash percettivi restando completamente invisibili all'occhio umano. pHash, dHash e aHash del file elaborato non somigliano affatto a quelli dell'originale.
  • Perturbazione avversaria con IA: applica perturbazioni subpixel ottimizzate matematicamente, create tramite ottimizzazione basata sul gradiente contro gli stessi modelli IA usati dalle piattaforme. Queste perturbazioni allontanano molto dall'originale l'embedding a 512 dimensioni nello spazio delle caratteristiche del modello, così SSCD e sistemi simili vedono l'immagine elaborata come un contenuto del tutto scollegato, anche se appare identica a qualsiasi osservatore umano.

Questo approccio su tre livelli non è facoltativo: è necessario. Ogni livello di rilevamento richiede una propria contromisura e MetaGhost li gestisce tutti e tre automaticamente, per foto e video, su tutte le principali piattaforme.

Vuoi rendere i tuoi contenuti non rilevabili su ogni piattaforma? Inizia con MetaGhost e supera tutti e tre i livelli di rilevamento in un solo passaggio.

Domande frequenti

Cos'è un hash percettivo?

Un hash percettivo è una breve firma ricavata dalla struttura visiva di un'immagine o di un fotogramma. A differenza di un hash crittografico, cambia poco quando il contenuto cambia poco, quindi file visivamente simili producono hash simili e possono essere riconosciuti.

Che differenza c'è tra rilevamento dei duplicati e avvertimento per copyright?

Il rilevamento dei duplicati confronta le impronte per individuare caricamenti ripetuti o quasi identici ai fini della copertura e dello spam. Un avvertimento per copyright (per esempio Content ID) confronta il contenuto con un riferimento del titolare dei diritti e comporta conseguenze legali o sulla monetizzazione. Usano confronti simili ma servono sistemi diversi.

La compressione o uno screenshot superano questi sistemi?

Di solito no. Le impronte percettive e audio sono progettate per resistere a ricompressione, ridimensionamento e screenshot. Queste trasformazioni spostano l'impronta solo marginalmente, spesso lasciandola entro la soglia di corrispondenza.

Aiutaci a migliorare

Questa guida ha risolto il tuo problema?

Vuoi proteggere i tuoi contenuti?

Prova MetaGhost e rendi ogni repost unico e non rilevabile.

Scopri MetaGhost

Il sito del prodotto e la registrazione sono in inglese.

Articoli correlati