Google Search Console introduce il reporting della ricerca multimodale

Lens, Circle to Search, upload di immagini e “Search this image” diventano finalmente misurabili. Il punto, però, non è soltanto il nuovo filtro: cambia il modo in cui dobbiamo leggere la visibilità quando la ricerca parte da ciò che l’utente vede.

C’è un passaggio nell’annuncio del 24 settembre 2026 che vale più della nuova voce in un menu. Google non sta semplicemente aggiungendo un altro filtro a Search Console: sta iniziando a separare una parte delle ricerche web in base al modo in cui nasce la query. Da un lato il testo; dall’altro un’immagine, una foto o uno screenshot che diventa input di ricerca.

Per chi fa SEO è un cambio di prospettiva importante. Finora potevamo misurare il rendimento della Ricerca immagini, osservare le landing page e leggere alcuni segnali indiretti. Era molto più difficile, invece, isolare il momento in cui l’utente non cominciava digitando una keyword, ma mostrando a Google ciò che aveva davanti. Con il nuovo reporting “Web: multimodal” quella zona grigia diventa finalmente analizzabile.

La notizia in breve. Il nuovo filtro multimodale è disponibile nei report di rendimento dei risultati di ricerca e nel report dedicato alle funzionalità di AI generativa. Comprende ricerche con Google Lens, Circle to Search su Android, immagini caricate su Google Search e la funzione “Search this image” di Chrome. Il rollout è globale e i dati compaiono quando una proprietà riceve effettivamente traffico da queste ricerche.

Google Search Central — Announcing web multimodal Search performance reporting in Search Console

Che cosa misura davvero il nuovo filtro “Web: multimodal”

Google definisce il nuovo segmento come il traffico dei risultati Web generato da ricerche in cui un’immagine viene usata come parte dell’input. È una distinzione semplice sulla carta, ma molto importante nell’analisi: non stiamo parlando soltanto di risultati visuali, bensì di un diverso modo di interrogare il motore di ricerca.

Un utente può fotografare un oggetto con Lens, cerchiare un prodotto in uno screenshot tramite Circle to Search, caricare un’immagine nella Ricerca Google oppure usare la funzione di Chrome per cercare un’immagine. Da quel momento il contenuto visuale diventa una componente dell’intento. La pagina che emerge deve quindi essere comprensibile non solo per le parole presenti, ma anche per la relazione tra immagine, entità, contesto e contenuto della landing page.

Multimodal non significa “Ricerca immagini”

Questo è il primo punto da non sbagliare. “Image” e “Web: multimodal” non sono due etichette per la stessa cosa. La Ricerca immagini descrive il tipo di superficie o risultato. Il filtro multimodale descrive invece come è partita la ricerca: un’immagine, una foto o uno screenshot hanno contribuito alla query che ha portato a un risultato Web.

In pratica, sono due assi diversi: formato del risultato e modalità di input. Per l’analisi SEO cambia molto, perché una pagina web tradizionale può ottenere visibilità in un percorso iniziato con una fotocamera o con uno screenshot, anche se l’utente non è entrato nella scheda “Immagini”.

Il limite più importante: la dimensione Query non è il centro dell’analisi

La documentazione aggiornata riportata da Search Engine Roundtable precisa che, per il traffico multimodale, la dimensione Query non è disponibile: molte ricerche partono soprattutto da immagini e non esiste necessariamente una stringa testuale specifica da mostrare. Questo ci obbliga a cambiare metodo.

Nella SEO classica partiamo spesso dalle query e risaliamo alle pagine. Qui conviene fare il contrario: partire dalle pagine, raggrupparle per template, categoria o intento, osservare dispositivi e Paesi, quindi capire quali asset visuali e quali entità hanno in comune le URL che stanno guadagnando impression multimodali.

Perché questa novità conta davvero per la SEO

Il valore del nuovo report non sta nel fatto che aggiunge una metrica. Sta nel fatto che rende osservabile un comportamento che fino a ieri era difficile da separare dal resto. La ricerca visuale non è più soltanto un tema di Google Images: entra nella ricerca Web, in Lens, nei percorsi mobile e nelle esperienze generative.

Questo è particolarmente rilevante per e-commerce, moda, arredamento, automotive, food, travel, tutorial, recensioni di prodotto e in generale per qualsiasi progetto in cui l’utente possa riconoscere, confrontare o identificare qualcosa partendo da un’immagine. Ma non riguarda solo i siti “fotografici”. Anche un articolo editoriale può essere trovato perché contiene l’immagine giusta, inserita nel contesto giusto e collegata a un’entità che Google riesce a comprendere.

La ricerca multimodale entra anche nel reporting dell’AI generativa

Google ha inserito il filtro anche nel report sul rendimento delle funzionalità di AI generativa. Quel report comprende oggi AI Overview e AI Mode. È un passaggio interessante perché permette di leggere una parte della visibilità generativa distinguendo i percorsi che hanno avuto origine da un input visuale.

Qui è importante evitare scorciatoie concettuali: Google continua a ribadire che non esiste uno schema speciale o un file “AI” necessario per comparire in AI Overview o AI Mode. Le fondamenta restano quelle della SEO: accessibilità al crawling, indicizzazione, contenuti utili, immagini e video di qualità quando pertinenti, dati strutturati coerenti con il contenuto visibile e informazioni di prodotto aggiornate.

Tips SEO avanzati per lavorare sulla ricerca multimodale

1. Costruisci una baseline multimodale prima di “ottimizzare”

Non partire modificando centinaia di immagini. Parti dai dati. Dal momento in cui il filtro compare nella proprietà, salva una baseline per impression, clic, CTR e pagine coinvolte. Dopo alcune settimane confronta finestre omogenee, per esempio 28 giorni contro i 28 precedenti, e separa almeno mobile e desktop. All’inizio il trend è spesso più informativo del volume assoluto.

Per siti grandi, esporta i dati e costruisci coorti per tipologia di pagina: schede prodotto, categorie, articoli, guide, recensioni, landing locali. Se il multimodale cresce solo su uno specifico template, hai già un’indicazione molto più utile di una media di sito.

2. Fai SEO delle immagini partendo dalla crawlability, non dall’alt text

L’alt text conta, ma arriva dopo una condizione più banale: Google deve poter scoprire e recuperare l’immagine. Le linee guida di Google consigliano di usare elementi HTML immagine standard; le immagini caricate soltanto come background CSS non vengono indicizzate da Google Images. Per siti con molte risorse visuali, una sitemap immagini può aiutare a far scoprire asset che altrimenti potrebbero essere difficili da trovare.

Se le immagini sono servite da CDN, mantieni URL stabili e controllabili. Google suggerisce anche di verificare il dominio della CDN in Search Console quando possibile, così da poter ricevere indicazioni su eventuali errori di scansione. Nei progetti ad alto traffico, aggiungerei anche una lettura periodica dei log per capire come Googlebot e Googlebot-Image stanno realmente accedendo agli asset strategici.

3. Tratta immagine e testo circostante come un’unica unità semantica

Google ricava informazioni sull’immagine anche dal contenuto della pagina, dalle didascalie, dai titoli e dal testo vicino. Questo significa che una foto perfetta inserita in una pagina semanticamente debole può essere meno utile di quanto sembri. Il soggetto visuale deve essere coerente con H1, titolo, paragrafo vicino, entità citate e intento della pagina.

Il nome file fornisce un segnale leggero, mentre l’alt text è importante soprattutto per accessibilità e comprensione. Va scritto in modo descrittivo e contestuale, senza trasformarlo in un contenitore di keyword. Se l’immagine mostra “scarpa da running blu con suola bianca”, descrivere il soggetto è utile; ripetere dieci varianti della stessa keyword non lo è.

4. Crea asset visuali che aiutino a riconoscere l’entità

Per un e-commerce non limitarti alla classica foto prodotto isolata. Quando ha senso, aggiungi viste laterali, dettagli, texture, proporzioni, utilizzo reale e varianti. Non è una formula di ranking, ma una scelta che migliora la capacità dell’utente e dei sistemi di visual search di disambiguare ciò che stanno osservando.

Lo stesso principio vale per contenuti editoriali: diagrammi originali, fotografie contestuali, screenshot annotati con criterio e visual che rappresentano davvero il concetto trattato sono più utili di stock generici. La priorità è sempre la riconoscibilità del soggetto e la coerenza con la pagina.

5. Usa i dati strutturati per esplicitare la relazione tra pagina, immagine ed entità

I dati strutturati non sono un acceleratore magico del ranking, ma aiutano Google a comprendere in modo più esplicito ciò che la pagina rappresenta. Per contenuti editoriali puoi indicare l’immagine principale della pagina o l’immagine dell’articolo; per e-commerce, il markup Product e le informazioni delle schede del commerciante collegano immagini, prodotto, prezzo, disponibilità e altri attributi.

Google specifica inoltre che le informazioni di prodotto possono comparire in Google Images e Google Lens. Nei cataloghi con varianti, usa una modellazione coerente di Product e ProductGroup, identificatori stabili e immagini che rappresentino davvero la variante mostrata. Il markup deve sempre corrispondere a ciò che l’utente vede sulla pagina.

6. Non rompere la visibilità con lazy loading e rendering

Il lazy loading è utile per le performance, ma va implementato in modo che i contenuti diventino disponibili quando entrano nel viewport e non dipendano da un click o da un’interazione che Google non esegue. Per immagini responsive, Google raccomanda anche di mantenere un URL di fallback. Il test corretto non è soltanto “la pagina sembra veloce”: bisogna verificare che Google possa effettivamente recuperare gli asset importanti nella versione renderizzata.

7. Per gli e-commerce, allinea sito, Merchant Center e varianti

La ricerca visuale è particolarmente sensibile alle entità prodotto. Se la pagina mostra un modello, il feed ne descrive un altro e le varianti hanno identificatori incoerenti, stai creando ambiguità proprio nel punto in cui vuoi essere riconosciuto. Mantieni allineati nome, brand, GTIN o SKU quando disponibili, disponibilità, prezzo, immagini e attributi di variante.

Non serve creare dati “per Lens”: serve ridurre le contraddizioni tra ciò che Google vede nell’immagine, ciò che legge nella pagina e ciò che riceve dai dati strutturati o dai feed.

8. Costruisci test visuali ripetibili, non screenshot casuali

Per le pagine strategiche crea una piccola batteria di test manuali con Lens o strumenti equivalenti: foto frontale, dettaglio, contesto d’uso, screenshot, variante di colore, inquadratura parziale. L’obiettivo non è trasformare un test manuale in un “rank tracker di Lens”, perché i risultati sono contestuali e dinamici. Serve piuttosto a individuare errori di riconoscimento, ambiguità tra prodotti e landing page che Google associa male al soggetto.

Ripeti gli stessi scenari dopo modifiche importanti alle immagini, al template o ai dati strutturati. Se Search Console mostra contemporaneamente un cambiamento nel segmento multimodale, hai un segnale utile da investigare, non una prova causale automatica.

9. Misura per landing page e outcome, non cercare di ricostruire la keyword mancante

Il rischio è perdere tempo tentando di ricreare artificialmente la query che Search Console non mostra. È più utile collegare la crescita multimodale alle landing page e ai risultati di business: visualizzazioni prodotto, lead, add-to-cart, vendite, iscrizioni o altre conversioni. L’attribuzione non sarà perfetta a livello di singola sessione, quindi lavora per coorti di pagina e finestre temporali coerenti.

Un esempio: se un cluster di schede prodotto aumenta le impression multimodali e nello stesso periodo cresce l’ingresso organico mobile su quelle URL, controlla se sono cambiate immagini, disponibilità, feed, markup o domanda di mercato. È un metodo di analisi, non una scorciatoia per attribuire ogni conversione a Lens.

10. Usa il nuovo report per trovare dove investire, non solo per fare reporting

La parte più interessante sarà identificare pagine con molte impression multimodali ma CTR debole, oppure pagine con crescita visuale e poche informazioni contestuali. Questi sono candidati migliori per un audit rispetto a un intervento sitewide indiscriminato. Il nuovo filtro deve diventare uno strumento di prioritizzazione: quali asset visuali meritano un redesign, quali categorie richiedono immagini migliori, quali template impediscono a Google di capire correttamente il contenuto.

E le platform properties di YouTube, Instagram, TikTok e X?

Da luglio 2026 Search Console consente anche di aggiungere platform properties per monitorare come contenuti pubblicati su Instagram, TikTok, X e YouTube vengono scoperti tramite Google. È una funzionalità distinta dal nuovo filtro multimodale, ma va nella stessa direzione: la presenza organica di un brand non coincide più con il solo dominio proprietario.

Per un progetto editoriale o un brand con una forte produzione video e social, conviene leggere insieme questi segnali. Una stessa entità può essere scoperta attraverso una pagina del sito, un’immagine, un video YouTube o un contenuto social indicizzato da Google. La strategia SEO deve quindi mantenere coerenza tra naming, contenuti, visual e dati strutturati su più superfici.

Gli errori che eviterei

Il primo è scambiare il nuovo filtro per una nuova disciplina separata dalla SEO. Google, anche nelle linee guida sull’AI generativa, continua a indicare le fondamenta classiche: crawling, indicizzazione, contenuti utili, immagini di qualità, dati strutturati coerenti e informazioni commerciali aggiornate. Non esiste un markup “multimodal SEO”.

Il secondo è ottimizzare soltanto l’alt text. Se l’immagine è irraggiungibile, caricata in modo problematico, duplicata con URL instabili o inserita in una pagina povera di contesto, un alt perfetto non risolve il problema. Il terzo è giudicare il fenomeno solo dai clic: nelle prime fasi le impression e la distribuzione delle landing page possono raccontare molto più del traffico assoluto.

Il punto per chi fa SEO

La keyword non scompare. Semplicemente smette di essere l’unica porta d’ingresso. La ricerca multimodale sposta parte dell’interazione da “scrivo ciò che cerco” a “ti mostro ciò che sto guardando”. Search Console ora ci offre finalmente un primo livello di reporting specifico per quel comportamento.

Per me la conseguenza pratica è chiara: le immagini non vanno più trattate come un allegato del contenuto. Devono diventare asset tecnici e semantici, con URL stabili, contesto, qualità, relazione esplicita con le entità della pagina e misurazione nel tempo. Non perché esista una nuova formula segreta per Lens, ma perché la Search sta diventando sempre più capace di partire dal mondo reale, dagli screenshot e dai visual per arrivare alle pagine.

Il nuovo filtro di Search Console non ci dice ancora tutto. Non mostra la query testuale nel modo a cui siamo abituati e non risolve l’attribuzione. Ma ci dà qualcosa che mancava: un modo per capire quali contenuti stanno entrando davvero nei percorsi di ricerca visuale. Ed è da lì che conviene iniziare.