Metodologia
Come misuriamo la visibilità nella ricerca IA
Una spiegazione onesta e pubblica di cosa significano i punteggi, di come li calcoliamo e, soprattutto, di cosa non possono dirti. La nostra metodologia è la cosa di cui siamo più orgogliosi: merita di essere resa pubblica.
Ultimo aggiornamento: giugno 2026 · Il settore cambia in fretta, quindi riverifichiamo le statistiche chiave ogni trimestre.
Cosa misuriamo
WhoCanFindMe misura due cose diverse, ed è importante capirle entrambe:
- Preparazione della pagina (il Controllo AI Gratuito). Un punteggio deterministico ed euristico basato su segnali che estraiamo direttamente dalla tua pagina pubblica: regole del robots.txt, dati strutturati, estraibilità dei contenuti, segnali di aggiornamento e salute tecnica. Viene eseguito in pochi secondi e non costa nulla perché non richiede chiamate API IA dal vivo. Ti dice se la tua pagina è posizionata per essere trovata dai crawler e dai parser IA.
- Visibilità Misurata (piano a pagamento). Query dal vivo con grounding inviate a ChatGPT, Perplexity, Gemini e Claude, per misurare se il tuo brand compare davvero nelle risposte. Ogni motore viene interrogato con lo strumento di ricerca web dal vivo del suo stesso provider attivo, quindi le risposte che valutiamo si basano sul retrieval e non sul richiamo dai dati di addestramento. Vedi la Sezione 4 per i dettagli completi.
La distinzione conta. Un punteggio di Idoneità ti dice quali sono i prerequisiti tecnici per la visibilità nell'IA; la Visibilità Misurata ti dice il risultato effettivo. Pensa all'Idoneità come a "la porta è aperta?" e alla Visibilità Misurata come a "le persone ci stanno davvero passando attraverso?"
I sei segnali di idoneità
Il punteggio di Idoneità aggrega sei categorie di segnali. Ognuna è misurabile in modo indipendente dalla tua pagina pubblica, senza alcuna chiamata API IA.
Accesso dei crawler IA
AltoCosa: Se i principali crawler IA riescono a raggiungere i tuoi contenuti.
Come lo misuriamo: Analizziamo il tuo robots.txt alla ricerca di regole Disallow esplicite rivolte a GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot e Google-Extended. Se un crawler è bloccato, quel motore non può indicizzare la tua pagina: è categoricamente escluso dalla possibilità di essere citato, indipendentemente dalla qualità dei contenuti.
Evidenza: Consenso: l'accesso dei crawler è un cancello binario. L'87% delle citazioni di ChatGPT corrisponde ai primi 10 risultati di Bing (Seer Interactive, 2025), quindi l'indicizzazione su Bing, che richiede l'accesso di OAI-SearchBot, è il singolo segnale più critico per la visibilità su ChatGPT.
Dati strutturati
Alto per Gemini, Medio per gli altriCosa: Markup schema JSON-LD che permette ai motori IA di leggere i tuoi contenuti come fatti strutturati.
Come lo misuriamo: Analizziamo i blocchi JSON-LD della tua pagina alla ricerca dei tipi FAQPage, Article, HowTo, Organization e BreadcrumbList. FAQPage è il tipo a priorità più alta: uno studio del 2026 su 1,508 siti immobiliari ha rilevato lo schema FAQPage presente sul 6.2% dei siti visibili su ChatGPT, contro solo lo 0.8% dei siti non visibili.
Evidenza: Probabile: studio controllato (Schanbacher, 2026, n=1,508). Altri tipi di schema mostrano correlazioni miste o nulle in studi indipendenti: non affidarti troppo allo schema come soluzione miracolosa.
Estraibilità
Massimo per Claude, Alto per gli altriCosa: Quanto facilmente un'IA può individuare e citare il passaggio più rilevante della tua pagina.
Come lo misuriamo: Cerchiamo una struttura answer-first (risposta diretta nelle prime ~200 parole), il numero di titoli, coppie di domande e risposte in stile FAQ, elenchi e tabelle, e la leggibilità Flesch. Le pagine che rispondono subito alla query vengono citate dal primo terzo dei contenuti nel 44% dei casi (ricerca di settore). Una leggibilità nell'intervallo 50-70 Flesch è ottimale per la citazione nell'IA.
Evidenza: Probabile: consenso tra professionisti, più il risultato del paper GEO di Princeton secondo cui i segnali di struttura dei contenuti correlano con l'aumento delle citazioni (n=10,000 query, Perplexity).
Autorevolezza e densità di fatti
Massimo per Perplexity, Alto per GeminiCosa: Quanto bene la pagina segnala la propria affidabilità attraverso contenuti fattuali.
Come lo misuriamo: Contiamo statistiche e percentuali (le affermazioni numeriche aumentano la probabilità di citazione di circa il 41% secondo il paper GEO di Princeton), i link in uscita verso domini autorevoli, le citazioni nel testo, e il conteggio complessivo delle parole (un proxy per la profondità). Questi fungono da proxy per i segnali E-E-A-T, che compaiono nel 96% delle citazioni di Google AI Overview.
Evidenza: Comprovato: paper GEO di Princeton (statistiche: +41%, citazioni: +34%, n=10,000 query). Correlazione E-E-A-T dallo studio Wellows (professionale, 2025). Correlazione delle menzioni del brand con AIO: r=0.664, il predittore noto più forte che possiamo misurare dalla pagina stessa.
Aggiornamento
Massimo per PerplexityCosa: Se la tua pagina comunica ai motori IA quanto sono recenti le sue informazioni.
Come lo misuriamo: Controlliamo datePublished e dateModified nel JSON-LD, il lastmod della sitemap e i tag meta data HTML. Calcoliamo quanti giorni fa risale il segnale più recente. La pipeline di retrieval di Perplexity applica un filtro di recenza aggressivo: le pagine senza segnali di aggiornamento vengono trattate come potenzialmente obsolete.
Evidenza: Consenso: Perplexity documenta esplicitamente l'aggiornamento come fattore di posizionamento. Nessuno studio quantificato isola l'aumento di citazioni dovuto ai soli segnali di aggiornamento, ma il consenso tra professionisti è forte.
Salute tecnica
Alto per ChatGPT, Medio per gli altriCosa: Se la pagina è effettivamente recuperabile e analizzabile da un crawler IA.
Come lo misuriamo: Controlliamo HTTPS, uno stato HTTP 200 valido, il tag meta viewport (proxy per l'adattabilità ai dispositivi mobili), e se la pagina dipende pesantemente dal rendering JavaScript. I crawler IA in genere recuperano l'HTML grezzo senza eseguire JavaScript, quindi le pagine che dipendono molto da JS possono apparire loro quasi vuote.
Evidenza: Consenso su HTTPS e rendering JS. Effetto della velocità della pagina: in uno studio di settore, le pagine con FCP sotto 0.4s ricevono 6.7 citazioni di ChatGPT contro 2.1 per un FCP oltre 1.13s, ma questo non è stato replicato in modo indipendente e va considerato solo indicativo.
Nota su llms.txt
Segnaliamo l'assenza di un file /llms.txt come un problema informativo, non critico. Le prove attuali vanno contro la sua importanza: lo studio di Ahrefs del maggio 2026 su 137,000 domini ha rilevato che il 97% dei file llms.txt non ha ricevuto alcun traffico da bot IA. Includiamo il segnale perché la specifica potrebbe diffondersi in futuro, ma non ne sopravvaluteremo l'effetto attuale.
Punteggio per motore
Ogni motore IA pesa le sei categorie di segnali in modo diverso, perché hanno architetture di retrieval realmente diverse. Invece di presentare un unico "punteggio IA", calcoliamo un punteggio di Idoneità per ciascun motore e poi ne facciamo la media per il numero complessivo in evidenza.
| Segnale | ChatGPT | Perplexity | Gemini | Claude |
|---|---|---|---|---|
| Accesso crawler | 25% | 20% | 20% | 20% |
| Dati strutturati | 15% | 10% | 25% | 20% |
| Estraibilità | 20% | 15% | 15% | 30% |
| Autorevolezza | 15% | 25% | 20% | 15% |
| Aggiornamento | 10% | 25% | 10% | 5% |
| Tecnico | 15% | 5% | 10% | 10% |
ChatGPT pesa molto l'accesso dei crawler perché l'87% delle sue citazioni proviene dai primi 10 risultati di Bing, e Bing richiede l'accesso di OAI-SearchBot. Perplexity pesa soprattutto l'aggiornamento e l'autorevolezza perché la sua pipeline RAG a sei fasi filtra aggressivamente per recenza e densità di fatti. È su Gemini che pesiamo di più i dati strutturati, perché un markup pulito è ciò che rende una pagina facile da interpretare per i sistemi di Google. Google stessa indica che alle sue funzioni IA si applica la SEO di sempre, quindi lo schema è igiene e non una leva specifica per l'IA. Claude mette l'estraibilità al primo posto perché è il motore più selettivo, con il 97.8% delle citazioni provenienti da fonti consolidate e chiaramente strutturate.
Qualsiasi motore bloccato nel robots.txt riceve una penalità del 55% sul punteggio combinato (il punteggio viene moltiplicato per 0.45), a riflettere il fatto che i motori bloccati non possono indicizzare né citare la pagina.
Il punteggio complessivo di Idoneità è la media aritmetica dei quattro punteggi per motore, ciascuno limitato all'intervallo [0, 100].
Visibilità Misurata (query dal vivo con grounding)
I punteggi di Idoneità sono una condizione necessaria ma non sufficiente per la visibilità nell'IA. La Visibilità Misurata va oltre: inviamo query reali ai motori IA effettivi e misuriamo se il tuo brand compare nelle risposte con grounding e citazioni.
Perché query con grounding, e non sondaggi sulla memoria di addestramento
Per la maggior parte dei principali motori IA consumer (ChatGPT Search, Perplexity, Google AI Overviews e Copilot), le risposte si basano su retrieval web dal vivo al momento della query. La memoria di addestramento decide se un'IA "sa" che un brand esiste; il retrieval dal vivo decide se lo cita nelle risposte. La GEO è principalmente un problema di retrieval, ed è per questo che preferiamo le query con grounding ovunque il motore le supporti.
Per tutti e quattro i motori non usiamo il prompting sul modello base (chiedere all'IA cosa "sa" di un brand senza ricerca web). Questo testa la memoria di addestramento congelata, è altamente non deterministico, incline ad allucinazioni per i brand meno conosciuti, e non riflette ciò che gli utenti vedono davvero nei motori consumer con grounding. Claude incluso: lo interroghiamo tramite lo strumento di ricerca web proprietario di Anthropic, la stessa forma di recupero dal vivo che usiamo per gli altri tre. Una differenza va detta con chiarezza: Anthropic lascia al modello la decisione se una data domanda richieda una ricerca, quindi una risposta di Claude ha grounding solo quando ha davvero cercato. Lo registriamo su ogni risposta e calcoliamo le metriche basate sulle citazioni solo dalle risposte con grounding.
Composizione del set di query
Costruiamo un set di query curato che copre tre categorie: query di scoperta (basate sulla categoria, senza nomi di brand), query di confronto (fase di valutazione), e query dirette sul brand. Il mix è di circa 60/30/10: la scoperta ha il peso maggiore perché è lì che si intercetta nuovo pubblico. Il volume di query dipende dal piano: il controllo misurato del piano gratuito esegue 4 prompt su ChatGPT, il Report Completo una tantum ne esegue 25 su 3 motori, Lite ne esegue 15 su 2, e Multi-Site ne esegue 25 su tutti e 4.
Ripetizioni e trattamento statistico
Una singola esecuzione di una singola query è quasi priva di significato. Il non-determinismo degli LLM implica che la stessa query può produrre citazioni diverse tra un'esecuzione e l'altra, anche a temperature=0 (la varianza dovuta alla dimensione del batch a livello di GPU non può essere eliminata). Il paper GEO di Princeton ha rilevato che servono da 60 a 100 ripetizioni per stabilizzare le percentuali di visibilità.
Ogni ripetizione invia di nuovo la query identica. Non variamo né parafrasiamo il prompt tra una ripetizione e l'altra. Il piano gratuito e il Report Completo una tantum eseguono 3 ripetizioni per query per motore. I piani in abbonamento ne eseguono 1 e ricavano il loro segnale di precisione dalla serie storica del monitoraggio settimanale, che campiona le vere fonti di variabilità (movimenti dell'indice, concorrenti, aggiornamenti dei modelli) nell'arco di settimane anziché di secondi. Il compromesso, detto chiaramente: una scorecard in abbonamento mostra stime puntuali senza banda all'interno dello stesso audit. Il tasso di citazione è calcolato come la frazione di esecuzioni in cui il brand è stato citato (brandCited = true). Dove le ripetizioni sono sufficienti, usiamo l'intervallo di Wilson per calcolare un intervallo di confidenza del 95% su questa proporzione. Questo riflette la coerenza da un'esecuzione all'altra sotto il jitter lato provider tra chiamate identiche, non un campione di come la citazione potrebbe variare tra formulazioni diverse della stessa query.
Fedeltà tra API e interfaccia consumer
Per tutti e quattro i motori usiamo l'API programmatica del provider con il suo strumento di ricerca web attivato. Questo è lo standard di settore e l'unico approccio scalabile, ma introduce discrepanze note:
- ChatGPT.com in versione consumer può includere personalizzazione e cronologia di navigazione che le API non replicano.
- L'API di Gemini con grounding di Google Search e Google AI Overviews condividono solo circa il 38.5% dei domini più citati, una discrepanza strutturale che dichiariamo esplicitamente su ogni punteggio Google.
- Perplexity documenta una possibile divergenza tra la propria API e l'interfaccia consumer.
- Claude decide da sé se una domanda richieda una ricerca, quindi una singola risposta di Claude può tornare senza grounding. Registriamo il grounding per ogni risposta ed escludiamo quelle senza grounding dalle metriche di citazione, invece di contarle come uno zero.
Segnaliamo questi limiti in ogni report che include un punteggio di Visibilità Misurata. Crediamo che la trasparenza sui limiti della misurazione valga più di una falsa precisione.
Bande di confidenza e volatilità
I punteggi di visibilità nell'IA sono stime, non fatti. Tre fonti di volatilità influenzano qualsiasi misurazione:
- Non-determinismo degli LLM. Anche a temperature=0, le risposte delle API variano a causa della varianza della dimensione del batch a livello di GPU. Un punteggio puntuale senza ripetizioni può variare del ±30% in una nuova esecuzione. Il nostro motore di Visibilità Misurata ripete più volte ogni query identica e riporta intervalli di confidenza Wilson-score sul tasso di citazione risultante. Questo misura la coerenza da un'esecuzione all'altra sotto il jitter lato provider, non la variazione tra formulazioni diverse della stessa query, così puoi vedere quanto è stabile ogni numero.
- Aggiornamenti di modello e algoritmo. OpenAI, Google e Perplexity aggiornano continuamente i loro modelli, spesso senza annunci pubblici. Un punteggio di sei settimane fa potrebbe non riflettere la realtà attuale. Mostriamo la data di misurazione su ogni punteggio e segnaliamo i punteggi più vecchi di 30 giorni.
- Variazione geografica e di personalizzazione. La stessa query produce risposte diverse a seconda di località, lingue e tipi di account. Le nostre misurazioni vengono eseguite da località standardizzate. I risultati per altre aree geografiche potrebbero differire.
Il punteggio di preparazione della pagina (il Controllo AI Gratuito) è molto più stabile della Visibilità Misurata perché testa segnali deterministici (robots.txt, dati strutturati, contenuto HTML), non output stocastici dell'IA. Una variazione del punteggio di preparazione della pagina riflette un cambiamento reale della tua pagina.
Cosa ti dice e cosa non ti dice questo strumento
Pensiamo che l'onestà intellettuale sui limiti della misurazione sia ciò che distingue uno strumento utile da un generatore di punteggi solo apparentemente convincente. Ecco cosa questo strumento non può dirti, esplicitamente:
Non misuriamo il traffico organico proveniente dall'IA.
La citazione nell'IA e il traffico di rimando dall'IA sono cose diverse. Un brand può essere citato moltissimo e comunque vedere un traffico di rimando piatto, perché le piattaforme IA rispondono sempre più spesso all'interno della propria interfaccia, senza generare click esterni (Digiday, 2025). Il nostro punteggio ti dice qualcosa sulla probabilità di citazione, non sul volume di traffico.
Il tasso di citazione non garantisce un impatto sui ricavi.
Il traffico di rimando dall'IA converte a tassi più alti rispetto al traffico organico tradizionale (più studi rilevano una conversione da 5 a 23 volte superiore rispetto all'organico di Google), ma il volume assoluto resta sotto l'1% del traffico web. Un punteggio di visibilità alto è un segnale di qualità del posizionamento, non una previsione di ricavi.
I punteggi di Idoneità riguardano i prerequisiti, non le garanzie.
Un punteggio di Idoneità di 90/100 significa che la tua pagina ha i giusti segnali tecnici in atto. Non garantisce che verrai citato. I fattori off-site (presenza su Reddit, menzioni del brand in giro per il web, riconoscimento dell'entità su Wikipedia/Wikidata, profili sui siti di recensioni) sono importanti fattori di citazione che non possiamo misurare dalla sola pagina.
Non possiamo misurare ciò che non possiamo scansionare.
Il nostro audit recupera la tua pagina pubblica nello stesso modo in cui lo farebbe un crawler IA. Se i contenuti sono dietro autenticazione, caricati interamente via JavaScript senza rendering lato server, o su sottodomini che non ci sono stati indicati, non possiamo valutarli.
I punteggi non sono confrontabili tra strumenti diversi.
Un punteggio di 65 su WhoCanFindMe non è confrontabile con un 65 su Otterly, Peec, Profound o qualsiasi altro strumento. Ogni strumento usa un set di query diverso, un numero di ripetizioni diverso, una combinazione di motori diversa e una ponderazione diversa. Non esiste uno standard di settore. Il nostro punteggio è calibrato e internamente coerente: può tracciare il tuo miglioramento nel tempo, ma non è un valore assoluto di settore.
Ricerca e fonti
La nostra metodologia si basa su ricerca accademica pubblicata e studi primari di settore. Il campo si evolve in fretta; riverifichiamo le statistiche chiave ogni trimestre. Etichette di forza dell'evidenza: Comprovato = studio controllato o replicato in più studi; Probabile = singolo studio o forte consenso tra professionisti con un meccanismo plausibile; Diceria = ampiamente ripetuto, nessuno studio.
Princeton / IIT Delhi / Georgia Tech GEO paper (Aggarwal et al., KDD 2024)
Aggiunta di statistiche +41%, citazione di fonti +34%, aggiunta di citazioni testuali +28% di aumento delle citazioni. n=10,000 query su un sistema in stile Bing Chat, validato su Perplexity.
ComprovatoGoogle AI Overviews measurement study (arxiv:2605.14021, June 2026)
Tasso di attivazione AIO del 13.7% complessivo, 64.7% per le query in forma di domanda. I domini citati da AIO sono più credibili dell'organico in prima pagina (0.732 contro 0.645). Il 30% delle citazioni AIO non compare nei primi risultati organici.
ComprovatoAhrefs llms.txt study (May 2026, 137,000 domains)
Il 97% dei file llms.txt non ha ricevuto alcun traffico da bot IA. Il 96% delle richieste proveniva da strumenti di audit automatizzati, non da motori IA.
ComprovatoSeer Interactive ChatGPT/Bing correlation study (2025)
L'87% delle citazioni di ChatGPT Search corrisponde ai primi 10 risultati organici di Bing.
ComprovatoWellows E-E-A-T and AIO study
Il 96% delle citazioni AIO proviene da fonti con E-E-A-T elevato. Gli autori nominati hanno una probabilità di citazione 2.3 volte maggiore. Correlazione dell'autorevolezza del dominio con AIO: r=0.18. Correlazione delle menzioni esterne del brand: r=0.664.
ProbabileSE Ranking Reddit study
I domini con oltre 50 menzioni su Reddit mostrano un indice di citazione di 22.5 contro 10.4 per 11-50 menzioni.
ProbabileSchanbacher 2026 FAQ schema study (n=1,508 real estate websites)
Schema FAQPage nel 6.2% dei siti visibili su ChatGPT contro lo 0.8% dei siti non visibili.
ProbabileOtterlyAI llms.txt 90-day experiment
Solo lo 0.1% delle richieste dei crawler IA ha toccato /llms.txt.
ComprovatoSemrush 2026 AI Visibility Index (126M US AI search prompts)
Il 45% dei responsabili marketing non riesce a misurare con precisione la propria visibilità nell'IA. Scalato da 2,500 a 126M prompt tra gennaio e aprile 2026.
ComprovatoSuperprompt.com conversion analysis (12M website visits)
Il traffico di rimando dall'IA converte al 14.2% contro il 2.8% dell'organico di Google.
ProbabileGuarda subito il tuo punteggio
Avvia un Controllo AI Gratuito e ottieni il tuo punteggio di preparazione della pagina su ChatGPT, Gemini, Perplexity e Claude in meno di 30 secondi. Ogni account gratuito ne include uno.
Correlati: Dati di benchmark per categoria · Prezzi · Controllo AI Gratuito