- Blog
- Quante volte bisogna eseguire un prompt per la visibilità AI?
Quante volte bisogna eseguire un prompt per la visibilità AI?

In seguito al recente dibattito di settore sulla necessità di eseguire più volte al giorno gli stessi prompt per misurare in modo affidabile la visibilità AI, abbiamo deciso di verificare direttamente la questione.
Per dieci giorni consecutivi, Meikai ha raccolto 250.000 risposte da un portafoglio fisso di 500 prompt su ChatGPT, Copilot, Gemini, Google AI Mode e Perplexity. Ogni giorno, ciascun prompt è stato eseguito in dieci gruppi di ripetizione indipendenti. Abbiamo quindi confrontato ciò che una strategia di misurazione avrebbe rilevato utilizzando una, due, tre, cinque o tutte e dieci le esecuzioni.
Ripetere più spesso i prompt nella stessa giornata ha migliorato la precisione, senza però modificare in modo significativo il risultato aggregato su dieci giorni per quota di citazioni o visibilità.
È una distinzione importante. Le risposte AI variano, questo è un dato di fatto. La domanda concreta non è se la variazione esista, ma se investire in più ripetizioni nella stessa giornata cambi la decisione supportata dalla misurazione di un ampio portafoglio.
La domanda alla base dell’esperimento
Studi recenti hanno giustamente messo in discussione le rilevazioni isolate della visibilità AI. Una singola risposta non costituisce una misurazione stabile, perché può cambiare tra un’esecuzione e l’altra, in base alla formulazione del prompt e nel tempo. Il paper Don’t Measure Once: Measuring Visibility in AI Search (GEO) sostiene che la visibilità debba essere trattata come una distribuzione, non come un risultato puntuale.
Noi abbiamo formulato una domanda operativa più circoscritta. Se un team misura ogni giorno per dieci giorni un portafoglio di prompt ampio e fisso, deve davvero eseguire ogni prompt dieci volte al giorno per ottenere un risultato affidabile a livello di portafoglio?
È una domanda diversa dal chiedersi se una singola risposta isolata sia attendibile. In questo caso, 1x/giorno indica un’esecuzione per ogni coppia prompt-piattaforma in ciascuno dei dieci giorni, non una risposta osservata una sola volta.
Come è stato condotto lo studio
| Elemento dello studio | Disegno |
|---|---|
| Finestra di osservazione | 13-22 luglio 2026, dieci giorni consecutivi |
| Portafoglio di prompt | 500 prompt fissi in inglese statunitense |
| Piattaforme | ChatGPT, Copilot, Gemini, Google AI Mode e Perplexity |
| Disegno delle ripetizioni | Dieci gruppi indipendenti sull’intero portafoglio, ogni giorno |
| Campione dello studio | 250.000 risposte |
| Strategie confrontate | 1x, 2x, 3x, 5x e 10x al giorno |
| Metriche principali | Quota di citazioni e visibilità media nella top 10 |
Per ogni strategia abbiamo campionato ripetutamente gruppi completi del portafoglio sulle stesse dieci date. Abbiamo confrontato ciascun risultato simulato con la stima ottenuta usando tutti i gruppi in quella finestra. L’errore di campionamento p95 indicato corrisponde al 95° percentile di questa differenza assoluta, espresso in punti percentuali.
In termini semplici: il valore atteso indica il centro della stima. L’errore p95 indica quanto una strategia campionata può normalmente discostarsi da quel centro.
Il risultato: la stessa stima, con un intervallo più ristretto
Le stime aggregate sui dieci giorni sono state del 20,52% per la quota di citazioni e del 15,76% per la visibilità media nella top 10. Aumentare le esecuzioni da una a dieci al giorno non ha modificato in modo significativo questi valori attesi. Ha soltanto ristretto l’intervallo di campionamento attorno a essi.

| Esecuzioni al giorno | Errore p95 sulla quota di citazioni | Errore p95 sulla visibilità nella top 10 |
|---|---|---|
| 1x | 0,17 pp | 0,09 pp |
| 2x | 0,11 pp | 0,07 pp |
| 3x | 0,10 pp | 0,06 pp |
| 5x | 0,08 pp | 0,05 pp |
| 10x | 0,05 pp | 0,04 pp |
Con 1x/giorno, il 95% delle stime simulate della quota di citazioni su dieci giorni si collocava entro 0,17 punti percentuali dalla stima ottenuta con tutti i gruppi. Per la visibilità nella top 10, l’errore equivalente era di 0,09 punti percentuali.
Dieci ripetizioni hanno ridotto questi errori rispettivamente a 0,05 e 0,04 punti percentuali, ma con un costo in termini di risposte dieci volte superiore. Le esecuzioni aggiuntive hanno acquistato precisione, non un diverso risultato aggregato.
L’eccezione a livello di piattaforma
Il risultato aggregato non implica che tutte le piattaforme abbiano mostrato la stessa variabilità. La quota di citazioni di Copilot rappresenta l’eccezione più evidente: l’errore p95 su dieci giorni era di 1,33 punti percentuali con 1x/giorno e di 0,49 punti con 10x/giorno. Tre esecuzioni al giorno sono state la prima strategia testata a portarlo sotto la soglia indicativa di un punto percentuale.

Per questo una regola unica sulle ripetizioni è inefficiente. Un portafoglio ampio può essere stabile mentre una specifica coppia piattaforma-metrica beneficia ancora di esecuzioni aggiuntive. La strategia migliore è ripetere in modo selettivo quando l’incertezza residua può cambiare un confronto o una decisione.
Nota metodologica
Ogni strategia di esecuzione è stata valutata campionando ripetutamente esecuzioni giornaliere complete sulle stesse dieci date e confrontando il risultato con quello ottenuto usando tutte e dieci le esecuzioni. Un controllo di sensibilità basato su tutte le risposte disponibili ha prodotto la stessa conclusione.
I risultati si riferiscono a questo portafoglio di 500 prompt in inglese statunitense e a questa finestra di dieci giorni. Portafogli più piccoli, analisi di singoli prompt e misurazioni intraday possono richiedere più ripetizioni.
Cosa significa per la misurazione della visibilità AI
- Considerate la ripetizione una scelta di precisione, non un requisito predefinito. In questo studio, un’esecuzione quotidiana per prompt e piattaforma ha prodotto lo stesso segnale aggregato su dieci giorni di dieci esecuzioni.
- Ripetete in modo selettivo quando l’incertezza può cambiare una decisione. I confronti a livello di piattaforma e le metriche più variabili, come la quota di citazioni di Copilot, sono quelli che beneficiano maggiormente delle esecuzioni aggiuntive.
- Investite in prompt rappresentativi quando la precisione è sufficiente. Una domanda più ampia e meglio modellata può aggiungere più valore alla misurazione rispetto alla ripetizione dello stesso campione. Il nostro framework di modellazione dei prompt spiega perché.
Partite da un’esecuzione ampia e regolare. Aggiungete ripetizioni quando la precisione supplementare può cambiare la decisione.