- Blog
- Combien de fois faut-il exécuter un prompt de visibilité IA ?
Combien de fois faut-il exécuter un prompt de visibilité IA ?

Le secteur débat depuis peu de la question suivante : une mesure fiable de la visibilité IA impose-t-elle d’exécuter les mêmes prompts plusieurs fois par jour ? Nous avons décidé de la tester nous-mêmes.
Pendant dix jours consécutifs, Meikai a collecté 250 000 réponses issues d’un portefeuille fixe de 500 prompts sur ChatGPT, Copilot, Gemini, Google AI Mode et Perplexity. Chaque prompt a été exécuté chaque jour dans dix bras de répétition indépendants. Nous avons ensuite comparé ce qu’une politique de mesure aurait rapporté en utilisant une, deux, trois, cinq ou l’intégralité des dix exécutions.
Répéter les prompts plus souvent au cours d’une même journée améliore la précision, mais ne modifie pas sensiblement le résultat agrégé sur dix jours, qu’il s’agisse de la part de citations ou de la visibilité.
La distinction compte. Les réponses IA varient, c’est un fait. La vraie question n’est pas de savoir si cette variation existe, mais si payer davantage de répétitions le même jour change la décision que soutient la mesure d’un large portefeuille.
La question à l’origine de l’expérience
Des travaux récents ont, à juste titre, remis en cause les vérifications ponctuelles de visibilité IA. Une réponse isolée n’est pas une mesure stable, car les réponses changent d’une exécution à l’autre, d’une formulation de prompt à l’autre et au fil du temps. L’article Don't Measure Once: Measuring Visibility in AI Search (GEO) défend l’idée que la visibilité doit être traitée comme une distribution plutôt que comme un résultat ponctuel.
Nous avons posé une question opérationnelle plus étroite. Lorsqu’une équipe mesure chaque jour, pendant dix jours, un portefeuille de prompts large et fixe, doit-elle exécuter chaque prompt dix fois par jour pour retrouver un résultat fiable à l’échelle du portefeuille ?
Cela diffère de la question de savoir si une réponse isolée est digne de confiance. Ici, 1x/jour désigne une exécution pour chaque couple prompt-plateforme lors de chacun des dix jours, et non une réponse observée une seule fois.
Comment l’étude a été menée
| Élément de l’étude | Dispositif |
|---|---|
| Fenêtre d’observation | 13-22 juillet 2026, dix jours consécutifs |
| Portefeuille de prompts | 500 prompts fixes en anglais américain |
| Plateformes | ChatGPT, Copilot, Gemini, Google AI Mode et Perplexity |
| Dispositif de répétition | Dix bras indépendants couvrant tout le portefeuille, chaque jour |
| Échantillon de l’étude | 250 000 réponses |
| Politiques comparées | 1x, 2x, 3x, 5x et 10x par jour |
| Métriques principales | Part de citations et visibilité top 10 moyenne |
Pour chaque politique, nous avons échantillonné de façon répétée des bras de portefeuille complets sur les dix mêmes dates. Nous avons comparé chaque résultat simulé à l’estimation obtenue avec l’ensemble des bras sur cette fenêtre. L’erreur d’échantillonnage p95 indiquée correspond au 95e centile de cet écart absolu, exprimé en points de pourcentage.
En clair : la valeur attendue indique où se situe le centre de l’estimation. L’erreur p95 indique de combien une politique échantillonnée s’écarte habituellement de ce centre.
Le résultat : la même estimation, dans une fourchette plus serrée
Les estimations agrégées sur dix jours s’établissent à 20,52 % de part de citations et 15,76 % de visibilité top 10 moyenne. Passer d’une à dix exécutions par jour ne déplace pas sensiblement ces valeurs attendues. Cela ne fait que resserrer la fourchette d’échantillonnage autour d’elles.

| Exécutions par jour | Erreur p95 sur la part de citations | Erreur p95 sur la visibilité top 10 |
|---|---|---|
| 1x | 0,17 pt | 0,09 pt |
| 2x | 0,11 pt | 0,07 pt |
| 3x | 0,10 pt | 0,06 pt |
| 5x | 0,08 pt | 0,05 pt |
| 10x | 0,05 pt | 0,04 pt |
À 1x/jour, 95 % des estimations simulées de part de citations sur dix jours se situaient à moins de 0,17 point de pourcentage de l’estimation complète. Pour la visibilité top 10, l’erreur équivalente était de 0,09 point de pourcentage.
Dix répétitions ramènent ces erreurs à 0,05 et 0,04 point de pourcentage respectivement, mais pour un coût en réponses multiplié par dix. L’exécution supplémentaire achète de la précision, pas une réponse agrégée différente.
L’exception au niveau des plateformes
Le résultat agrégé ne signifie pas que toutes les plateformes présentaient la même variabilité. La part de citations de Copilot fait figure d’exception la plus nette : son erreur p95 sur dix jours atteignait 1,33 point de pourcentage à 1x/jour, contre 0,49 point à 10x/jour. Trois exécutions par jour constituent la première politique testée à la faire passer sous le seuil indicatif d’un point de pourcentage.

C’est pourquoi une règle de répétition unique se révèle inefficace. Un portefeuille large peut être stable alors qu’un seul couple plateforme-métrique gagne encore à être répété. La meilleure politique consiste à répéter de façon sélective là où l’incertitude résiduelle pourrait changer une comparaison ou une décision.
Note méthodologique
Chaque politique d’exécution a été évaluée en échantillonnant de façon répétée des exécutions quotidiennes complètes sur les dix mêmes dates, puis en comparant le résultat à celui des dix exécutions. Un contrôle de sensibilité utilisant toutes les réponses disponibles aboutit à la même conclusion.
Ces conclusions valent pour ce portefeuille de 500 prompts en anglais américain et pour cette fenêtre de dix jours. Des portefeuilles plus restreints, des diagnostics sur un seul prompt et des mesures intrajournalières peuvent exiger davantage de répétitions.
Ce que cela implique pour la mesure de la visibilité IA
- Traitez la répétition comme un choix de précision, pas comme une obligation par défaut. Dans cette étude, une exécution quotidienne par prompt et par plateforme produit le même signal agrégé sur dix jours que dix exécutions.
- Répétez de façon sélective là où l’incertitude peut changer une décision. Les comparaisons entre plateformes et les métriques les plus variables, comme la part de citations de Copilot, sont celles qui gagnent le plus à des exécutions supplémentaires.
- Investissez dans des prompts représentatifs dès que la précision est suffisante. Une demande plus large et mieux modélisée apporte souvent plus de valeur à la mesure que la répétition du même échantillon. Notre cadre de modélisation des prompts explique pourquoi.
Commencez par exécuter largement et régulièrement. Ajoutez de la répétition lorsque le surcroît de précision peut changer la décision.