Taille d’échantillon d’une enquête synthétique : plus de réponses ne prouve pas l’exactitude

· 8 min de lecture

La taille d’échantillon d’une enquête synthétique compte des réponses générées. Augmenter ce nombre peut stabiliser l’estimation de ce que produit un modèle configuré, mais n’améliore pas automatiquement l’exactitude concernant les personnes. Choisissez le nombre d’exécutions selon la tâche et l’incertitude examinée, au lieu d’appliquer aux lignes générées une règle de marge d’erreur d’enquête humaine.

Cette distinction complète notre revue de l’exactitude des répondants synthétiques. L’enjeu pratique est de dépenser un budget de simulation sans confondre répétition et apport d’éléments supplémentaires sur le marché.

Demandez-vous ce qui varie lorsque vous générez une autre réponse

Dans une enquête humaine, un participant supplémentaire peut apporter la réponse d’une autre personne, sous réserve du plan d’échantillonnage et de la qualité des données. Dans une enquête synthétique, une ligne supplémentaire provient du processus de génération. Sa variation peut venir de différentes entrées de persona, de l’échantillonnage aléatoire du modèle, de différences de prompt ou de changements du modèle lui-même.

Ces sources de variation ne sont pas équivalentes. Répéter le prompt d’un persona explore une autre quantité que modifier le profil du public. Changer à la fois le persona et le modèle rend plus difficile l’identification de la cause d’une différence de réponse.

Notez l’unité que vous souhaitez étudier. Il peut s’agir d’une réponse générée sous une configuration fixe, d’un scénario de persona ou d’une simulation entière répétée. N’appelez pas chaque unité un consommateur indépendant simplement parce qu’elle possède un identifiant unique.

Séparez la variation du modèle de l’erreur concernant les personnes

Imaginez un générateur qui tend à choisir l’option A environ 60 % du temps dans une configuration fixe. Davantage de tirages peut aider à estimer cette tendance. Si la proportion correspondante parmi les personnes pertinentes est de 40 %, une estimation stable proche de 60 % reste incorrecte pour la question humaine.

Cet exemple est inventé pour expliquer la distinction. Ce n’est ni une estimation du comportement de SynthFolk ni une affirmation concernant un modèle particulier. Le problème général est que réduire la variation aléatoire ne supprime pas nécessairement une différence systématique entre le processus générateur et la population cible.

Pour un ensemble idéalisé de tirages binaires indépendants de probabilité 0,60, l’erreur standard de leur moyenne est sqrt(0.60 × 0.40 / n). Elle vaut environ 4,9 points de pourcentage pour 100 tirages et 1,5 point pour 1 000. Ces chiffres décrivent ce modèle mathématique d’échantillonnage. Ce ne sont pas des marges d’erreur pour des clients représentés par des personas IA, et l’indépendance ne peut pas être simplement présumée dans un processus synthétique réel.

Le fait qu’un tableur permette le calcul ne démontre pas que ses hypothèses décrivent le processus de recherche.

Pourquoi un échantillon synthétique plus grand peut encore omettre des personnes importantes

Augmenter le nombre de réponses générées n’ajoute pas au brief une situation d’achat absente. Si tous les personas supposent un accès facile à Internet, en générer davantage ne révélera pas l’expérience des personnes qui n’en disposent pas, sauf si le processus contient un moyen de représenter cette différence.

Sun et ses collègues (2024) ont examiné des simulations conditionnées par des distributions démographiques et constaté des variations selon les questions et les groupes démographiques. Leur application portait sur des données d’opinion américaines, et la prépublication consultée mentionne des limites, dont une possible exposition durant l’entraînement. Elle n’établit pas qu’une simulation plus grande puisse surmonter une représentation inadaptée du public dans un autre domaine.

Vérifiez la pertinence des distinctions entre publics pour votre question avant d’augmenter le nombre. Un quota fondé uniquement sur l’âge peut peu apporter à une question déterminée par l’accès au produit, l’expérience de la catégorie ou les contraintes du ménage. Remplir les quotas choisis montre que la configuration les a suivis ; cela ne valide pas les réponses générées.

Affectez les exécutions à l’incertitude à examiner

Tâche de recherche Motif utile d’ajouter des exécutions Ce qu’elles ne peuvent pas établir seules
Répéter un questionnaire Rechercher davantage d’ambiguïtés et de parcours de réponse possibles La fréquence des incompréhensions chez les personnes
Vérifier un classement simulé Observer si l’ordre change dans la configuration fixe L’option préférée des vrais clients
Examiner les hypothèses de public Comparer des scénarios explicitement définis Leur fréquence réelle dans la population
Tester la sensibilité à la formulation Comparer des variantes planifiées de prompt ou d’ordre La formulation donnant l’estimation humaine la plus juste
Évaluer la validité externe Répéter une comparaison prédéfinie avec des données humaines La généralisation aux marchés ou tâches non testés

Utilisez la plus petite exécution initiale permettant un examen utile du contenu. Augmentez-la lorsque le résultat supplémentaire répond à une incertitude nommée. C’est une proposition d’allocation de ressources, pas une taille d’échantillon universellement recommandée.

Si votre question principale est de savoir si un classement correspond aux personnes, une autre comparaison humaine bien conçue peut être plus informative qu’une forte augmentation des lignes générées. Si votre question principale porte sur l’instabilité de la simulation elle-même, répéter le modèle est directement pertinent.

Exemple avec un budget de simulation fixe

Supposons qu’une équipe dispose d’un budget pour plusieurs exécutions exploratoires de trois descriptions de service. Elle peut tout dépenser en générant de nombreuses réponses à un seul brief, ou réserver des exécutions à des configurations répétées et à des alternatives plausibles de public.

L’équipe fixe d’abord les descriptions, les questions et le brief du public. Elle répète cette configuration pour voir si l’option en tête reste stable. Elle change ensuite une hypothèse de public, par exemple l’accessibilité du service pendant les heures de travail, et examine les changements. Ce sont des différences de scénarios, pas des segments de marché mesurés.

Si l’option préférée s’inverse après une légère modification de formulation, l’équipe consigne cette instabilité. Elle ne choisit pas l’exécution qui soutient le lancement souhaité. Si le classement reste stable, la question suivante demeure celle de son accord avec les personnes pertinentes.

L’exemple est hypothétique. Aucun nombre précis d’exécutions ne garantit un résultat utile, et les contrôles disponibles sur la plateforme déterminent les comparaisons possibles. L’essentiel est de nommer la question à laquelle répond chaque exécution supplémentaire.

Présentez la configuration avec le nombre

Consignez au minimum le brief du public, le stimulus, les questions exactes, les options de réponse, la date et les informations disponibles sur le modèle. Distinguez le nombre de profils de personas des réponses répétées et des études entières répétées. Consignez les exclusions et les échecs d’exécution au lieu de ne présenter que les réponses achevées.

Ong (2024) discute des problèmes de reproductibilité et du besoin de prompts, procédures et réglages détaillés. Si un outil n’expose pas un paramètre, indiquez qu’il est indisponible. Un réglage de température inventé est pire qu’une limite explicite.

Présentez les résultats dans des termes conformes aux éléments disponibles : « Le classement n’a pas changé entre les exécutions consignées » décrit la stabilité du modèle. « Le classement correspondait à l’étude humaine réservée dans les conditions précisées » décrit une comparaison externe particulière. Aucune de ces affirmations ne suffit à établir une fiabilité universelle.

Fixez une règle d’arrêt avant d’interpréter le résultat

Décidez à quel moment une autre exécution ne modifierait plus l’action de recherche suivante. Vous pourriez arrêter la répétition du questionnaire lorsque les résultats répétés n’ajoutent plus de problème nouveau méritant vérification, tout en précisant qu’il s’agit d’une règle d’arrêt éditoriale, pas d’une preuve de couverture complète.

Pour un exercice de validation, précisez à l’avance les exécutions et comparaisons et conservez les échecs. N’agrandissez pas sans cesse l’échantillon jusqu’à obtenir le résultat préféré. Sarstedt et ses collègues (2024) situent l’échantillonnage de silicium dans un processus de recherche plus large ; un effectif synthétique accru n’efface pas les limites de cet usage.

Budgétez selon l’incertitude, pas selon le nombre de lignes. Utilisez le modèle de brief, consultez les tarifs actuels et planifiez le processus quantitatif. Pour les affirmations concernant des personnes, ajoutez l’étape de validation externe requise par votre décision.

Sources et méthode éditoriale

Le calcul de probabilité est un exemple mathématique explicitement idéalisé. Les scénarios de service et les suggestions d’arrêt sont des applications originales, pas des résultats observés ni des recommandations validées de taille d’échantillon pour SynthFolk.