Steekproefgrootte bij synthetische enquêtes: meer antwoorden bewijzen geen nauwkeurigheid

· 6 min leestijd

De steekproefgrootte van een synthetische enquête telt gegenereerde antwoorden. Meer antwoorden kunnen de schatting van wat een ingesteld model produceert stabiliseren, maar verbeteren niet automatisch de nauwkeurigheid over mensen. Kies het aantal runs volgens taak en onderzochte onzekerheid, niet door een menselijke foutmargeregel op gegenereerde rijen toe te passen.

Dit onderscheid vult ons overzicht van nauwkeurigheid van synthetische respondenten aan. Praktisch gaat het om het besteden van simulatiebudget zonder herhaling te verwarren met extra marktbewijs.

Vraag wat varieert wanneer je nog een antwoord genereert

In een menselijke enquête kan een extra deelnemer het antwoord van nog iemand toevoegen, afhankelijk van steekproefontwerp en datakwaliteit. In een synthetische enquête produceert het generatieproces nog een rij. Variatie kan voortkomen uit andere persona-invoer, willekeurige modelsampling, promptverschillen of modelwijzigingen.

Die variatiebronnen zijn niet gelijkwaardig. De prompt van één persona herhalen onderzoekt iets anders dan het doelgroep-profiel veranderen. Zowel persona als model wijzigen maakt het moeilijker de oorzaak van een antwoordverschil te identificeren.

Leg de te bestuderen eenheid vast. Dat kan een gegenereerd antwoord onder vaste configuratie, een personascenario of een volledig herhaalde simulatie zijn. Noem niet iedere eenheid een onafhankelijke consument omdat ze een unieke identificatie heeft.

Scheid modelvariatie van fouten over mensen

Stel je een generator voor die bij één vaste opzet ongeveer 60% van de keren optie A kiest. Meer trekkingen helpen die neiging schatten. Als het corresponderende aandeel onder relevante mensen 40% is, blijft een stabiele schatting rond 60% fout voor de menselijke vraag.

Dit voorbeeld is verzonnen om het onderscheid uit te leggen. Het is geen schatting van SynthFolk-gedrag of claim over een specifiek model. Het algemene punt is dat minder willekeurige variatie niet noodzakelijk een systematisch verschil tussen generatieproces en doelpopulatie wegneemt.

Voor een geïdealiseerde reeks onafhankelijke binaire trekkingen met kans 0,60 is de standaardfout van het gemiddelde sqrt(0.60 × 0.40 / n). Die is ongeveer 4,9 procentpunt bij 100 trekkingen en 1,5 punt bij 1.000. Deze cijfers beschrijven dat wiskundige steekproefmodel. Het zijn geen foutmarges voor klanten die door AI-persona’s worden vertegenwoordigd, en onafhankelijkheid mag niet zomaar worden aangenomen voor een echte synthetische workflow.

Dat een spreadsheet de berekening toelaat, bewijst niet dat de aannames bij het onderzoeksproces passen.

Waarom een grotere synthetische steekproef belangrijke mensen kan missen

Meer gegenereerde antwoorden voegen geen ontbrekende koopsituatie toe aan de briefing. Als elke persona gemakkelijke internettoegang veronderstelt, onthult meer genereren niet de ervaring van mensen zonder toegang, tenzij het proces dat verschil kan representeren.

Sun en collega’s (2024) onderzochten op demografische verdelingen geconditioneerde simulaties en vonden variatie tussen vragen en demografische groepen. Hun toepassing betrof Amerikaanse opiniedata; de geraadpleegde preprint noemt onder meer mogelijke trainingsblootstelling als beperking. Ze bewijst niet dat een grotere simulatie een ongeschikte doelgroeprepresentatie in een ander domein overwint.

Controleer vóór opschalen of doelgroepverschillen relevant zijn voor je vraag. Een leeftijdsquotum alleen helpt mogelijk weinig bij een vraag bepaald door producttoegang, categorie-ervaring of huishoudelijke beperkingen. Het vullen van quota toont dat de configuratie ze volgde; het valideert de gegenereerde antwoorden niet.

Besteed runs aan de te onderzoeken onzekerheid

Onderzoekstaak Nuttige reden voor extra runs Wat extra runs op zichzelf niet vaststellen
Vragenlijst oefenen Meer mogelijke dubbelzinnigheden en antwoordroutes zoeken Hoe vaak mensen een vraag verkeerd begrijpen
Gesimuleerde rangorde controleren Zien of de volgorde onder vaste opzet verandert Welke optie echte klanten verkiezen
Doelgroepaannames onderzoeken Expliciet gedefinieerde scenario’s vergelijken Werkelijke populatiefrequenties van scenario’s
Formuleringsgevoeligheid testen Geplande prompt- of volgordevarianten vergelijken Welke formulering de waarheidsgetrouwste menselijke schatting geeft
Externe validiteit beoordelen Vooraf bepaalde vergelijking met menselijk bewijs herhalen Generalisatie naar ongeteste markten of taken

Gebruik de kleinste eerste run die zinvolle inspectie van het materiaal toelaat. Vergroot hem wanneer extra uitvoer een benoemde onzekerheid behandelt. Dit is een voorstel voor middelenverdeling, geen universeel aanbevolen steekproefgrootte.

Als de hoofdvraag is of een rangorde met mensen overeenkomt, kan nog een goed ontworpen menselijke vergelijking informatiever zijn dan veel meer gegenereerde rijen. Als je wilt weten of de simulatie zelf instabiel is, zijn herhaalde modelruns rechtstreeks relevant.

Uitgewerkt voorbeeld met een vast simulatiebudget

Stel dat een team budget heeft voor enkele verkennende runs van drie dienstbeschrijvingen. Het kan alles besteden aan veel antwoorden op één briefing of runs reserveren voor herhaalde configuraties en plausibele doelgroepalternatieven.

Het team legt eerst beschrijvingen, vragen en doelgroepbriefing vast. Het herhaalt die opzet om de stabiliteit van de koploper te bekijken. Daarna verandert het één doelgroepaanname, zoals toegang tijdens kantooruren, en onderzoekt wat verandert. Dat zijn scenarioverschillen, geen gemeten marktsegmenten.

Draait de voorkeursoptie om bij een kleine formuleringswijziging, dan registreert het team die instabiliteit. Het selecteert niet de run die de gewenste lancering steunt. Blijft de rangorde stabiel, dan is de volgende vraag nog steeds of ze overeenkomt met relevante mensen.

Het voorbeeld is hypothetisch. Geen bepaald aantal runs garandeert een nuttig resultaat en de beschikbare platforminstellingen bepalen welke vergelijkingen mogelijk zijn. Het punt is de vraag te benoemen die elke extra run beantwoordt.

Rapporteer naast het aantal ook de configuratie

Registreer minimaal doelgroepbriefing, stimulus, exacte vragen, antwoordopties, datum en beschikbare modelinformatie. Onderscheid het aantal personaprofielen van herhaalde antwoorden en herhaalde volledige studies. Registreer uitsluitingen en mislukte runs in plaats van alleen voltooide antwoorden te tonen.

Ong (2024) bespreekt reproduceerbaarheidsproblemen en de noodzaak van gedetailleerde prompts, procedures en instellingen. Label niet-zichtbare parameters als niet beschikbaar. Een verzonnen temperatuurinstelling is slechter dan een expliciete beperking.

Gebruik formuleringen die bij het bewijs passen: ‘De rangorde bleef in de geregistreerde runs gelijk’ beschrijft modelstabiliteit. ‘De rangorde kwam onder de vastgelegde omstandigheden overeen met het achtergehouden menselijke onderzoek’ beschrijft een specifieke externe vergelijking. Geen van beide bewijst op zichzelf universele betrouwbaarheid.

Stel een stopregel vast vóór interpretatie

Bepaal wanneer nog een run de volgende onderzoeksactie niet meer zou veranderen. Je kunt vragenlijstrepetities stoppen wanneer herhaalde uitvoer geen nieuwe controlewaardige kwestie toevoegt, mits je documenteert dat dit een redactionele stopregel is, geen bewijs van volledige dekking.

Specificeer bij validatie runs en vergelijkingen vooraf en bewaar fouten. Vergroot de steekproef niet totdat een gewenst resultaat verschijnt. Sarstedt en collega’s (2024) plaatsen silicon sampling in een breder onderzoeksproces; een groter synthetisch aantal heft die gebruiksgrenzen niet op.

Begroot op onzekerheid, niet op rijen. Gebruik het briefingsjabloon, bekijk de actuele prijzen en plan de kwantitatieve workflow. Voeg voor claims over mensen de externe validatiestap toe die je beslissing vereist.

Bronnen en redactionele methode

De kansberekening is expliciet een geïdealiseerd wiskundig voorbeeld. Dienstscenario’s en stopsuggesties zijn originele toepassingen, geen waargenomen resultaten of gevalideerde steekproefgrootteaanbevelingen voor SynthFolk.