Synthetische gebruikers: wat ze zijn en wat ze wel en niet kunnen
Synthetische gebruikers zijn door AI gegenereerde onderzoeksdeelnemers: persona's op basis van een taalmodel, gedefinieerd door een demografisch en attitudinaal profiel. U stelt hun dezelfde vragen als aan een echt panel. Het zijn geen mensen en ze produceren geen meningen. Ze leveren een snelle, goedkope simulatie van hoe een beschreven populatie zou kunnen antwoorden — bruikbaar voor sommige onderzoeksvragen en ronduit misleidend voor andere. Deze pagina maakt het onderscheid.
Kernpunten
- Synthetische gebruikers zijn gesimuleerde respondenten, die een groot taalmodel op basis van een beschreven populatie genereert. Niets van wat ze zeggen komt van een mens.
- Ze zijn het sterkst bij vergelijkende en richtinggevende vragen, het zwakst bij absolute cijfers, nieuw gedrag en specialistische doelgroepen. Het gepubliceerde reviewbewijs trekt dezelfde lijn: de overeenstemming tussen silicon samples (gesimuleerde steekproeven) en menselijke steekproeven "verschilt aanzienlijk per domein", en de belofte ligt stroomopwaarts, bij pretests en pilotstudies (Sarstedt et al., 2024).
- De kwaliteit wordt vooral bepaald door de verankeringsdata, niet door de omvang van het model: afstemming op demografische verdelingen op groepsniveau kan echte peilingverdelingen dicht benaderen, al varieert de repliceerbaarheid per groep en onderwerp (Sun et al., 2024).
- Ze zijn een aanvulling op echt onderzoek, geen vervanging — de marketingwetenschap komt over AI in het algemeen tot dezelfde conclusie: het versterkt menselijke managers beter dan het ze vervangt (Davenport et al., 2020).
Wat zijn synthetische gebruikers?
Synthetische gebruikers zijn kunstmatige onderzoeksdeelnemers. Ze ontstaan wanneer een groot taalmodel wordt gevraagd te antwoorden als lid van een gedefinieerde populatie. Elke gebruiker heeft een profiel — leeftijd, markt, inkomen, waarden, houdingen, mediagewoonten — en beantwoordt interviewvragen, enquêtevragen of creatieve stimuli zoals iemand met dat profiel dat plausibel zou doen. De literatuur noemt deze constructie een silicon sample (Sarstedt et al., 2024). Het resultaat ziet eruit als onderzoeksdata. Het is een simulatie.
Dat onderscheid staat centraal. Een synthetische gebruiker heeft geen herinnering aan een aankoop — alleen een statistisch model van hoe tekst over zulke mensen doorgaans klinkt. Soms is dat een voldoende bruikbare benadering om op te beslissen, vaak niet. De terminologie wordt in deze categorie losjes gebruikt; het helpt daarom om die eerst scherp af te bakenen.
Synthetische gebruikers, synthetische persona's en synthetische respondenten
Ze worden vaak als synoniemen gebruikt, maar zijn beter te begrijpen als één concept in drie stadia.
| Term | Wat het aanduidt | Waar u het tegenkomt | Typische output |
|---|---|---|---|
| Synthetische persona | Het profiel van een gesimuleerd individu | Opzet van de studie | Een karakterschets: wie deze persoon is, wat hij belangrijk vindt |
| Synthetische gebruiker | De persona in een sessie — antwoordend, reagerend op een stimulus | Kwalitatieve interviews, concepttests, creatiebeoordeling | Transcripten, citaten, thema's |
| Synthetische respondent | De persona in een enquête — één regel in een dataset | Enquêtes onder tientallen tot honderden | Verdelingen, kruistabellen, rangordes |
Een vierde term, digital twin, duidt een gesimuleerd model aan van één specifiek, bestaand mens, gebouwd uit diens eigen data — een andere techniek met veel zwaardere eisen: Toubia et al. (2025) ondervroegen 2.058 mensen over 500 vragen, 2,42 uur per persoon, alleen al om een openbare testomgeving voor twins op individueel niveau te bouwen. Dat is niet de steekproeftrekking op populatieniveau die hier wordt beschreven.
Hoe die profielen worden opgebouwd, leest u in de gids over synthetische persona's. Deze pagina blijft bij wat er gebeurt zodra zo'n profiel begint te antwoorden.
Hoe synthetische gebruikers worden gegenereerd
Vier stappen, waarvan de tweede het grootste kwaliteitsverschil tussen tools bepaalt.
1. Populatiedefinitie. Beschrijf van wie u wilt horen — markt, leeftijdsbereik, inkomen en de kenmerken die relevant zijn voor de vraag: de briefing die u aan een wervingsbureau zou geven.
2. Verankering en steekproeftrekking. Het systeem bouwt profielen die bij die briefing passen. Het model die profielen zelf laten verzinnen levert vloeiende resultaten op, maar kent één concreet gebrek: van de 14 psychologische replicaties die Sarstedt et al. (2024) bespreken, vertoonden er zes een "correct answer effect" — het model antwoordde zeer uniform, met vrijwel geen variatie. Het alternatief is kenmerken uit echte populatiedata te trekken. Sun et al. (2024) laten zien waarom dat doorslaggevend is: een model dat alleen op demografische verdelingen op groepsniveau was afgestemd, produceerde antwoordverdelingen die "opmerkelijk vergelijkbaar" waren met echte Amerikaanse opiniepeilingen. SynthFolk stemt persona's over vijf cultuurregio's af op de European Social Survey en Eurobarometer, zodat bijvoorbeeld institutioneel vertrouwen of prijsgevoeligheid een gemeten verdeling weerspiegelt, en niet de indruk van het model daarvan.
De regel die daaruit volgt is van ons, geen gepubliceerde bevinding, maar volgt rechtstreeks uit het mechanisme: onenigheid is het signaal. Eensgezindheid zegt iets over de uitgangspositie van het model, niet over de spreiding in de markt.
3. Onafhankelijke bevraging. Elke synthetische gebruiker wordt afzonderlijk gegenereerd en bevraagd, en speelt niet samen met anderen een rol binnen één contextvenster. Door LLM's bemiddelde tekst is al homogener dan menselijke tekst — 45% gelijkenis bij samenvattingstaken tegenover 27% bij menselijke samenvattingen (Lin) — zodat een gedeelde context de trek naar het gemiddelde alleen versterkt. Het groepsformaat is ook met echte mensen een zwak instrument: bij de meest recente verpakkingsredesigns van 227 marketeers vonden Caruso et al. (2025) focusgroepen terug onder de methoden die samenhingen met minder succesvolle uitkomsten, terwijl onderzoek dat vaststelde welke ontwerpelementen consumenten al aan het merk koppelen samenhing met succesvollere uitkomsten — een samenhang in één categorie en geen wetmatigheid, maar wel een zwakke basis om het groepsgesprek te simuleren.
4. Aggregatie. Bij kwalitatief werk gaat het om thema's en citaten, bij kwantitatief werk om verdelingen en uitsplitsingen, en bij A/B-stimuli om vergelijkende scores.
Een gevolg van stap twee, als redenering en niet als meting: een kleiner, beter verankerd panel hoort een groter maar niet verankerd panel te verslaan. Meer respondenten uit dezelfde ingeklapte verdeling voegen zekerheid toe, geen informatie.
De kwalitatieve module van SynthFolk zet een doelgroepbeschrijving in gewone taal om in 3–8 verankerde persona's.
Waarvoor synthetisch gebruikersonderzoek wordt ingezet
Synthetisch onderzoek heeft zijn plaats waar breedte, snelheid en vergelijking waardevol zijn, niet waar ontdekking centraal staat. Sarstedt et al. (2024) plaatsen de belofte in "de stroomopwaartse delen van het onderzoeksproces, zoals kwalitatieve pretests en pilotstudies", en beoordelen het gebruik in hoofdstudies veel kritischer.
Concepten voorselecteren. Elf positioneringsstatements, budget om er twee te toetsen. Een synthetisch panel geeft u een rangorde waarover u kunt discussiëren — genoeg om te bepalen wat in echt onderzoek gaat. De meeste teams beslechten die keuze nu met argumenten in een vergaderkamer.
Boodschappen en creatie vergelijken. A/B-vergelijkingen van koppen, waardeproposities of advertentiecreatie passen beter bij de methode: een relatief oordeel is minder gevoelig voor het kalibratieprobleem dan een absoluut oordeel. Ze vervangen niet de echte test, maar helpen de shortlist daarvoor samen te stellen. Een goed opgezette stimulusstudie ziet eruit als Caruso et al. (2026), waarin 484 Amerikaanse en 491 Britse consumenten 48 heringerichte verpakkingen beoordeelden. De mediamodule van SynthFolk biedt die voorselectie als A/B-modus.
Enquêtes en interviews pilotten. Test uw instrument met synthetische respondenten voordat u wervingsbudget uitgeeft. Dubbelzinnige vragen laten synthetische antwoorden net zo uiteenlopen als menselijke, en u vindt zwakke items in één middag.
Eerste doorkijk over meerdere markten. Een twaalftal markten is met echte panels nauwelijks betaalbaar, maar met synthetische panels eenvoudig te onderzoeken. De cijfers per markt zijn niet verdedigbaar. Sun et al. (2024) stellen vast dat de repliceerbaarheid per demografische groep en onderwerp varieert, wat zij toeschrijven aan maatschappelijke vertekeningen in de modellen. Lees het patroon van verschillen daarom als hypothese over waar veldwerk nodig is.
Bezwaren in kaart brengen. Door een divers panel te vragen wat hen van een aankoop zou weerhouden, krijgt u snel een inventaris van bezwaren — niet hoe vaak elk bezwaar voorkomt, maar wel de zekerheid dat geen enkel bezwaar u later verrast.
Stuk voor stuk zijn dit filtertaken stroomopwaarts van een echte beslissing, en niet de beslissing zelf — wat meteen de grens markeert met de bredere categorie AI-marktonderzoek, waarin door AI ondersteunde analyse en door AI gemodereerde interviews met echte mensen worden verward met volledig synthetisch werk.
Het pleidooi tegen synthetische gebruikers
De meestgelezen pagina's over dit onderwerp komen niet van leveranciers. De kritiek van de Nielsen Norman Group op synthetische gebruikers (2024) stelt dat ze niet kunnen vervangen wat u leert door echte mensen te onderzoeken, en dat ze vaak oppervlakkige of overdreven positieve feedback opleveren. Papangelis (2025) formuleert in ACM Interactions het verwante argument van de "synthetic persona fallacy": statistische patroonherkenners als gesimuleerde cognitie verkopen leent het gezag van onderzoek, maar laat de standaarden ervan los. Kwantitatieve UX-professionals zeggen het het scherpst: gesimuleerde antwoorden zijn geen data, omdat er niets is gemeten.
Drie onderdelen van die kritiek kloppen, en geen enkele mate van verankering lost ze op.
- Er wordt niets gemeten. Een synthetische verdeling is gegenereerd, niet waargenomen; die rapporteren met de betrouwbaarheidsintervallen van enquêteonderzoek is een categoriefout. Samenhang kan er ook niet voor doorgaan: Lin documenteert autonome AI-agents die door 99,8% van 6.000 aandachtscontroles kwamen en daarbij psychometrisch deugdelijke data produceerden die niet te onderscheiden waren van zorgvuldig mensenwerk.
- Modellen hebben systematische antwoordvertekeningen. Sun et al. (2024) koppelen het falen van repliceerbaarheid in subgroepen aan maatschappelijke vertekeningen in de modellen. Lin is scherper: de opschoning "kapt precies de staarten van de verdeling af — uitingen van vooroordeel, ambivalentie, extreme opvattingen". Valenzuela et al. (2024) benoemen het mechanisme als parametrisch reductionisme: representeer een mens met een handvol parameters en u verliest alles wat die parameters niet dragen.
- Substitutie is een reëel institutioneel risico. De faalwijze is niet een slechte studie, maar een onderzoeksbudget dat stilletjes wordt vervangen door een abonnement, en een team dat met niemand meer praat.
Het eerlijke antwoord is niet die kritiek te weerleggen, maar er bij het ontwerp rekening mee te houden. Hoe goed verankerde persona's echte respondenten volgen, behandelen we in hoe nauwkeurig synthetische respondenten zijn.
Wanneer u wél echte gebruikers nodig heeft
| Type vraag | Synthetisch inzetten | Echte gebruikers inzetten |
|---|---|---|
| Welke van deze 10 concepten is het toetsen waard? | ✅ Voorselectie | Eindvalidatie |
| Is deze kop duidelijker dan die andere? | ✅ Richtinggevende A/B | Winnaar bevestigen |
| Welk percentage koopt bij € 29? | ❌ Geen kalibratie | ✅ Vereist |
| Hoe voeren mensen deze taak werkelijk uit? | ❌ Geen gedrag | ✅ Usability-onderzoek |
| Wat willen gebruikers in een gloednieuwe categorie? | ❌ Geen verankeringsdata | ✅ Verkennend onderzoek |
| Hoe beoordelen 40 kinderoncologieverpleegkundigen dit? | ❌ Data te dun | ✅ Vereist |
| Houdt deze claim stand bij de toezichthouder? | ❌ Nooit | ✅ Vereist |
Achter die tabel zitten vijf harde grenzen:
Absolute cijfers. Een synthetisch panel dat 63% koopintentie rapporteert, produceert een getal zonder enige kalibratie op de werkelijkheid. Hoe sterk synthetische regels een schatting verschuiven, is niet hypothetisch: in Lins simulaties van de Amerikaanse presidentiële peilingen van 2024 kantelde het toevoegen van 10 tot 52 synthetische respondenten aan steekproeven van 1.600 wie er aan de leiding ging. Lees verdelingen vergelijkenderwijs, nooit als voorspelling.
Werkelijk nieuwe producten. De verankeringsdata dateren van vóór het model, en de trainingsdata zijn niet inzichtelijk — een open probleem dat Ong (2024) signaleert voor onderzoek dat LLM's als plaatsvervangers voor mensen inzet. Waar geen attitudeverdeling bestaat, interpoleert het model met stelligheid; hoe verder de vraag van gevestigd gedrag afstaat, hoe minder betekenisvol het resultaat is.
Ondervertegenwoordigde en specialistische doelgroepen. De verankeringsdata zijn het dunst precies waar nauwkeurigheid het meest telt, en de resulterende fictie is overtuigend — dat is het gevaarlijke deel. Fernandez et al. genereerden 2.106 synthetische persona's uit 13 op de DSM gebaseerde diagnostische profielen en lieten er zeven gevalideerde psychiatrische screeningsinstrumenten op los; louter op basis van korte beschrijvingen produceerde het model klinisch gedifferentieerde scores die meeschaalden met de ernst. Samenhangend antwoorden boven de afkapwaarde is niet langer een indicatie van authentieke deelname. Plausibiliteit is niet uw controle.
Geleefde ervaring en waargenomen gedrag. Synthetische gebruikers genereren wat een beschreven persoon zou kunnen zeggen. Ze kunnen u niet de omweg tonen die iemand zelf bedacht of de aarzeling vlak voor een klik, en twee soorten metingen blijven om dezelfde reden buiten bereik. Gedragsfrequentie komt uit gedragsregistraties: Tanusondjaja et al. (2023) leiden verdelingen van zware kopers af uit ruim 550 miljoen warenhuistransacties, niet uit navraag. Geheugengebonden constructen horen thuis in het geheugennetwerk van een koper in een koopsituatie en niet in tekst over een merk, waardoor merksaillantie een meetprobleem is en geen vraag voor een model (Romaniuk & Sharp, 2004).
Regelgeving, veiligheid of juridische aansprakelijkheid. Als een fout antwoord leidt tot een terugroepactie, een boete of schade, gebruikt u mensen.
Wat de positie oplevert: synthetisch onderzoek is een aanvulling, geen vervanging. Het verandert de economie van vragen die u toch nooit had gefinancierd, en scherpt echt onderzoek aan door eerst de duidelijke zijwegen te schrappen. Een team dat zijn onderzoeksfunctie opheft en een synthetisch panel koopt, heeft een manier gekocht om zijn eigen aannames te bevestigen.
Synthetische gebruikers in de praktijk
Een eerste studie hoort klein, vergelijkend en controleerbaar te zijn.
Opzet. Kwalitatieve module. Beschrijf de doelgroep in gewone taal — bijvoorbeeld mensen van 30–50 jaar die boodschappen doen in twee Europese markten, met een gemengd inkomensniveau. Gebruik drie persona's: het kleinste panel dat het oneens kan zijn. Vanaf 6 credits, gepubliceerd op de prijzenpagina.
Instrument. Vier of vijf open vragen over een besluit dat u al genomen heeft, plus één doorvraag waarvan u het antwoord niet kent.
Wat u terugkrijgt. Een transcript per persona, daarna een synthese: terugkerende thema's, waar de persona's uiteenlopen en de citaten daarachter. Lees eerst waar ze uiteenlopen. Gaven alle drie hetzelfde antwoord in drie registers, dan was uw vraag sturend of uw doelgroepbeschrijving te smal — beide te herstellen in de volgende ronde, en niet pas na zes weken veldwerk.
De controle die telt. Neem een vraag die u vorig jaar met echt onderzoek beantwoordde, draai die synthetisch en kijk of het panel de bevinding reproduceert. Twee dingen maken dat een serieuze test. Uw eigen vergelijking draaien op uw eigen fenomeen levert echte kennis op, en geen minderwaardig surrogaat voor een algemene theorie over nauwkeurigheid (Golder et al., 2023). En de maatstaf is geen exacte overeenstemming: mensen antwoorden twee keer ook niet identiek, en daarom bouwden Toubia et al. (2025) een herhaalde meetronde in hun studie in om een test-hertestbasislijn vast te leggen. De menselijke vergelijkingsbasis is bovendien niet meer schoon — ongeveer 34% van de respondenten op Prolific en tot 73% op MTurk zegt AI te gebruiken bij open vragen (Lin).
Teams die er blijvend waarde uit halen, komen uit op één cyclus: synthetisch divergeren, het instrument synthetisch onder druk zetten, valideren met mensen op wat overblijft, en dan uw kalibratie controleren aan de hand van wat de echte studie opleverde. Stap vier scheidt serieus gebruik van een rationalisatiemachine, en niemand kan die stap voor u zetten.
Veelgestelde vragen
Zijn synthetische gebruikers echte mensen?
Nee. Het zijn simulaties van een taalmodel, afgestemd op statistieken op populatieniveau: geen individu wordt gerepresenteerd, geen persoonsgegevens worden verwerkt, geen antwoord komt van een mens. Elke tool die anders suggereert, geeft een verkeerde voorstelling van de methode.
Zijn synthetische gebruikers nauwkeurig?
Er is geen enkel nauwkeurigheidscijfer, en de reviewliteratuur is expliciet over waarom: de overeenstemming met menselijke steekproeven verschilt aanzienlijk per domein (Sarstedt et al., 2024), en de repliceerbaarheid varieert per groep en onderwerp, zelfs waar geaggregeerde verdelingen dichtbij komen (Sun et al., 2024). Resultaten bewegen ook mee met promptformulering en modelversie — de onopgeloste "hyperparameters" van dit werk (Ong, 2024). Behandel de output als richtinggevend en ongekalibreerd; het bewijs bespreken we in onze gids over nauwkeurigheid.
Wat kosten synthetische gebruikers?
SynthFolk rekent in credits en publiceert die openlijk: een kwalitatieve studie met drie persona's begint bij 6 credits; grotere panels en kwantitatieve steekproeven van 50–250 respondenten kosten naar verhouding meer. Vergelijk dat met een geworven panelstudie voor dezelfde vraag: doorgaans weken doorlooptijd en een bedrag van vier cijfers.
Vervangen synthetische gebruikers usability-onderzoek?
Nee — dat is de duidelijkste grens in de methode. Usability-onderzoek meet wat mensen onder observatie doen; synthetische gebruikers genereren wat iemand zou kunnen zeggen. Er bestaat geen vervanging voor het kijken naar iemand die een knop niet kan vinden.
Welke talen en markten worden ondersteund?
SynthFolk draait in 12 interfacetalen met persona's die verankerd zijn in vijf Europese cultuurregio's, en dat maakt een eerste doorkijk over meerdere markten praktisch haalbaar. De dekking volgt de onderliggende enquêtedata — waar die dun zijn, behandelt u de output als dunner.
Draai er zelf een. Een studie met drie persona's begint bij 6 credits, en nieuwe accounts starten met gratis credits — genoeg om de methode te toetsen op een vraag waarvan u het antwoord al kent. Open het dashboard: of het panel reproduceert wat u al weet, is de enige benchmark die telt.
Literatuur
- Caruso, W., Romaniuk, J., Page, B., Anesbury, Z. W., & Williams, J. (2025). The role of market research in pack redesign performance. International Journal of Market Research, 67(1), 17–32. https://doi.org/10.1177/14707853241296656
- Caruso, W., Romaniuk, J., Page, B., Anesbury, Z. W., Saeed, R., & Williams, J. (2026). The packaging redesign modernisation dilemma: The relationship with familiarity, likeability, and its effect on purchase intent. Journal of Retailing and Consumer Services, 92, 104800. https://doi.org/10.1016/j.jretconser.2026.104800
- Davenport, T., Guha, A., Grewal, D., & Bressgott, T. (2020). How artificial intelligence will change the future of marketing. Journal of the Academy of Marketing Science, 48, 24–42. https://doi.org/10.1007/s11747-019-00696-0
- Eurobarometer. Public opinion surveys of the European Commission. https://europa.eu/eurobarometer/
- European Social Survey. https://www.europeansocialsurvey.org/
- Fernandez, K., Berner, L. A., & Shevlin, B. R. K. The threat of synthetic respondents extends to clinical mental health screening. Submitted manuscript, University of California, Los Angeles, and Icahn School of Medicine at Mount Sinai (undated).
- Golder, P. N., Dekimpe, M. G., An, J. T., van Heerde, H. J., Kim, D. S. U., & Alba, J. W. (2023). Learning from data: An empirics-first approach to relevant knowledge generation. Journal of Marketing, 87(3), 319–336. https://doi.org/10.1177/00222429221129200
- Lin, Z. Synthetic respondents and the illusion of human data. Preprint, Department of Psychology, Yonsei University (undated).
- Nielsen Norman Group. (2024, June 21). Synthetic users: If, when, and how to use AI-generated "research". https://www.nngroup.com/articles/synthetic-users/
- Ong, D. C. (2024). GPT-ology, computational models, silicon sampling: How should we think about LLMs in cognitive science? arXiv:2406.09464. https://arxiv.org/abs/2406.09464
- Papangelis, K. (2025, December 17). The synthetic persona fallacy: How AI-generated research undermines UX research. ACM Interactions (blog). https://interactions.acm.org/blog/view/the-synthetic-persona-fallacy-how-ai-generated-research-undermines-ux-research
- Romaniuk, J., & Sharp, B. (2004). Conceptualizing and measuring brand salience. Marketing Theory, 4(4), 327–342. https://doi.org/10.1177/1470593104047643
- Sarstedt, M., Adler, S. J., Rau, L., & Schmitt, B. (2024). Using large language models to generate silicon samples in consumer and marketing research: Challenges, opportunities, and guidelines. Psychology & Marketing, 41, 1254–1270. https://doi.org/10.1002/mar.21982
- Sun, S., Lee, E., Nan, D., Zhao, X., Lee, W., Jansen, B. J., & Kim, J. H. (2024). Random silicon sampling: Simulating human sub-population opinion using a large language model based on group-level demographic information. arXiv:2402.18144. https://arxiv.org/abs/2402.18144
- Tanusondjaja, A., Romaniuk, J., Nenycz-Thiel, M., Sakashita, M., & Viswanathan, V. (2023). Examining Pareto Law across department store shoppers. International Journal of Market Research. https://doi.org/10.1177/14707853221145851
- Toubia, O., Gui, G. Z., Peng, T., Merlau, D. J., Li, A., & Chen, H. (2025). Twin-2K-500: A dataset for building digital twins of over 2,000 people based on their answers to over 500 questions. arXiv:2505.17479. https://arxiv.org/abs/2505.17479
- Valenzuela, A., Puntoni, S., Hoffman, D., Castelo, N., De Freitas, J., Dietvorst, B., Hildebrand, C., Huh, Y. E., Meyer, R., Sweeney, M. E., Talaifar, S., Tomaino, G., & Wertenbroch, K. (2024). How artificial intelligence constrains the human experience. Journal of the Association for Consumer Research, 9(3). https://doi.org/10.1086/730709