Velikost syntetického vzorku: proč více odpovědí neprokazuje přesnost

· 5 min čtení

Velikost vzorku syntetického dotazníku počítá generované odpovědi. Vyšší počet může stabilizovat odhad toho, co vytváří nastavený model, ale automaticky nezvyšuje přesnost poznání lidí. Počet běhů vybírejte podle úkolu a zkoumané nejistoty; nepřenášejte na generované řádky pravidla výběrové chyby lidských průzkumů.

Rozlišení doplňuje přehled přesnosti syntetických respondentů. Praktickou otázkou je využití rozpočtu simulace bez zaměňování opakování za další důkazy o trhu.

Ptejte se, co se mění při generování další odpovědi

V lidském průzkumu může další účastník dodat odpověď dalšího člověka, v mezích výběrového designu a kvality dat. V syntetickém dotazníku vytváří další řádek generovací proces. Variabilita může pocházet z odlišných vstupů person, náhodného vzorkování modelu, změn promptu či modelu samotného.

Tyto zdroje variability nejsou rovnocenné. Opakování promptu jedné persony zkoumá jinou veličinu než změna profilu publika. Současná změna persony i modelu ztěžuje identifikaci příčiny rozdílu v odpovědi.

Zapište jednotku, kterou chcete zkoumat. Může jí být generovaná odpověď při pevném nastavení, scénář persony nebo celá opakovaná simulace. Nenazývejte každou jednotku nezávislým spotřebitelem jen proto, že má unikátní identifikátor.

Oddělte variabilitu modelu od chyby vůči lidem

Představte si generátor, který při jednom pevném nastavení vybírá variantu A přibližně v 60 % případů. Více výběrů pomůže odhadnout tuto tendenci. Pokud odpovídající podíl mezi relevantními lidmi činí 40 %, stabilní odhad kolem 60 % zůstává pro lidskou otázku chybný.

Příklad je vymyšlený pro vysvětlení rozdílu. Neodhaduje chování SynthFolk ani netvrdí nic o konkrétním modelu. Obecným problémem je, že snížení náhodné variability nemusí odstranit systematický rozdíl mezi generujícím procesem a cílovou populací.

Pro idealizovaný soubor nezávislých binárních výběrů s pravděpodobností 0,60 je standardní chyba průměru sqrt(0,60 × 0,40 / n). Při 100 výběrech činí přibližně 4,9 procentního bodu a při 1 000 výběrech 1,5 bodu. Čísla popisují tento matematický model vzorkování. Nejde o meze chyby pro zákazníky reprezentované AI personami a nezávislost nelze u skutečného syntetického postupu jednoduše předpokládat.

To, že tabulka umožňuje výpočet, neprokazuje soulad jeho předpokladů s výzkumným procesem.

Proč větší syntetický vzorek může stále vynechávat důležité lidi

Zvýšení počtu generovaných odpovědí nepřidá do zadání chybějící nákupní situaci. Pokud každá persona předpokládá snadný přístup k internetu, více takových person neodhalí zkušenost lidí bez něj, pokud proces neobsahuje způsob reprezentace tohoto rozdílu.

Sun a kolegové (2024) zkoumali simulace podmíněné demografickým rozdělením a zjistili variabilitu mezi otázkami a demografickými skupinami. Aplikace pracovala s americkými názorovými daty a použitý preprint uvádí omezení včetně možné tréninkové expozice. Neprokazuje, že větší simulace překoná nevhodnou reprezentaci publika v jiné oblasti.

Před zvýšením počtu prověřte relevanci rozlišení publika pro otázku. Samotná věková kvóta může málo pomoci u otázky řízené dostupností produktu, zkušeností s kategorií nebo omezeními domácnosti. Naplnění zvolených kvót ukazuje jejich dodržení v nastavení; nevaliduje generované odpovědi.

Přidělujte běhy nejistotě, kterou potřebujete prověřit

Výzkumný úkol Užitečný důvod dalších běhů Co další běhy samy neprokážou
Zkouška dotazníku Hledání dalších možných nejasností a cest odpovědí Jak často lidé otázce neporozumějí
Kontrola simulovaného pořadí Pozorování změn pořadí při pevném nastavení Kterou variantu preferují skuteční zákazníci
Zkoumání předpokladů o publiku Srovnání výslovně definovaných scénářů Skutečnou četnost scénářů v populaci
Test citlivosti na formulaci Srovnání plánovaných variant promptu či pořadí Která formulace vytváří nejpravdivější lidský odhad
Posouzení externí validity Opakování předem určeného srovnání s lidskými podklady Zobecnění na netestované trhy či úkoly

Použijte nejmenší úvodní běh, který umožňuje smysluplnou kontrolu materiálu. Rozšiřujte jej, pokud další výstup řeší pojmenovanou nejistotu. Jde o návrh rozdělení zdrojů, nikoli univerzální doporučenou velikost vzorku.

Pokud hlavní otázka zní, zda pořadí odpovídá lidem, další dobře navržené lidské srovnání může být informativnější než výrazný nárůst generovaných řádků. Je-li otázkou nestabilita samotné simulace, opakované běhy modelu jsou přímo relevantní.

Rozpracovaný příklad s pevným rozpočtem simulace

Předpokládejme, že tým má rozpočet na několik průzkumných běhů tří popisů služeb. Může vše utratit za mnoho odpovědí na jediné zadání, nebo vyhradit běhy pro opakování nastavení a věrohodné alternativy publika.

Nejprve zafixuje popisy, otázky a zadání publika. Nastavení opakuje, aby zjistil stabilitu vedoucí varianty. Poté změní jeden předpoklad o publiku, například dostupnost služby během pracovní doby, a zkoumá změny. Jde o rozdíly scénářů, nikoli změřené tržní segmenty.

Pokud se preferovaná varianta obrátí při malé změně formulace, tým zaznamená nestabilitu. Nevybere běh podporující požadované uvedení na trh. Pokud pořadí zůstává stabilní, další otázkou stále je, zda souhlasí s relevantními lidmi.

Příklad je hypotetický. Žádný konkrétní počet běhů nezaručuje užitečný výsledek a dostupné ovládací prvky platformy určují možné srovnání. Smyslem je pojmenovat otázku, na kterou každý další běh odpovídá.

Vedle počtu uvádějte nastavení

Zaznamenejte alespoň zadání publika, podnět, přesné otázky, možnosti odpovědí, datum a dostupné údaje o modelu. Rozlišujte počet profilů person, opakovaných odpovědí a opakovaných celých studií. Zapisujte vyloučení i neúspěšné běhy místo prezentace pouze dokončených odpovědí.

Ong (2024) diskutuje problémy reprodukovatelnosti a potřebu podrobných promptů, postupů a nastavení. Pokud nástroj parametr nezpřístupňuje, označte jej jako nedostupný. Vymyšlená hodnota teploty je horší než výslovné omezení.

Výsledky popisujte jazykem odpovídajícím podkladům: „Pořadí zůstalo ve všech zaznamenaných bězích stejné“ popisuje stabilitu modelu. „Pořadí odpovídalo oddělené lidské studii za uvedených podmínek“ popisuje konkrétní externí srovnání. Ani jedno samo nezajišťuje univerzální spolehlivost.

Před interpretací výstupu určete pravidlo ukončení

Rozhodněte, kdy už další běh nezmění následující výzkumný krok. Zkoušku dotazníku můžete ukončit, když opakované výstupy nepřidávají nový problém hodný ověření. Zdokumentujte však, že jde o redakční pravidlo ukončení, nikoli důkaz úplného pokrytí.

U validačního cvičení stanovte běhy a srovnání předem a zachovejte selhání. Nerozšiřujte vzorek, dokud se neobjeví preferovaný výsledek. Sarstedt a kolegové (2024) zasazují syntetické vzorkování do širšího výzkumného procesu; vyšší počet syntetických odpovědí hranice použití nemaže.

Rozpočet určujte podle nejistoty, nikoli počtu řádků. Použijte šablonu zadání, prohlédněte aktuální ceny a naplánujte kvantitativní postup. Pro tvrzení o lidech přidejte externí validaci potřebnou pro vaše rozhodnutí.

Zdroje a redakční metoda

Pravděpodobnostní výpočet je výslovně idealizovaný matematický příklad. Scénáře služeb a návrhy ukončení jsou původní aplikace, nikoli pozorované výsledky či validovaná doporučení velikosti vzorku pro SynthFolk.