Wielkość próby syntetycznej: dlaczego więcej odpowiedzi nie dowodzi dokładności

· 5 min czytania

Wielkość próby ankiety syntetycznej liczy wygenerowane odpowiedzi. Zwiększenie tej liczby może stabilizować oszacowanie tego, co tworzy skonfigurowany model, lecz nie poprawia automatycznie dokładności dotyczącej ludzi. Dobieraj liczbę przebiegów według zadania i badanej niepewności, zamiast stosować regułę marginesu błędu ankiet ludzkich do wygenerowanych wierszy.

To rozróżnienie uzupełnia przegląd dokładności respondentów syntetycznych. Praktyczny problem dotyczy wydawania budżetu symulacji bez mylenia powtórzeń z dodatkowymi dowodami o rynku.

Zapytaj, co zmienia się przy generowaniu kolejnej odpowiedzi

W ankiecie z ludźmi dodatkowy uczestnik może wnieść odpowiedź kolejnej osoby, zależnie od doboru próby i jakości danych. W ankiecie syntetycznej kolejny wiersz wytwarza proces generowania. Zmienność może wynikać z innych danych person, losowego próbkowania modelu, różnic promptów lub zmian samego modelu.

Te źródła zmienności nie są równoważne. Powtarzanie promptu jednej persony bada inną wielkość niż zmiana profilu odbiorców. Jednoczesna zmiana persony i modelu utrudnia wskazanie przyczyny różnicy odpowiedzi.

Zapisz jednostkę, którą zamierzasz badać. Może to być wygenerowana odpowiedź przy stałej konfiguracji, scenariusz persony lub całe powtórzenie symulacji. Nie nazywaj każdej jednostki niezależnym konsumentem tylko dlatego, że ma unikalny identyfikator.

Oddziel zmienność modelu od błędu dotyczącego ludzi

Wyobraźmy sobie generator wybierający opcję A w około 60% przypadków przy jednej stałej konfiguracji. Więcej losowań pomaga oszacować tę tendencję. Jeśli odpowiedni odsetek wśród właściwych ludzi wynosi 40%, stabilne oszacowanie blisko 60% pozostaje błędne dla pytania o ludzi.

Przykład jest wymyślony, aby wyjaśnić rozróżnienie. Nie jest oszacowaniem zachowania SynthFolk ani twierdzeniem o konkretnym modelu. Ogólny problem polega na tym, że zmniejszanie losowej zmienności niekoniecznie usuwa systematyczną różnicę między procesem generowania a populacją docelową.

Dla wyidealizowanego zbioru niezależnych losowań binarnych z prawdopodobieństwem 0,60 błąd standardowy średniej wynosi sqrt(0.60 × 0.40 / n). To około 4,9 punktu procentowego przy 100 losowaniach i 1,5 punktu przy 1000. Liczby opisują ten matematyczny model próbkowania. Nie są marginesami błędu klientów reprezentowanych przez persony AI, a niezależności nie można po prostu zakładać w rzeczywistym procesie syntetycznym.

To, że arkusz pozwala wykonać obliczenie, nie dowodzi, że jego założenia opisują proces badawczy.

Dlaczego większa próba syntetyczna nadal może pomijać ważne osoby

Zwiększanie liczby wygenerowanych odpowiedzi nie dodaje do briefu brakującej sytuacji zakupowej. Jeśli każda persona zakłada łatwy dostęp do internetu, generowanie kolejnych nie ujawni doświadczenia osób bez niego, chyba że proces zawiera sposób reprezentowania tej różnicy.

Sun i współautorzy (2024) badali symulacje warunkowane rozkładami demograficznymi i znaleźli różnice między pytaniami i grupami demograficznymi. Zastosowanie obejmowało amerykańskie dane opinii, a konsultowany preprint wskazuje ograniczenia, w tym możliwy kontakt podczas treningu. Nie dowodzi, że większa symulacja przezwycięży nieodpowiednią reprezentację odbiorców w innej dziedzinie.

Przed zwiększeniem liczby sprawdź istotność rozróżnień odbiorców dla pytania. Sama kwota wieku może niewiele wnosić do pytania zależnego od dostępu do produktu, doświadczeń w kategorii lub ograniczeń gospodarstwa domowego. Wypełnienie kwot pokazuje, że konfiguracja ich przestrzegała; nie waliduje wygenerowanych odpowiedzi.

Przydzielaj przebiegi do niepewności wymagającej sprawdzenia

Zadanie badawcze Przydatny powód dodatkowych przebiegów Czego same dodatkowe przebiegi nie ustalą
Próba kwestionariusza Poszukiwanie kolejnych możliwych niejasności i ścieżek odpowiedzi Jak często ludzie źle zrozumieją pytanie
Sprawdzenie symulowanego rankingu Obserwacja zmian kolejności przy stałej konfiguracji Którą opcję preferują rzeczywiści klienci
Badanie założeń o odbiorcach Porównanie jawnie określonych scenariuszy Rzeczywiste częstości scenariuszy w populacji
Testowanie wrażliwości na sformułowania Porównanie planowanych wariantów promptu lub kolejności Które sformułowanie daje najprawdziwsze oszacowanie ludzkie
Ocena trafności zewnętrznej Powtórzenie zdefiniowanego porównania z dowodami ludzkimi Uogólnienie na niebadane rynki lub zadania

Użyj najmniejszego początkowego przebiegu, który pozwala sensownie przejrzeć materiał. Zwiększaj go, gdy dodatkowy wynik odpowiada na nazwaną niepewność. To propozycja alokacji zasobów, a nie uniwersalna zalecana wielkość próby.

Jeśli głównym pytaniem jest zgodność rankingu z ludźmi, kolejne dobrze zaprojektowane porównanie ludzkie może być bardziej informacyjne niż duży przyrost wygenerowanych wierszy. Jeśli głównym pytaniem jest niestabilność samej symulacji, powtórzenia modelu są bezpośrednio istotne.

Przykład ze stałym budżetem symulacji

Załóżmy, że zespół ma budżet na kilka eksploracyjnych przebiegów trzech opisów usług. Może wydać wszystko na wiele odpowiedzi do jednego briefu lub zarezerwować przebiegi na powtarzanie konfiguracji i wiarygodne alternatywy odbiorców.

Zespół najpierw ustala opisy, pytania i brief odbiorców. Powtarza konfigurację, aby sprawdzić stabilność prowadzącej opcji. Następnie zmienia jedno założenie o odbiorcach, np. dostępność usługi w godzinach pracy, i bada zmiany. Są to różnice scenariuszy, a nie zmierzone segmenty rynku.

Jeśli preferowana opcja odwraca się po drobnej zmianie sformułowania, zespół zapisuje niestabilność. Nie wybiera przebiegu wspierającego pożądane wprowadzenie produktu. Jeśli ranking jest stabilny, kolejnym pytaniem nadal pozostaje zgodność z właściwymi ludźmi.

Przykład jest hipotetyczny. Żadna konkretna liczba przebiegów nie gwarantuje użytecznego wyniku, a dostępne funkcje platformy określają możliwe porównania. Chodzi o nazwanie pytania, na które odpowiada każdy dodatkowy przebieg.

Raportuj konfigurację obok liczby

Zapisz co najmniej brief odbiorców, bodziec, dokładne pytania, opcje odpowiedzi, datę i dostępne informacje o modelu. Rozróżniaj liczbę profili person, powtarzane odpowiedzi i powtarzane całe badania. Rejestruj wykluczenia i nieudane przebiegi zamiast pokazywać wyłącznie ukończone odpowiedzi.

Ong (2024) omawia problemy odtwarzalności i potrzebę szczegółowych promptów, procedur i ustawień. Jeśli narzędzie nie udostępnia parametru, oznacz go jako niedostępny. Wymyślona wartość temperatury jest gorsza niż jawne ograniczenie.

Raportuj językiem odpowiadającym dowodom: „Ranking nie zmienił się w zapisanych przebiegach” opisuje stabilność modelu. „Ranking odpowiadał odłożonemu badaniu z ludźmi w określonych warunkach” opisuje konkretne porównanie zewnętrzne. Żadne samo w sobie nie ustanawia uniwersalnej wiarygodności.

Ustal regułę zakończenia przed interpretacją wyników

Zdecyduj, kiedy kolejny przebieg nie zmieni już następnego działania badawczego. Możesz zakończyć próbę kwestionariusza, gdy powtórzenia nie dodają nowej kwestii wartej sprawdzenia, dokumentując, że to redakcyjna reguła zakończenia, a nie dowód pełnego pokrycia.

Dla walidacji określ przebiegi i porównania wcześniej oraz zachowaj niepowodzenia. Nie powiększaj próby, aż pojawi się preferowany wynik. Sarstedt i współautorzy (2024) umieszczają próby generowane przez modele w szerszym procesie badawczym; większa liczba syntetyczna nie usuwa granic zastosowania.

Planuj budżet na niepewność, nie na liczbę wierszy. Użyj szablonu briefu, sprawdź aktualny cennik i zaplanuj proces ilościowy. Dla twierdzeń o ludziach dodaj etap walidacji zewnętrznej wymagany przez decyzję.

Źródła i metoda redakcyjna

Obliczenie prawdopodobieństwa jest jawnie wyidealizowanym przykładem matematycznym. Scenariusze usług i sugestie zakończenia są autorskimi zastosowaniami, a nie obserwowanymi wynikami ani zwalidowanymi zaleceniami wielkości próby dla SynthFolk.