Tamaño de muestra sintética: por qué más respuestas no prueban exactitud

· 7 min de lectura

El tamaño de muestra de una encuesta sintética cuenta respuestas generadas. Aumentarlo puede estabilizar una estimación de lo que produce un modelo configurado, pero no mejora automáticamente la exactitud sobre las personas. Elija el número de ejecuciones según la tarea y la incertidumbre examinada, en vez de aplicar a filas generadas una regla de margen de error de encuestas humanas.

La distinción complementa nuestra revisión de la exactitud de participantes sintéticos. La cuestión práctica es cómo gastar un presupuesto de simulación sin confundir repetición con evidencia adicional sobre el mercado.

Pregúntese qué varía al generar otra respuesta

En una encuesta humana, un participante adicional puede aportar la respuesta de otra persona, sujeto al diseño muestral y la calidad de datos. En una encuesta sintética, otra fila la produce el proceso generador. Su variación puede surgir de distintas entradas de persona, muestreo aleatorio del modelo, diferencias de prompt o cambios del propio modelo.

Estas fuentes de variación no son equivalentes. Repetir el prompt de una persona explora una cantidad distinta de cambiar el perfil del público. Cambiar persona y modelo a la vez dificulta identificar qué causó una diferencia en la respuesta.

Escriba qué unidad quiere estudiar. Puede ser una respuesta generada bajo configuración fija, un escenario de persona o una simulación completa repetida. No llame consumidor independiente a cada unidad solo porque tenga un identificador único.

Separe variación del modelo de error sobre las personas

Imagine un generador que tiende a elegir A aproximadamente el 60 % de las veces bajo una configuración fija. Más extracciones pueden ayudar a estimar esa tendencia. Si la proporción correspondiente entre personas pertinentes es 40 %, una estimación estable cercana al 60 % sigue siendo incorrecta para la pregunta humana.

El ejemplo es inventado para explicar la distinción. No estima el comportamiento de SynthFolk ni afirma nada sobre un modelo particular. El problema general es que reducir variación aleatoria no elimina necesariamente una diferencia sistemática entre proceso generador y población objetivo.

Para un conjunto idealizado de extracciones binarias independientes con probabilidad 0,60, el error estándar de su media es sqrt(0.60 × 0.40 / n). Es aproximadamente 4,9 puntos porcentuales con 100 extracciones y 1,5 con 1.000. Las cifras describen ese modelo matemático de muestreo. No son márgenes de error para clientes representados por personas IA, y no puede suponerse sin más independencia en un proceso sintético real.

Que una hoja de cálculo permita el cálculo no establece que sus supuestos describan el proceso de investigación.

Por qué una muestra sintética mayor puede seguir omitiendo personas importantes

Aumentar respuestas generadas no añade al brief una situación de compra ausente. Si todas las personas suponen acceso fácil a internet, generar más no revelará la experiencia de quienes carecen de él salvo que el proceso tenga una forma de representar esa diferencia.

Sun y colaboradores (2024) examinaron simulaciones condicionadas por distribuciones demográficas y encontraron variación entre preguntas y grupos demográficos. Su aplicación usaba datos de opinión estadounidenses, y la prepublicación consultada señala limitaciones como posible exposición durante el entrenamiento. No establece que una simulación mayor supere una representación inadecuada del público en otro ámbito.

Compruebe si las distinciones del público son pertinentes para su pregunta antes de aumentar el número. Una cuota solo por edad puede aportar poco a una cuestión determinada por acceso al producto, experiencia en la categoría o restricciones del hogar. Cumplir las cuotas elegidas muestra que la configuración las siguió; no valida las respuestas generadas.

Asigne ejecuciones a la incertidumbre que necesita examinar

Tarea de investigación Razón útil para más ejecuciones Qué no pueden establecer solas
Ensayar un cuestionario Buscar más ambigüedades y recorridos posibles Frecuencia con que las personas malinterpretarán una pregunta
Comprobar un ranking simulado Observar si cambia el orden bajo configuración fija Qué opción prefieren los clientes reales
Examinar supuestos del público Comparar escenarios explícitamente definidos Frecuencias reales de esos escenarios en la población
Probar sensibilidad a redacción Comparar variantes planificadas de prompt u orden Qué redacción produce la estimación humana más veraz
Evaluar validez externa Repetir una comparación predefinida con evidencia humana Generalización a mercados o tareas no probados

Use la ejecución inicial más pequeña que permita examinar útilmente el material. Auméntela cuando el resultado extra atienda una incertidumbre nombrada. Es una propuesta de asignación de recursos, no un tamaño universal recomendado.

Si la cuestión principal es si un ranking corresponde con las personas, otra comparación humana bien diseñada puede informar más que un gran aumento de filas generadas. Si la cuestión principal es la inestabilidad de la propia simulación, repetir el modelo es directamente pertinente.

Ejemplo con presupuesto fijo de simulación

Suponga un equipo con presupuesto para varias ejecuciones exploratorias de tres descripciones de servicio. Podría gastarlo todo en muchas respuestas a un brief o reservar ejecuciones para configuraciones repetidas y alternativas plausibles de público.

Primero fija descripciones, preguntas y brief del público. Repite la configuración para comprobar estabilidad de la opción líder. Después cambia un supuesto del público, como si el servicio es accesible en horario laboral, y examina qué cambia. Son diferencias de escenarios, no segmentos de mercado medidos.

Si se invierte la opción preferida cuando cambia ligeramente la redacción, el equipo registra esa inestabilidad. No selecciona la ejecución favorable al lanzamiento deseado. Si el ranking sigue estable, la siguiente pregunta continúa siendo si concuerda con personas pertinentes.

El ejemplo es hipotético. Ningún número particular de ejecuciones garantiza un resultado útil, y los controles de la plataforma determinan qué comparaciones son posibles. La idea es nombrar qué pregunta responde cada ejecución adicional.

Informe de la configuración junto al número

Como mínimo registre brief del público, estímulo, preguntas exactas, opciones, fecha e información disponible del modelo. Distinga número de perfiles de persona de respuestas repetidas y estudios completos repetidos. Registre exclusiones y ejecuciones fallidas en vez de presentar solo respuestas completadas.

Ong (2024) aborda problemas de reproducibilidad y la necesidad de detallar prompts, procedimientos y ajustes. Si una herramienta no expone un parámetro, márquelo como no disponible. Un ajuste de temperatura inventado es peor que una limitación explícita.

Informe con lenguaje ajustado a la evidencia: «El ranking no cambió entre las ejecuciones registradas» describe estabilidad del modelo. «El ranking coincidió con el estudio humano reservado bajo las condiciones especificadas» describe una comparación externa particular. Ninguna establece por sí sola fiabilidad universal.

Fije una regla de parada antes de interpretar resultados

Decida cuándo otra ejecución dejaría de cambiar la siguiente acción investigadora. Podría detener el ensayo del cuestionario cuando los resultados repetidos no añadan un nuevo problema que valga la pena comprobar, documentando que es una regla editorial de parada, no prueba de cobertura completa.

En validación, especifique antes ejecuciones y comparaciones y conserve fallos. No amplíe continuamente la muestra hasta que aparezca el resultado preferido. Sarstedt y colaboradores (2024) sitúan el muestreo de silicio dentro de un proceso de investigación mayor; más respuestas sintéticas no borran los límites de ese uso.

Presupueste para la incertidumbre, no para el número de filas. Use la plantilla de brief, consulte precios actuales y planifique el proceso cuantitativo. Para afirmaciones sobre personas, añada el paso de validación externa que exige su decisión.

Fuentes y método editorial

El cálculo de probabilidad es un ejemplo matemático explícitamente idealizado. Los escenarios de servicio y sugerencias de parada son aplicaciones originales, no resultados observados ni recomendaciones validadas de tamaño muestral para SynthFolk.