El sorprendente límite entre psicología y cultura
En junio de 2026 hicimos un back-test de respondentes sintéticos contra poblaciones de la World Values Survey en EE. UU. y Reino Unido. La varianza salió más estrecha que en las poblaciones reales, y un hallazgo redibujó cómo separamos psicología y cultura.
Lo que un back-test contra datos de población publicados nos enseñó sobre los respondentes sintéticos.
Durante el último año hemos estado construyendo respondentes sintéticos.
No respuestas sintéticas de encuesta. No resúmenes de IA. No personas.
Personas sintéticas — con distintas motivaciones, distintas prioridades, distintas formas de interpretar el mundo y distintas estructuras psicográficas.
Y la pregunta que más escuchamos es exactamente la correcta:
¿Cómo sabéis que no son solo promedios producidos por un modelo de lenguaje?
Es una objeción justa. De hecho, es probablemente el reto más importante al que se enfrenta hoy la investigación sintética.
Así que decidimos comprobarlo. No con una demo. No con un caso de cliente. No con un benchmark de marketing. Con datos públicos.
Y los resultados nos enseñaron algo que no esperábamos.
La prueba
Usamos la World Values Survey (WVS), Ola 7 — uno de los datasets más respetados de las ciencias sociales, como referencia.
Generamos poblaciones sintéticas para Estados Unidos y Reino Unido, usando cuotas demográficas alineadas con la estructura poblacional de cada país. Luego comparamos sus respuestas contra las distribuciones reales de la WVS en cinco actitudes no sensibles:
- Confianza interpersonal
- Satisfacción con la vida
- Felicidad
- Actitudes hacia la competencia
- Importancia del trabajo
Nuestro objetivo no era simplemente reproducir promedios. Un modelo puede acertar un promedio por accidente. Lo que importa es si reproduce la variación.
Las poblaciones humanas no están de acuerdo entre sí. Contienen minorías, contradicciones y extremos. Si las poblaciones sintéticas colapsan hacia el centro, pueden parecer realistas mientras pierden lo que de verdad hace diferentes a las personas.
Así que evaluamos cuatro cosas: convergencia distribucional, alineamiento de medias, preservación de la varianza y las diferencias entre los dos países.
Los números
Estos son los resultados reales. Sin selección interesada. Sin reporte selectivo. Sin fallos ocultos.
Estados Unidos
| Ítem | Sintético | Humano | Convergencia | Ratio de varianza |
|---|---|---|---|---|
| Confianza | 1,72 | 1,63 | 90,5% | 0,87 |
| Importancia del trabajo | 1,57 | 1,88 | 83,2% | 0,37 |
| Felicidad | 2,22 | 1,84 | 71,6% | 0,48 |
| Competencia | 4,07 | 3,31 | 50,0% | 0,15 |
| Satisfacción con la vida | 7,02 | 7,28 | 38,1% | 0,06 |
Reino Unido
| Ítem | Sintético | Humano | Convergencia | Ratio de varianza |
|---|---|---|---|---|
| Confianza | 1,72 | 1,54 | 81,6% | 0,80 |
| Felicidad | 2,18 | 1,78 | 67,4% | 0,38 |
| Competencia | 4,25 | 3,78 | 62,9% | 0,23 |
| Importancia del trabajo | 1,85 | 2,05 | 59,1% | 0,18 |
| Satisfacción con la vida | 6,95 | 7,34 | 47,1% | 0,13 |
Cómo leer esto
La convergencia es el solapamiento entre la distribución de respuestas sintéticas y humanas, reportada como 1 menos la distancia de variación total (más alto es mejor). El ratio de varianza es la varianza sintética dividida por la varianza humana (1,0 = misma dispersión que los humanos reales; por debajo de 1,0 = más estrecha).
La dirección de las escalas varía por ítem: en confianza y felicidad, más bajo significa más confiado o más feliz; en satisfacción con la vida (0–10), más alto significa más satisfecho; competencia va de 1 (bueno) a 10 (dañino); importancia del trabajo va de 1 (muy importante) a 4 (nada importante).
La convergencia distribucional media fue de aproximadamente el 65%.
Los dos hallazgos de abajo resultaron ser lo más útil del ejercicio.
Hallazgo 1: La varianza colapsó
Mira los ratios de varianza.
La confianza interpersonal preservó la varianza razonablemente bien (0,87 y 0,80). Pero la mayoría de las demás variables no. La satisfacción con la vida es el caso más claro: en Estados Unidos, el ratio de varianza fue de solo 0,06. Los humanos reales se reparten por toda la escala; los respondentes sintéticos se agruparon estrechamente en torno al centro.
Las poblaciones sintéticas estaban menos en desacuerdo entre sí de lo que lo están los humanos reales.
Esta es una tendencia conocida de los modelos de lenguaje — regresan hacia la respuesta más probable, produciendo distribuciones más estrechas, menos extremos, menos outliers, menos desacuerdo. Conocer el mecanismo no excusa el resultado.
No invalida el benchmark. Pero revela un reto técnico genuino: si los respondentes sintéticos van a convertirse en una metodología de investigación seria, preservar la varianza humana puede ser uno de los problemas más importantes a resolver. Es uno en el que ya estamos trabajando directamente.
Hallazgo 2: Cerca en el nivel de confianza, planos en la diferencia
El segundo hallazgo nos sorprendió más.
La confianza interpersonal es uno de los ejemplos clásicos de variación intercultural: en los datos de la WVS, Reino Unido reporta más confianza que Estados Unidos, y la brecha está bien documentada.
Dentro de cada país, la distribución sintética de confianza se solapó con la real en un 90,5% (EE. UU.) y un 81,6% (Reino Unido). La brecha entre los dos países, en cambio, no apareció. Las poblaciones sintéticas de EE. UU. y Reino Unido devolvieron puntuaciones de confianza casi idénticas (1,72 en ambas). Las poblaciones reales no.
A primera vista, parece un fallo. Creemos que revela algo más interesante.
El límite entre psicología y cultura
El benchmark forzó una pregunta más fundamental: ¿qué está modelando realmente nuestro sistema?
Las diferencias entre sociedades enteras no surgieron por sí solas de los perfiles individuales.
Nuestra arquitectura está diseñada para crear variación entre individuos — distintas motivaciones, prioridades, estructuras psicográficas y formas de dar sentido al mundo. Lo que modela con menos fuerza son las fuerzas institucionales e históricas que dan forma a sociedades enteras.
La confianza no es una variable puramente psicológica. También es cultural e institucional — emerge de normas sociales, instituciones cívicas, experiencia histórica, expectativas colectivas, narrativas compartidas. Esas fuerzas existen por encima del nivel individual, y nuestro benchmark sugiere que deberían tratarse como una capa de modelado separada, en lugar de asumir que emergen automáticamente de la psicología individual.
Esto no es algo que descubriéramos por accidente. Es una condición de frontera. Y entender las condiciones de frontera es parte de tomarse en serio una metodología.
Por qué esto importa más de lo que parece
Si nuestro objetivo hubiera sido demostrar un realismo poblacional perfecto, este benchmark sería decepcionante. Afortunadamente, eso no era lo más importante que aprendimos.
La mayoría de las decisiones comerciales no se toman entre países. Se toman entre tipos de cliente.
Distintas motivaciones, ansiedades, prioridades y estilos de decisión. Un equipo de producto rara vez necesita la puntuación media de confianza de una nación. Necesita entender por qué un segmento abraza una propuesta mientras otro la rechaza.
Esa es una pregunta sobre segmentos, no sobre promedios nacionales, y es la pregunta alrededor de la que se construye el pre-research cualitativo: por qué cada respondente contesta como contesta, desde su propia situación.
Esa es la prueba que hicimos a continuación: un estudio pre-registrado de 2.600 respondentes sintéticos en ocho mercados, sellado antes de cualquier dato y publicado entero, incluida la predicción que el dato refutó.
El estudio pre-registrado, sus controles y su resultado.
Lee el estudio pre-registrado →Lo que este benchmark no demuestra
Este benchmark no demuestra validez predictiva. No prueba que los respondentes sintéticos puedan predecir intención de compra, disposición a pagar, elección de marca o adopción de producto. Tampoco demuestra utilidad comercial. Esas preguntas requieren estudios prospectivos, comparaciones paralelas humano-sintético y resultados de decisión en el mundo real.
Aborda una pregunta más básica: ¿cuánto se acercan las distribuciones sintéticas a las reales, ítem a ítem? Las tablas de arriba son la respuesta para esta ejecución, con las salvedades ya mencionadas.
Un marco de validación mejor
Este proyecto también cambió cómo pensamos sobre la validación. El realismo poblacional no debería ser la línea de meta. Debería ser el punto de partida. Una jerarquía más útil:
- Nivel 1 — Realismo poblacional. ¿Se parecen las poblaciones sintéticas a las reales?
- Nivel 2 — Realismo psicográfico. ¿Divergen coherentemente los distintos perfiles psicológicos?
- Nivel 3 — Reproducibilidad. ¿Producen resultados estables las ejecuciones repetidas?
- Nivel 4 — Convergencia humana. ¿Se alinean los hallazgos con investigación humana paralela?
- Nivel 5 — Utilidad predictiva. ¿Mejoran las decisiones los insights resultantes?
Solo los dos últimos establecen valor comercial. Pero los tres primeros establecen credibilidad — y la credibilidad es el recurso que la investigación sintética más necesita ahora mismo.
Una nota sobre transparencia
La World Values Survey Ola 7 es anterior a los modelos frontera actuales y puede estar parcialmente representada dentro de sus corpus de entrenamiento. Por esa razón no tratamos esto como prueba de validez predictiva — un modelo puede puntuar bien por memoria en lugar de por fidelidad. Lo tratamos como un back-test del que aprender, no como validación.
Estamos publicando la metodología, e invitamos a cualquiera que esté construyendo respondentes sintéticos a ejecutar la misma prueba y publicar sus propios números — ratios de varianza incluidos. El objetivo no es ganar una discusión. Es darle a la categoría una forma compartida y reproducible de preguntar qué tan cerca es suficientemente cerca.
Lo que aprendimos
Empezamos este benchmark intentando responder una pregunta simple: ¿son los respondentes sintéticos solo promedios?
El back-test no lo resolvió por sí solo. Lo que nos dio fue más preciso: las respuestas sintéticas salieron más estrechas que las humanas, y las diferencias entre sociedades enteras no surgieron por sí solas de los perfiles individuales. Las dos son el tipo de resultado que solo se obtiene haciendo la prueba en público.
Eso es útil. Te dice dónde mirar primero cuando pruebes cualquier panel sintético.
La investigación sintética no se volverá creíble porque lo acierte todo. Se volverá creíble cuando entendamos con precisión dónde se equivoca.
Referencias y lecturas adicionales
- Argyle, L. P., Busby, E. C., Fulda, N., Gubler, J. R., Rytting, C., & Wingate, D. (2023). Out of One, Many: Using Language Models to Simulate Human Samples. Political Analysis, 31(3), 337–351.
- Park, J. S., Zou, C. Q., Shaw, A., et al. (2024). Generative Agent Simulations of 1,000 People. Stanford University.
- Larooij, M., & Törnberg, P. (2025). Validation is the Central Challenge for Generative Social Simulation. AI Review (Springer).
- Morocho, E. E. T., Cima, L., Cresci, S., et al. (2026). Assessing the Reliability of Persona-Conditioned LLMs as Synthetic Survey Respondents. WWW 2026 Companion.
- Bisbee, J., Kennedy, R., & Goel, S. Synthetic Replacements for Human Survey Data? The Perils of Large Language Models. Political Analysis.
- Haerpfer, C., et al. (eds.). World Values Survey: Round Seven. WVS Association.
¿Quieres hacer el mismo back-test en tu categoría? Hablemos.
QualiSynth