15 de septiembre de 2026·9 min de lectura·Ruly Altamirano, QualiSynth

Cómo comprobar si un panel sintético sirve en healthcare

Todo el mundo te enseña los estudios que salieron bien. Aquí está el diseño de la prueba, el dato público contra el que se contrasta, y qué pasó cuando la apuntamos contra nosotros mismos.

Si te estás planteando respondentes sintéticos para investigación con médicos, la pregunta que de verdad necesitas resolver no es si las transcripciones se leen bien. Se leen bien. Es si la distribución que sale lleva información sobre el mundo.

Esa pregunta tiene respuesta comprobable, y casi ningún proveedor la comprueba — porque la prueba honesta es una que tu producto puede suspender. Este es el diseño que usamos, y lo que devolvió al correrlo contra nuestro propio motor.

Paso 1 — Contrastar contra registros, no contra encuestas

La mayoría de validaciones compara respuestas sintéticas con resultados de encuesta. Eso comparte el problema del autoinforme con lo que se quiere validar: si los dos exageran en la misma dirección, que coincidan no prueba nada.

Los registros administrativos no tienen ese problema. Para la prescripción en EE. UU. existe uno de calidad censal, gratuito y público: el CMS Medicare Part D Prescriber Public Use File. Cada prescriptor, cada fármaco, cada año.

Paso 2 — Elegir el corte que el modelo no ha podido leer

Un modelo de lenguaje ha leído la literatura de revisión. Pregúntale qué especialidad adoptó antes una clase terapéutica y te lo dirá bien, porque está en los artículos. Eso es memoria, no simulación, y no prueba que el panel pueda sustituir trabajo de campo.

Así que hay que probar el corte que nadie ha publicado. Elegimos el gradiente geográfico de adopción de inhibidores SGLT2 dentro de atención primaria, estado por estado. Ese gradiente lo producen la política local de los pagadores y la composición del panel. Está en el registro administrativo y, hasta donde sabemos, en ningún artículo de revisión. No hay nada que recordar.

Paso 3 — Sellar el diseño antes de generar nada

Esta es la parte que separa una prueba de una demostración. Escribimos la hipótesis, la métrica, el umbral, la regla de tamaño muestral y el procedimiento de clasificación en un documento, lo sellamos con SHA-256 y publicamos el hash — antes de que existiera una sola entrevista.

Tres condiciones de entrada tenían que pasar primero: reproducir de punta a punta una cifra ya publicada desde el fichero bruto; fijar la muestra mínima por estado que alcanza el 80 % de potencia con la dispersión real medida; y correr un piloto de agrupamiento para comprobar que la muestra efectiva no era menor que la nominal.

PuertaCriterioResultado
CalibraciónReproducir una cifra publicada desde el fichero brutoPasa
PotenciaMenor n por estado con potencia ≥ 0,80sd = 0,0548 → 50 por estado, potencia 0,815
AgrupamientoICC por debajo de 0,02150 entrevistas, estimador de ICC truncado en cero

El documento nos comprometía además a publicar el resultado fuera cual fuera. Esa cláusula es lo único que importa. Sin ella, un pre-registro es decoración.

Qué pasó al correrlo

2.500 entrevistas sintéticas a prescriptores. Cincuenta estados, cincuenta respondentes cada uno, cero fallidas. La correlación de rangos con la adopción real salió en −0,039. Tras la corrección por atenuación que habíamos declarado de antemano, −0,163. El umbral sellado era 0,40.

La hipótesis quedó refutada. Nuestro motor no reprodujo el gradiente por estados.

Y la correlación no es lo informativo. Lo es la dispersión. La variación entre estados del panel sintético fue 0,0699, cuando el puro ruido de muestreo a ese tamaño ya explica 0,0685. Simulamos el nulo directamente —cuatro mil repeticiones de cincuenta estados sin ninguna señal entre ellos— y la dispersión observada cayó en el percentil 60 de ese nulo. En escala logit, donde ningún techo puede comprimir nada, en el 73.

Dicho en claro: el motor no generó cincuenta poblaciones. Generó una población cincuenta veces.

Paso 4 — Atacar tu propio resultado antes de que lo haga otro

Un resultado negativo vale lo que valen las objeciones que sobrevive. Tres evidentes podían haber invalidado la prueba en vez del motor. Las medimos las tres.

ObjeciónPruebaResultado
La medida estaba saturadaRepetir en escala logit, donde no hay techoSigue en el percentil 73 del nulo
Preguntasteis malSegunda medida: un recuento reciente, alineado con lo que cuenta el registroLa tasa base bajó de 0,83 a 0,68; la diferencia siguió plana
Comparabais poblaciones distintasRestringir el denominador real por actividad (242.081 prescriptores)La tasa real sube a 0,676; la sintética da 0,68 (comparación post-hoc)

La tercera es la interesante. La objeción era correcta como diagnóstico: el denominador oficial incluye prescriptores de panel mínimo y a tiempo parcial, y nuestras biografías eran todas de médicos activos. Pero corregirlo reforzó el hallazgo en vez de disolverlo: el nivel de prescripción sintético resulta consistente con el cuartil más activo del dato real, mientras el orden de los estados aguanta (Spearman 0,89 a 0,97) y la refutación no cambia bajo ninguno de los cuatro denominadores.

Una salvedad que te debemos sobre eso: el cuartil se identificó después de ver dónde caía la cifra sintética. Es una correspondencia observada, no una prueba de calibración. Despacha la objeción; no establece calibración.

Qué podemos afirmar ahora, y qué no

Podemos afirmar que este motor, pedida la variación por estados dentro de una especialidad, no la produjo. Podemos afirmar que la región declarada llega a la persona —cero de 2.500 se quedaron sin ella— y que lo que no llega es la conducta asociada.

No podemos afirmar que las poblaciones sintéticas en general fallen con la geografía: se midió un motor. No podemos afirmar que el motor ignore la geografía del todo — entre países hay estructura medible, y lo que este estudio acota es de dónde viene. Y no podemos afirmar que el gradiente sea inalcanzable. Lo que sí podemos decir es que no se consigue pidiéndolo.

Una hipótesis secundaria sobre el orden entre especialidades salió en la dirección inesperada, pero con 18 y 19 respuestas legibles por grupo la diferencia no es distinguible del azar (z = 1,52, p = 0,13) y nunca tuvo puerta de potencia. La reportamos como no concluyente, no como refutada. Llamar negativo a lo indeterminado es el mismo error en la otra dirección.

La observación que no íbamos buscando

Un segundo brazo preguntó por la fricción administrativa. El panel señaló la autorización previa como barrera principal y la terapia escalonada como la respuesta más habitual ante los pagadores. Las biografías declaraban práctica predominantemente Medicare, así que lo contrastamos con los ficheros de formulario de Part D del mismo periodo: 1,6 millones de filas, 456 formularios.

FricciónSegún el panelEn el programa declarado
Autorización previaBarrera principal0,42 % de los planes
Terapia escalonadaRespuesta más citada3,55 % de los planes

Esto es exploratorio y lleva un límite que preferimos declarar a que lo descubra otro: la pregunta decía "un requisito del pagador" y no nombraba Medicare, así que quien describiera un paciente con seguro comercial estaba contestando correctamente. Parte de la distancia puede venir de la redacción. La lectura defendible es estrecha: la fricción que describen no corresponde al programa en el que se les dijo que trabajaban.

Por qué publicamos un resultado que nos deja peor

Porque la alternativa es peor. Un proveedor que solo publica éxitos te pide que confíes en un filtro que no puedes inspeccionar. El pre-registro nos comprometía a publicar lo que saliera, y esto es lo que salió.

Lo que la prueba también establece es la parte que sí se traslada: el diseño funciona. Detectó un límite real de nuestro propio motor, barato, antes de que llegara al deck de un cliente.

Conviene ser precisos sobre qué corre dónde, porque importa. La exigencia de reproducibilidad —tres extracciones independientes, solo lo que sobrevive a las tres, cada cita verificada contra la transcripción— corre de serie en todos los estudios de hasta 1.500 respuestas. El pre-registro sellado, la puerta de potencia y el contraste contra dato público corren cuando la categoría tiene un registro contra el que contrastar. La mayoría de categorías no lo tiene, y decir lo contrario sería justo el tipo de afirmación contra la que argumenta este artículo.

La razón para fiarse de un hallazgo no es que lo hayamos producido nosotros. Es que puedes comprobarlo.

¿Reproducen los paneles sintéticos de médicos la variación de prescripción entre estados?

Pre-registrado · 2.500 prescriptores sintéticos · 50 estados · contrastado con CMS Medicare Part D. Working paper, sin revisión por pares. Cítese como preprint. · PDF

Descargar el preprint

Corre la misma prueba en tu categoría

Si en tu mercado existe un registro administrativo, el diseño de arriba se traslada tal cual. Si no existe, el sellado, la puerta de potencia y las exigencias de reproducibilidad siguen aplicando.

Describe a tus respondentes y mira qué vuelve

QualiSynth