polactisSynthetic Inteliniciar sesión →
Método

Cómo funciona una simulación.
De la población a la respuesta.

Qué define el cliente, cómo se construye la población, de dónde sale cada dato que el agente conoce, y cómo se resuelve cada respuesta.

Es la página que le damos al área de metodología de una consultora cuando pregunta, con razón, por qué debería creernos.

La diferencia de origen

No estimamos la población.
La tenemos.

universo 45.600.000muestra 2.400 por defecto
esquema · no está a escala

Cuando sólo hay datos agregados, una población sintética hay que inventarla de forma consistente: se modela cómo se relacionan las variables entre sí y se sortean perfiles de ese modelo. Es un problema difícil y real — la edad y la condición de actividad no son independientes, ni el sexo y la rama de actividad. Si esas relaciones se pierden, la población puede coincidir con todos los totales por separado y aun así llenar las aulas de jubilados.

Nosotros no tenemos que resolverlo, porque no partimos de agregados. Partimos del microdato del Censo 2022 del INDEC: 45,6 millones de registros individuales de personas, con su hogar y su vivienda. Las relaciones entre variables no se modelan — ya vienen en el dato, porque cada fila es una persona que existió.

Lo que hacemos es muestrear ese universo, no completarlo.

Las seis etapas

De un filtro censal
a una distribución de respuestas.

El punto de entrada

La audiencia se define con las variables del censo, no con segmentos que inventamos nosotros: provincia, departamento y localidad; edad, nivel educativo, condición de actividad, categoría ocupacional.

polactis.com
Pantalla de creación de un estudio en Polactis, con los filtros de audiencia desplegados: provincia, departamento, localidad, edad, sexo, género, nivel educativo, condición de actividad, categoría ocupacional e industria.
etapa01/ 06
  1. 01La población objetivo
  2. 02El muestreo
  3. 03El contexto
  4. 04La dieta de medios
  5. 05La respuesta
  6. 06El reporte
01La población objetivo

Definís a quién le preguntás, con las variables del censo.

Provincia, departamento y localidad; edad, sexo, nivel educativo, condición de actividad, tipo de hogar, acceso a servicios. Son las columnas reales del Censo 2022, no segmentos inventados por nosotros.

El filtro puede ser el país entero o un partido del Gran Buenos Aires. Lo que cambia es cuántas personas del censo quedan disponibles para muestrear, y eso lo decís vos, no un mínimo comercial.

02El muestreo

No estimamos la población. La tenemos.

Cada agente es una fila real del microdato censal: una persona anonimizada, con su hogar y su vivienda colgados de ella. No generamos perfiles sintéticos a partir de márgenes agregados.

Sobre ese universo corre un ajuste proporcional iterativo (IPF) para que la muestra respete simultáneamente los márgenes del target, no una variable a la vez.

La semilla es fija: dos corridas con la misma configuración comparten las mismas personas. Es lo que hace que dos mediciones sean comparables entre sí y no dos sorteos distintos.

03El contexto

Cada agente conoce el país en el que vive.

El resultado electoral real de su departamento en las generales 2023, del que se deriva un voto propio por persona.

Los indicadores de su región al nivel más específico disponible: inflación, desempleo, pobreza, canasta básica, ingreso mediano, confianza en el gobierno, tasa de homicidios — con su tendencia contra once meses antes.

La coyuntura del día que corre el estudio: dólar, riesgo país, reservas. Va en el prompt de evaluación y nunca en el de biografía, porque un dato que cambia todos los días invalidaría la biografía todos los días.

04La dieta de medios

Nadie recibe las noticias en abstracto.

Cada agente lee el país a través del espectro de medios que su voto predice: no todos leen los mismos titulares, y los que leen los mismos no los leen igual.

Es la palanca más fuerte del sistema y lo decimos porque es incómodo: la dieta define la dirección de la respuesta con más fuerza que cualquier otra capa. Un mapeo mal hecho de un frente provincial da vuelta el signo de una medición.

Se computa una vez por estudio y se reparte entre los agentes. Hacerlo por agente multiplicaría el costo por la cantidad de agentes sin cambiar el resultado.

05La respuesta

Una distribución, no un promedio.

Cada agente responde por separado, con su biografía y su contexto. La biografía se cachea por persona: es un artefacto estadístico sobre datos públicos, así que se reusa entre estudios y entre clientes.

La evaluación usa muestreo verbalizado, el mecanismo publicado contra el colapso de modo: sin él, los modelos de lenguaje concentran las respuestas en los extremos y la varianza de la población desaparece.

Ningún agente ve la respuesta de otro. No hay contagio ni deliberación: lo que se agrega son opiniones independientes.

06El reporte

Con la huella de lo que lo produjo.

Distribución, cortes por siete dimensiones censales, agregado geográfico y verbatims. Los cortes con menos de treinta agentes se suprimen en vez de mostrarse con un margen que nadie lee.

Cada corrida lleva una huella de contexto: un hash sobre las versiones de cada dataset y de cada prompt. Si la huella de dos estudios coincide, son comparables; si no coincide, algo cambió abajo y el sistema lo sabe.

La lectura interpretativa la escribe un modelo aparte, y queda registrada con su propio hash. Es la única capa de la página que es prosa generada, y está marcada como tal.

En vivo

No es un lote que tarda.
Se ve responder.

Cada agente resuelve por separado, así que el estudio se puede mirar mientras corre: las respuestas entran de a una, con su localidad, y el mapa se puebla a medida que llegan.

Una corrida real, sin acelerar. Los nombres son sintéticos: el microdato censal no tiene nombres.

polactis.com

Si algo de esto no te cierra,
es la conversación que queremos tener.

Acceso por invitación. Escribinos y te mostramos una corrida completa, con la huella de contexto y los cortes suprimidos incluidos.

ver pulse →