SevenTnewS

Ciencia del comportamiento

Las decisiones humanas que los LLM pueden replicar mejor que las encuestas

Un estudio que utiliza 3,000 agentes basados en GPT-5 en experimentos de elección de ruta muestra que los LLM reproducen sesgos de la teoría prospectiva acumulativa, aversión a las pérdidas, dependencia de referencia, ponderación de probabilidad, con alta fidelidad. El enfoque evita el cuello de botella de la estimación de parámetros que limita el modelado conductual tradicional.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-28 · 6 min de lectura

Las decisiones humanas que los LLM pueden replicar mejor que las encuestas
Fuentes : Reproducing hum…

Durante décadas, modelar cómo las personas reales toman decisiones, especialmente bajo riesgo e incertidumbre, se ha topado con un muro práctico difícil. La teoría prospectiva acumulativa (CPT) captura los sesgos que la economía clásica ignora: aversión a las pérdidas, dependencia de referencia, la tendencia a sobreponderar probabilidades pequeñas. Pero para usar la CPT a escala, los investigadores necesitan parámetros a nivel individual que son obstinadamente costosos de recolectar. Las encuestas son pequeñas. Los experimentos controlados son homogéneos. La diversidad de la toma de decisiones humana sigue siendo inalcanzable.

Un equipo de la Universidad de Tianjin y la Universidad de Nottingham Ningbo China ha publicado ahora lo que puede ser la primera demostración sistemática de que los modelos de lenguaje extenso pueden evitar ese cuello de botella por completo. En un preprint titulado "Reproducing human biases in route choice using large language models", los investigadores muestran que los agentes basados en LLM, 3,000 de ellos, cada uno con un perfil demográfico y psicológico distinto, producen patrones de elección que se corresponden con las predicciones de la CPT con una bondad de ajuste que supera 0.93 para ganancias y 0.95 para pérdidas.

“Estos hallazgos sugieren que los modelos de IA generativa pueden proporcionar una alternativa escalable para modelar procesos de decisión humana”, escriben los autores. La implicación es que las simulaciones basadas en agentes, durante mucho tiempo limitadas por la dificultad de dotar a los agentes virtuales de una heterogeneidad conductual realista, podrían construirse con una fidelidad antes reservada para pequeños experimentos con sujetos humanos.

De los cuestionarios a los agentes generativos

El cuello de botella que aborda el artículo no es teórico sino logístico. La CPT describe el comportamiento de elección a través de una función de valor y una función de ponderación de probabilidad, gobernadas por parámetros que codifican qué tan sensible es una persona a las ganancias versus las pérdidas, qué tan abruptamente descuentan las diferencias de probabilidad, y dónde establecen su punto de referencia psicológico. Históricamente, estimar estos parámetros ha implicado realizar encuestas de unos pocos cientos de participantes como máximo, 160 registros utilizables de una encuesta de viajes del área de Washington, o un puñado de estudiantes de posgrado en un experimento de laboratorio. Los conjuntos de parámetros resultantes describen un promedio grupal, no el espectro de la heterogeneidad del mundo real.

El enfoque del equipo chino reemplaza a los encuestados humanos con agentes basados en LLM. Utilizando una arquitectura de indicaciones no paramétrica, crearon diez perfiles de agente: un trabajador jubilado que va al hospital, un repartidor haciendo entregas, un vloguero reseñando ubicaciones, cada uno con preferencias de riesgo explícitas, sensibilidad al tiempo y propósito de viaje. Para cada perfil, generaron 300 agentes, dando un total de 3,000 sujetos virtuales. Luego, estos agentes fueron expuestos a escenarios de elección de ruta donde el mismo tiempo de viaje promedio ocultaba diferentes distribuciones de riesgo: algunas rutas tenían resultados estables pero mediocres; otras ofrecían la posibilidad de una gran ganancia junto con un riesgo real de pérdida.

“Los agentes humanos heterogéneos con atributos multidimensionales se construyen basándose en LLM a través de indicaciones estandarizadas”, explican los autores. Los agentes no recibieron parámetros de CPT; recibieron una descripción de quiénes eran y qué valoraban, y se les pidió que eligieran una ruta.

Los sesgos que los LLM reprodujeron

El artículo prueba dos predicciones canónicas de la CPT. Primero, que las personas son adversas al riesgo en el dominio de las ganancias y buscadoras de riesgo en el dominio de las pérdidas. Segundo, que la asimetría no es simétrica: las pérdidas duelen aproximadamente 1.43 veces más de lo que las ganancias equivalentes se sienten bien, una cifra que el estudio derivó directamente de las elecciones generadas por los LLM. Los parámetros estimados, α = 0.4 para la sensibilidad a las ganancias, β = 0.64 para la sensibilidad a las pérdidas y λ = 1.43 para la aversión a las pérdidas, se encuentran dentro del rango de valores reportados en estudios humanos.

Fundamentalmente, los agentes no siguieron sus etiquetas de riesgo mecánicamente. Cuando los agentes tipo 1, trabajadores jubilados descritos como cautelosos y meticulosos, se colocaron en un escenario de pérdida donde la ruta A tenía probabilidad cero de llegada a tiempo, cambiaron a la ruta B más volátil. “Esto sugiere que, aunque generalmente son adversos al riesgo, reevalúan la distribución de resultados cuando el retraso es inevitable”, señalan los autores. Los perfiles del vloguero y del estudiante universitario, descritos como buscadores de riesgo, eligieron abrumadoramente la ruta de alta varianza, pero no de manera uniforme en todos los escenarios, lo que indica una toma de decisiones sensible al contexto en lugar de una política fija.

El estudio también extrajo puntos de referencia, el punto de referencia psicológico contra el cual se miden las ganancias y las pérdidas, de los tiempos de viaje esperados de los agentes. En lugar de imponer una referencia fija, los agentes LLM formaron cada uno una expectativa individualizada; el agregado de estas expectativas produjo un punto de referencia que cambiaba con el escenario, reflejando la misma dependencia del contexto que los economistas conductuales observan en los sujetos humanos.

Escalar el comportamiento sin escalar los costos

La promesa práctica de este enfoque no es solo que funciona, sino que funciona de manera económica. Ejecutar 3,000 agentes a través de 11 escenarios en tres réplicas sería prohibitivamente costoso con sujetos humanos, tanto en costos de reclutamiento como en tiempo. La simulación basada en LLM produjo una salida JSON estructurada lista para el análisis estadístico, con una supervisión humana mínima más allá del diseño de las indicaciones.

Los autores son claros acerca de lo que no han probado. Su estudio no prueba si los LLM pueden reproducir todos los sesgos conductuales conocidos, solo los relevantes para la CPT en un contexto de elección de ruta. Los perfiles de los agentes, aunque diversos, siguen siendo una simulación de diversidad, no una validación contra datos de población real. Y el uso de un solo modelo, GPT-5, deja abierta la cuestión de si el resultado se generaliza entre familias de modelos o configuraciones de temperatura.

Aun así, el artículo abre una puerta contra la que los modeladores conductuales han estado presionando durante años. Si los LLM pueden generar datos conductuales sintéticos que reflejen con precisión las estructuras de sesgo humano, entonces el cuello de botella se desplaza de la recolección de datos a la ingeniería de indicaciones, una restricción que, al menos en principio, es más fácil de escalar.

El camino a seguir para el modelado conductual generativo

El trabajo del equipo de Tianjin se enmarca en un esfuerzo más amplio por utilizar los LLM como lo que algunos investigadores llaman "ciencia social computacional en una caja". Trabajos anteriores del proyecto de agentes generativos de Stanford mostraron que los agentes basados en LLM podían simular la difusión de información y la agregación social en un entorno de caja de arena. Este artículo extiende esa lógica a un marco conductual estrechamente parametrizado, lo que sugiere que los mismos agentes pueden servir como sustitutos de sujetos humanos en experimentos diseñados para medir patrones cognitivos específicos.

La siguiente pregunta, que el artículo no responde, es si los parámetros estimados de los agentes LLM coincidirían con los estimados a partir del comportamiento humano real en el mismo escenario. El estudio se detiene en mostrar que las elecciones de los agentes son consistentes con la CPT; no compara las estimaciones de parámetros resultantes con líneas de base recopiladas por humanos. Esa comparación sería el siguiente paso natural, y los autores lo reconocen indirectamente en su sugerencia final de que futuras investigaciones deberían examinar "diferentes modelos de IA y comparación con la toma de decisiones de usuarios reales".

Para los profesionales en modelado de transporte, planificación urbana y simulación basada en agentes, el artículo ofrece una metodología concreta. La arquitectura de indicaciones estandarizada es modular: los mismos componentes de perfil y planificación podrían adaptarse a escenarios de elección de modo, hora de salida o incluso decisiones financieras. El código y las plantillas de indicaciones aún no se han publicado públicamente, pero el artículo proporciona suficientes detalles para replicar el enfoque.

Si los resultados se mantienen en todos los dominios y modelos, el cuello de botella que ha limitado el modelado conductual finalmente puede tener una solución alternativa, una que se ejecuta en una llamada API en lugar de un portapapeles y un portapapeles.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.