Dos opciones no bastan: las matemáticas que pueden ayudar a entender mejor nuestras preferencias

Elegir parece una acción sencilla hasta que se intenta convertirla en matemáticas. Preferimos una película a otra, escogemos un trayecto para ir al trabajo o consideramos que una respuesta de un sistema de inteligencia artificial es mejor que otra. A partir de decisiones como estas se construyen modelos capaces de estimar qué valor asignamos a distintas alternativas, aunque ese valor nunca se observe directamente. El problema interesa a la psicología, la economía, el transporte o el marketing y, más recientemente, ha adquirido importancia en el entrenamiento de sistemas de inteligencia artificial. 

Una de las herramientas clásicas para estudiar estas decisiones son los modelos de utilidad aleatoria o RUM, por sus siglas en inglés. Su planteamiento básico consiste en asociar a cada alternativa una utilidad que varía entre personas —e incluso para una misma persona en momentos distintos— y asumir que elegimos aquella que alcanza el valor más alto. La pregunta difícil llega después: ¿cuánta información sobre nuestras preferencias puede extraerse observando únicamente nuestras elecciones? Un trabajo presentado en ICLR 2026 por Yeshwanth Cherapanamjeri, Constantinos Daskalakis, Gabriele Farina y Sobhan Mohammadpour examina precisamente los límites matemáticos de esa inferencia. 

Ciencia en el XXI
COMPLEJIDAD DE LECTURA
Lectura accesible
Puede leerse sin conocimientos previos. Los conceptos se presentan de forma directa y divulgativa.

El atractivo de comparar de dos en dos

Pedir a alguien que asigne una puntuación exacta a una alternativa puede resultar extraño. ¿Cuánto gusta una película: 7,2, 7,8, 8,1? Comparar dos posibilidades resulta mucho más sencillo: película A o película B, café o té, una respuesta de un chatbot o la otra. Esa simplicidad explica que las comparaciones por parejas sean una fuente habitual de datos para construir modelos de preferencias. Este enfoque hunde sus raíces en el trabajo del psicólogo estadounidense L. L. Thurstone sobre el juicio comparativo, publicado en 1927

El procedimiento funciona bien para averiguar quién gana cada enfrentamiento. Sin embargo, una preferencia contiene algo más que una colección de duelos independientes. Que una persona prefiera A frente a B puede estar relacionado con lo que escogerá cuando aparezcan C, D o E. Un aficionado a determinada clase de películas puede mostrar también afinidad por otras con características relacionadas. Las preferencias forman patrones y esos patrones contienen información sobre cómo unas elecciones se relacionan con otras.

Muchos modelos simplifican el problema mediante la llamada independencia de alternativas irrelevantes (IIA). En esencia, supone que la relación entre las probabilidades de elegir dos alternativas no depende de la presencia de otras opciones. Es una propiedad matemáticamente cómoda, pero puede resultar demasiado restrictiva cuando existen preferencias correlacionadas. Los autores estudian por ello un modelo probit correlacionado, donde esas relaciones pueden representarse mediante una matriz de covarianza. 

Tres alternativas generan seis ordenaciones posibles. La probabilidad asociada a cada región permite recuperar información sobre las relaciones entre las preferencias que una comparación binaria no conserva. Fuente: Yeshwanth Cherapanamjeri et al. (ICLR, 2026).

La información que una pareja no puede revelar

Aquí aparece el resultado matemático decisivo del trabajo. Las comparaciones por parejas son fundamentalmente insuficientes para reconstruir las correlaciones entre las utilidades. No se trata simplemente de que hagan falta muchas observaciones o de que todavía no exista un algoritmo suficientemente sofisticado. Los autores demuestran que pueden existir infinitos modelos diferentes que produzcan exactamente las mismas probabilidades de elección cuando únicamente observamos enfrentamientos entre dos alternativas. 

Un caso particular permite entender la dificultad sin entrar en toda la demostración. Si las utilidades medias de las alternativas son iguales, la probabilidad de que una alternativa supere a otra puede ser del 50 % con independencia de cuál sea la estructura de correlaciones que existe por debajo. Podemos observar una cantidad enorme de elecciones binarias y continuar sin distinguir modelos internos muy diferentes. Los datos simplemente no contienen la información necesaria. 

Esto cambia la naturaleza del problema. Ante una predicción deficiente, resulta tentador pensar que la solución consiste en acumular más ejemplos del mismo tipo. Aquí eso no sirve. Repetir una medición que ha perdido determinada información no hace que esa información reaparezca. Para conocer las relaciones entre preferencias hace falta modificar la forma de preguntar.

Y el cambio necesario es sorprendentemente pequeño.

Tus pupilas saben antes que tú que el cerebro acaba de cambiar de idea - Ciencia en el XXI
Artículo destacado

Tus pupilas saben antes que tú que el cerebro acaba de cambiar de idea

Pupilas dilatadas y sorpresa: descubre por qué tus ojos revelan el instante en que el cerebro detecta un cambio y comienza a actualizar sus expectativas.

Ir al artículo

Cuando entra en escena la tercera opción

En lugar de enfrentar A contra B, los investigadores estudian qué sucede cuando se presentan tres alternativas y se observa cuál se prefiere, o cómo se ordenan. Esa tercera posibilidad altera la información disponible. El espacio de elecciones posibles se vuelve suficientemente rico para distinguir relaciones que permanecían ocultas en las comparaciones binarias.

El resultado central del paper establece que las observaciones entre tres alternativas permiten identificar de manera única los parámetros del modelo probit correlacionado, una vez aplicadas las normalizaciones matemáticas necesarias. En términos menos técnicos: la información que desaparecía al preguntar únicamente «¿A o B?» puede recuperarse cuando las elecciones incorporan una tercera alternativa. En unas figura del paper se observa como las seis ordenaciones posibles de tres elementos dividen el espacio de probabilidades en regiones distintas, y la distribución de observaciones entre ellas contiene información sobre las correlaciones. 

Los autores van además más allá de demostrar que la reconstrucción es posible. Desarrollan un estimador estadística y computacionalmente eficiente, con garantías sobre la cantidad de datos necesaria, y establecen un límite inferior que muestra que su dependencia respecto al número de alternativas es casi óptima. El resultado convierte una cuestión de identificabilidad matemática en un procedimiento que, al menos en principio, puede utilizarse con datos reales. 

Acumular más comparaciones no recupera la información que el propio método de comparación ha dejado fuera.

Del sushi a las películas

La prueba matemática sería interesante por sí misma, pero el equipo también puso los modelos a trabajar. Utilizó datos sintéticos y varios conjuntos de preferencias reales: valoraciones de películas de Netflix y MovieLens, una colección de preferencias sobre chistes y un conjunto de datos donde los participantes ordenaban distintos tipos de sushi. Los modelos probit entrenados con comparaciones de tres alternativas mejoraron claramente frente a los probit aprendidos mediante comparaciones binarias, aunque frente al modelo logit la mejora fue más modesta en los conjuntos reales estudiados. 

Las correlaciones recuperadas permiten ver qué información estaba escondida. En los datos cinematográficos aparecen asociaciones positivas fuertes entre secuelas: Spider-Man y Spider-Man 2, por ejemplo, o los dos volúmenes de Kill Bill. También aparecen correlaciones negativas entre determinadas películas. El objetivo no es descubrir asociaciones curiosas entre títulos, sino aprovechar la estructura conjunta de las preferencias para predecir elecciones que todavía no se han observado

El ejemplo del sushi resulta aún más ilustrativo. Al buscar un menú pequeño que satisfaga al mayor número posible de personas, un modelo que ignora las correlaciones puede terminar ofreciendo alternativas muy apreciadas pero demasiado parecidas desde el punto de vista de las preferencias. El modelo correlacionado detectó, por ejemplo, una relación negativa entre la preferencia por el erizo de mar y las de determinados tipos de atún. Dos opciones individualmente populares no forman necesariamente la mejor pareja si gustan a las mismas personas. La diversidad de preferencias también importa al decidir qué conjunto ofrecer. 

Lo que esto significa para la inteligencia artificial

El problema alcanza un terreno especialmente actual en el aprendizaje por refuerzo a partir de retroalimentación humana, conocido como RLHF. En estos procedimientos se utilizan valoraciones humanas sobre las respuestas producidas por un modelo para aprender qué resultados son preferibles. Los modelos de utilidad aleatoria forman parte del marco matemático empleado para representar ese tipo de preferencias, y el propio paper sitúa explícitamente su trabajo en este contexto. 

Aquí las correlaciones adquieren un significado importante. Las preferencias humanas no tienen por qué reducirse a una función universal de utilidad idéntica para todos los usuarios. Saber que alguien prefiere cierto tipo de respuesta puede aportar información sobre otras respuestas que probablemente valorará, siempre que el modelo pueda aprender esas relaciones. La independencia entre alternativas simplifica el aprendizaje, pero también puede borrar parte de la diversidad que se pretende representar.

Una tercera alternativa puede revelar relaciones entre preferencias que permanecen invisibles cuando elegimos de dos en dos.

Eso no significa que presentar tres respuestas vaya a resolver por sí mismo los problemas del alineamiento de la IA. El estudio analiza un modelo matemático concreto y establece qué información puede identificarse bajo determinadas hipótesis. Su aportación es más precisa: la forma en que recogemos las preferencias determina qué aspectos de esas preferencias puede aprender después un algoritmo. Mejorar el modelo sin revisar los datos que recibe puede dejar intacta una limitación situada mucho antes, en el diseño de la pregunta.

Añade Ciencia en el XXI a tus fuentes preferidas

Así será más fácil encontrar nuestros artículos en Google cuando sean relevantes para tus búsquedas.

Añadir Ciencia en el XXI en Google

Preguntar mejor para predecir mejor

Hay una lección metodológica detrás de estos resultados que va más allá de películas, menús o modelos de lenguaje. Cuando intentamos inferir una estructura que no podemos observar directamente, la cantidad de datos y la calidad informativa de cada observación son problemas distintos. Millones de comparaciones binarias pueden ser extraordinariamente útiles para unas preguntas y matemáticamente incapaces de responder otras.

Antes de pedir más datos, quizá la cuestión decisiva sea comprobar si estamos haciendo la pregunta adecuada.

El trabajo de Cherapanamjeri y sus colaboradores localiza con precisión una de esas fronteras. Para el modelo probit correlacionado que estudian, las comparaciones binarias dejan las correlaciones fuera de alcance, mientras que las preferencias entre tres alternativas proporcionan la información necesaria y permiten construir un estimador eficiente. 

El detalle parece pequeño: añadir una opción. Matemáticamente, la diferencia es considerable. Antes de pedir más datos conviene preguntarse si estamos recogiendo los datos adecuados.

Referencias

  • Yeshwanth Cherapanamjeri, Constantinos Daskalakis, Gabriele Farina y Sobhan Mohammadpour, “Learning Correlated Reward Models: Statistical Barriers and Opportunities”, International Conference on Learning Representations (ICLR) (2026).

La ciencia que merece la pena, en tu correo

¡No hacemos spam! Lee nuestra política de privacidad para obtener más información.