Investigación en IA: toma de decisiones multiagente en arXiv
Un panel de agentes de IA puede estar de acuerdo y aun así equivocarse, sostiene un artículo
Las votaciones, las reglas electorales y los jueces LLM asignan la evidencia a etiquetas en una sola dirección, por lo que sus errores pueden estar correlacionados. Un nuevo artículo propone en su lugar clasificar a los agentes mediante una posterior bayesiana inversa, y reporta sus mayores ganancias donde los agentes discrepan.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-09-19 · 5 min de lectura

Si se plantea la misma pregunta a varios modelos de lenguaje grandes, no siempre responderán lo mismo. Lo que ocurre después decide si esa variedad ayuda o perjudica. Una votación, una regla electoral o un juez LLM resuelve la discrepancia, y el razonamiento se detiene ahí. Un artículo enviado a arXiv el 10 de septiembre de 2026 sostiene que el problema empieza exactamente en ese paso.
El artículo se titula When Agents Disagree: Bayesian Backward Reasoning as a Label-Free Anchor for Multi-Agent Collective Decision-Making. Su objetivo no es el modelo individual, sino la capa que se sitúa por encima de un conjunto de ellos.
Por qué una votación hereda el mismo error
Las votaciones, las reglas electorales y los jueces LLM parecen mecanismos distintos para resolver una discrepancia. Los autores los agrupan de todos modos. Los tres razonan hacia adelante: toman la evidencia y la asignan a una etiqueta en una sola dirección. Las estimaciones que resultan de ese proceso comparten lo que el artículo denomina la misma factorización de evidencia a etiqueta, y las estimaciones construidas sobre una misma factorización pueden acarrear errores correlacionados en lugar de independientes.
La distinción sostiene todo el argumento. Si cinco agentes fallan por razones no relacionadas, combinarlos cancela el ruido. Si fallan por la misma razón, la respuesta combinada coincide con el error y, al hacerlo, parece segura de sí misma. El artículo no afirma que los métodos hacia adelante siempre fallen juntos, solo que pueden hacerlo, y que el modo de fallo es invisible si se observan únicamente las salidas.
Ejecutar el modelo hacia atrás
La alternativa propuesta es construir una segunda estimación desde la otra dirección. Para cada instancia, los autores construyen una posterior inversa mediante razonamiento bayesiano hacia atrás a partir de una verosimilitud explícita. En su planteamiento, las posteriores hacia adelante y hacia atrás son dos aproximaciones factorizadas de forma distinta de la misma posterior subyacente, y eso es lo que las hace útiles como par.
El razonamiento se vuelve entonces probabilístico. Las estimaciones que llegan a través de factorizaciones distintas "may tend to share the same error less often", afirma el resumen, lo que constituye una hipótesis sobre la independencia de los errores más que una demostración de ella. Para ponerlo en práctica, los autores usan la divergencia de Jensen-Shannon para clasificar a los agentes según su consistencia entre rutas, una medida de cuán estrechamente se alinea la respuesta hacia adelante de un agente con la ruta inversa.
Tres formas de aprovechar una señal de consistencia
Esa clasificación sustenta tres estrategias de agregación, todas evaluadas en DDXPlus con cinco modelos base de LLM.
| Estrategia | Mecanismo | Resultado reportado |
|---|---|---|
| MinJS | Selección dura: elegir agentes por puntuación de consistencia | Supera la selección aleatoria en los cinco modelos base |
| FwdJS | Reponderación suave: mantener todos los agentes y ajustar su influencia | Generalmente mejora respecto de la línea base más sólida |
| LogLin | Fusión log-lineal del conjunto clasificado | Mejor rendimiento entre los métodos evaluados |
La distribución de esas ganancias importa más que el titular. Las mayores mejoras de LogLin recaen sobre el subconjunto de casos en los que los agentes discrepan. Un método que solo ayudara donde los agentes ya coinciden socavaría su propia premisa, así que este es el resultado en el que el artículo se apoya.
Dónde flaquea el ancla inversa
Un detalle reportado va en contra de una lectura simple del método. Por sí sola, la posterior inversa es menos precisa que las alternativas solo hacia adelante que pretende mejorar. Los autores no lo ocultan. Sostienen que su valor radica en ser un ancla más útil que una alternativa solo hacia adelante, porque aporta información que el conjunto hacia adelante no puede producir por sí solo.
Lo que el resultado en DDXPlus no dice
El resumen no contiene cifras. No hay dato de exactitud, ni margen sobre una línea base, ni intervalo de confianza, ni resultado por modelo base, y los cinco modelos base de LLM nunca se nombran. "Best performance among the evaluated methods" es la afirmación cuantitativa más contundente del texto, y es una clasificación más que una medición. Quien compare el enfoque con una canalización de producción debería tratar eso como un vacío que hay que verificar en el artículo completo, no como una cifra resuelta.
Hay un segundo hilo que vale la pena tirar. El método se presenta como un ancla sin etiquetas, es decir, clasifica a los agentes sin respuestas de referencia. Pero el artículo añade que, cuando hay datos etiquetados disponibles, una calibración ligera en dos etapas puede refinar aún más el ancla inversa y mejorar la agregación. Así, la técnica funciona sin etiquetas y funciona mejor con ellas, lo que deja la elección de variante supeditada a datos que un equipo puede tener o no.
El vacío que señala el artículo es estructural, no exótico. Los métodos de agregación combinan estimaciones sin separar los fallos independientes de los compartidos, y una mayoría segura de sí misma puede ocultar la diferencia. El razonamiento bayesiano hacia atrás es una forma de preguntar si un conjunto es diverso en el sentido que importa. Si esa pregunta se sostiene más allá de DDXPlus queda para el texto completo y para quien intente reproducirlo.
- Fuente : A panel of AI agents can agree and still be wrong, paper argues — 2026-09-10
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.