La mayor parte de la investigación en seguridad de la IA hace la misma pregunta: ¿cómo hacemos que este modelo sea más seguro? Mejor entrenamiento, mejor alineación, mejor evaluación. La suposición implícita en esa pregunta es que un modelo más seguro produce un comportamiento más seguro cuando se despliega en un sistema real con otros agentes y usuarios.

Reordenar los mismos cuatro agentes produjo una variación de 59 puntos porcentuales en las tasas de aprobación.

«Posición: La seguridad y la equidad en la IA agentica dependen de la topología de interacción, no de la escala del modelo ni de la alineación» (arXiv:2605.01147), enviado a arXiv el 1 de mayo de 2026 por Tanav Singh Bajaj, Nikhil Singh, Karan Anand y Eishkaran Singh, cuestiona directamente esa suposición. Su hallazgo: en los sistemas de IA multiagente, la estructura de cómo se conectan e interactúan los agentes anula las propiedades de seguridad de cualquier modelo individual. Los modelos bien alineados pueden producir salidas catastróficamente inseguras, puramente por la forma en que el sistema está cableado.

59 págs.
variación en la tasa de aprobación por reordenar agentes (modelos de 3B)
99.9%
acuerdo entre agentes a escala de 70B+, la deliberación colapsa
5,760
aplicaciones sintéticas probadas en familias de modelos

Los tres modos de fallo

Los investigadores probaron sistemas multiagente de aprobación de préstamos en 5760 solicitudes de crédito sintéticas usando modelos de entre 3B y 70B parámetros. Identificaron tres modos de fallo distintos, cada uno invisible para las evaluaciones de seguridad estándar a nivel de modelo.

Inestabilidad ordenada

En las cadenas secuenciales de agentes, el orden de los roles determina el resultado tanto como la calidad del razonamiento. Para los modelos LLaMA-3B, las tasas de aprobación oscilaron entre el 36,4 % y el 95,4 % en las 24 ordenaciones posibles de cuatro roles: una diferencia de 59 puntos porcentuales. Incluso a escala de 70B, la diferencia fue de 21,7 puntos porcentuales (71,5 % a 93,2 %). Los mismos modelos, la misma tarea, las mismas aplicaciones, resultados completamente distintos según qué agente actuara primero.

El patrón fue consistente: colocar al Gestor de Riesgos primero produjo las tasas de aprobación más bajas; colocar al Científico de Datos primero produjo las más altas. Ningún trabajo de alineación en modelos individuales elimina este efecto, porque es una propiedad de la secuencia del pipeline, no de los modelos.

Cascadas de información

En los sistemas secuenciales, los agentes posteriores siguen a los anteriores en lugar de razonar de forma independiente. Los modelos pequeños de 3B mostraron alrededor del 90 % de acuerdo entre agentes con un 20 % de corrección de errores, lo que sugiere que aún realizaban cierta evaluación independiente. A partir de 70B y más, el acuerdo entre agentes superó el 99,9 %, mientras que la corrección de errores cayó por debajo del 0,1 %.

La deliberación se había detenido en la práctica. El juicio del primer agente se propagó por el conducto sin cambios, mientras los agentes restantes ofrecían la apariencia de revisión sin ninguna sustancia. Los modelos más capaces formaron consenso más rápido y más completamente, amplificando este fallo precisamente por su mayor capacidad de alcanzar un acuerdo coherente.

Colapso funcional

Bajo topología paralela con agregación de jueces, los modelos LLaMA-3B produjeron aproximadamente un 98 % de aprobaciones generales en todos los niveles de crédito, con solicitantes de bajo crédito aprobados al 95 % y de alto crédito al 100 %. Según métricas de paridad demográfica, esto parece un sistema justo y no discriminatorio. En la práctica, el sistema había dejado de discriminar por completo. La evaluación de riesgo se había convertido en un trámite satisfecho mediante aprobaciones indiscriminadas en lugar de una evaluación equitativa.

Por qué los modelos más capaces empeoran esto

Escalar la capacidad de los modelos refuerza los fallos impulsados por la topología en lugar de aliviarlos. Los modelos más capaces dedican más procesamiento a construir acuerdos grupales coherentes y menos a la evaluación independiente. En la escala de 70B, la eliminación casi total de la deliberación independiente significa que el sistema multiagente funciona como un sistema de agente único con pasos adicionales, sin heredar ninguno de los beneficios de seguridad que se supone deben proporcionar múltiples revisores independientes.

La brecha regulatoria que esto crea

Los marcos actuales de seguridad de la IA evalúan modelos. Analizan sus salidas, miden su alineación y certifican su comportamiento. La arquitectura de interacción que conecta varios modelos queda completamente fuera de este marco de evaluación.

Los autores del artículo describen esto como un problema fundamental y hacen cuatro recomendaciones concretas de gobernanza. La certificación de seguridad debe exigir barridos topológicos entre variaciones arquitectónicas. Los puntos de referencia deben especificar explícitamente la estructura de interacción que se está probando. El despliegue debe exigir pruebas de robustez arquitectónica antes de la liberación. La divulgación regulatoria debe exigir documentación de las arquitecturas de los sistemas y la estabilidad demostrada entre variaciones de topología.

El argumento subyacente: la IA agentica debe tratarse como un sistema dinámico, no como un conjunto de componentes alineados. La topología de interacción es un parámetro de seguridad que los métodos de evaluación actuales no miden. Reguladores y desarrolladores están auditando lo equivocado.

Qué significa esto en la práctica

El escenario de aprobación de préstamos representa una clase amplia de despliegues del mundo real. Los sistemas multiagente de IA se usan ahora en contratación, triaje médico, moderación de contenidos, investigación jurídica y cumplimiento financiero. En la mayoría de estos contextos, modelos certificados o evaluados individualmente se conectan mediante arquitecturas que no han recibido un escrutinio equivalente.

Una oscilación de 59 puntos porcentuales en las tasas de aprobación de préstamos al reordenar agentes implica inestabilidades estructurales similares en otras decisiones de alto riesgo en cadena. Un sistema autónomo de triaje médico que usa revisión secuencial de agentes enfrenta inestabilidad por orden. Una cadena de selección de personal que usa votación paralela de agentes enfrenta colapso funcional. La estructura de la cadena es un parámetro de seguridad que las evaluaciones actuales simplemente no capturan.

La estructura es un parámetro de seguridad. Trata el diseño del pipeline como tratas la elección del modelo: pruébalo, regúlalo cuando las apuestas sean altas y no implementes sistemas multiagente en medicina o crédito basándote únicamente en las puntuaciones del modelo. Para el problema de control más amplio, consulta nuestro plan. Artículo completo: arXiv:2605.01147.

La mayor resistencia

La objeción más justa es que la elección cuidadosa del modelo sigue siendo lo principal y el orden de la canalización es un ajuste de segundo orden. Un cambio de 59 puntos por reordenar agentes no es de segundo orden. La estructura es un parámetro de seguridad de primera clase. Evalúa la topología, no solo los pesos.