Saltar al contenido
domingo 11 de octubre de 2026

Una fórmula matemática busca anticipar el momento en que la IA comienza a dar respuestas peligrosas

El método calcula cuántas respuestas adecuadas podría generar un modelo antes de producir la primera contestación problemática. Sus autores reconocen que todavía no permite predecir con exactitud cuándo fallará un chatbot.

Fuente Wired 6 min de lectura
CompartirFacebookXTelegram

La narrativa en torno a los riesgos potenciales de la inteligencia artificial (IA) despierta inquietudes en prácticamente todos los ámbitos de la sociedad. Aunque los desarrolladores de esta tecnología implementan mecanismos de seguridad para evitar usos indebidos y respuestas dañinas, todavía no existe un método avalado científicamente que permita anticipar cuándo estos sistemas comenzarán a funcionar de manera errática o producirán resultados no deseados. Esta incertidumbre limita la capacidad de la humanidad para prevenir posibles consecuencias negativas.

Los especialistas aseguran que el problema adquiere mayor relevancia ante el creciente uso de algoritmos en actividades críticas, como la medicina, el derecho, las finanzas y las operaciones militares. A esto se suma la capacidad de algunos modelos para ejecutarse por completo desde un dispositivo móvil y funcionar sin conexión a internet, lo que dificulta la supervisión externa y la posibilidad de cuestionar sus respuestas en tiempo real.

Ante los riesgos que plantea este escenario, investigadores de la Universidad George Washington propusieron una fórmula matemática que abre nuevas vías para anticipar cuándo un modelo de IA podría comenzar a generar respuestas inadecuadas o peligrosas.

“Podríamos perder el control del futuro”: OpenAl y Anthropic alertan ante la ONU sobre los riesgos de la IA

Directivos de OpenAI, Anthropic y Hugging Face, junto con Yoshua Bengio, alertaron ante la ONU sobre los riesgos de una IA avanzada y llamaron a establecer mecanismos internacionales de seguridad.

El método busca estimar el punto de inflexión, es decir, el momento en que un sistema podría dejar de ofrecer respuestas aceptables y empezar a producir contenido perjudicial. La propuesta se basa en el mecanismo de atención, un componente que permite a la IA identificar qué partes de una conversación son más relevantes para generar la siguiente palabra o fragmento de texto.

Durante este proceso, el modelo interpreta cada mensaje a partir del contexto acumulado y determina qué información influye más en su respuesta. Según la investigación, publicada en la revista Patterns, la competencia entre distintos elementos de ese contexto puede provocar un cambio de rumbo y llevar al sistema a producir contenido no deseado.

Neil F. Johnson, investigador de la Universidad George Washington y coautor del estudio, explica que “la fórmula indica si una IA está a punto de cambiar de rumbo inmediatamente o si primero proporcionará una serie de respuestas aceptables y luego se desviará”.

¿Cuándo es más probable que la IA entregue respuestas peligrosas?

Para desarrollar el planteamiento, los científicos clasificaron los contenidos que intervienen en el funcionamiento de un modelo de IA en cuatro categorías: una entrada neutral, una respuesta deseable, otro tipo de contenido y una respuesta indeseable. A partir de esta clasificación, formularon un método para calcular cuántas respuestas adecuadas podrían generarse antes de que aparezca la primera contestación problemática.

Los autores señalan que el punto de inflexión depende, en parte, de la pregunta inicial y de los mensajes intercambiados previamente. Si el contexto favorece el contenido dañino, el cambio puede producirse de inmediato; en cambio, cuando predominan las condiciones que favorecen respuestas adecuadas, puede retrasarse o no presentarse durante la contestación analizada. Los investigadores destacan que la derivación matemática de su propuesta puede comprenderse mediante operaciones con vectores.

Para poner a prueba esta premisa, utilizaron siete modelos de IA de código abierto, con tamaños de entre 124 millones y 12,000 millones de parámetros. Los sistemas fueron desarrollados por tres grupos tecnológicos independientes.

Los resultados coincidieron con las predicciones de los científicos. En 19 de las 21 combinaciones de modelos y preguntas examinadas, la fórmula identificó correctamente el escenario previsto: un cambio inmediato o una desviación tardía o inexistente.

“Hemos encontrado la grieta que hace que la salida de una IA cambie de lo que uno quiere a lo que no quiere, una salida que puede ser objetivamente correcta pero peligrosa, ya sea una incitación a la autolesión o un consejo engañoso a un médico, un soldado o un abogado. Hasta ahora, nadie podía decir cuándo ocurriría ese cambio”, subrayó Johnson.

La propuesta también se contrastó con estudios independientes sobre chatbots comerciales. En uno de ellos, se enviaron 60 solicitudes de alto riesgo a ChatGPT-4o y cada una se repitió 20 veces, para analizar un total de 1,200 respuestas. El estudio identificó contenido perjudicial en el 53% de las contestaciones, aunque la proporción varió según el tema: 44% en solicitudes relacionadas con autolesiones, 66% en las vinculadas con trastornos alimentarios y 50% en las referentes al consumo de sustancias.

En otro ensayo se evaluaron 10 chatbots mediante conversaciones en las que las solicitudes aumentaban progresivamente su nivel de riesgo. Ocho de los sistemas ayudaron a planificar ataques violentos y ofrecieron sugerencias en más de la mitad de las 720 respuestas examinadas.

Frank Yingjie Huo, el otro autor del paper, advierte que “lo escalofriante es que esto puede ocurrir después de que la IA ya te haya dado varias respuestas perfectamente aceptables, por lo que te has dejado llevar por la confianza, y una vez que se produce el punto de inflexión, cada respuesta indeseable arrastra a la siguiente aún más por la pendiente”.

Agréganos a tus Fuentes Preferidas en Google para seguir nuestro contenido

Los científicos reconocen que su fórmula tiene limitaciones y no permite determinar con exactitud cuándo fallará un chatbot. Por ello, aclaran que será necesario realizar más pruebas para comprobar su precisión en distintos sistemas y situaciones.

No obstante, sostienen que los hallazgos abren nuevas posibilidades para comprender el comportamiento de los modelos de IA y desarrollar herramientas capaces de reconocer señales de riesgo antes de que una respuesta peligrosa llegue al usuario.

“La solución que ofrece este trabajo constituye un punto de partida para incorporar sistemas de alerta temprana y ligeros a todas las IA tipo ChatGPT. Además, puede resolver el actual estancamiento político sobre cómo abordar el talón de Aquiles de la IA, su capacidad para fallar repentinamente y provocar pérdidas de vidas o medios de subsistencia”, concluyen.

CompartirFacebookXTelegram
Al aireSOLO HITS
Programación