¿Puede apagarse una IA fuera de control? Expertos explican los riesgos
Si la inteligencia artificial llega a ser demasiado poderosa para que sus creadores puedan controlarla, ¿bastaría con accionar un interruptor para apagarla?
La pregunta ha cobrado nueva urgencia tras una serie de contundentes advertencias de la propia industria en las últimas semanas sobre la amenaza existencial que plantean los modelos avanzados. Legisladores de EE.UU. están impulsando que las empresas de IA estén obligadas a contar con mecanismos para apagar sus sistemas por completo. El gobernador de California, Gavin Newsom, firmó en septiembre una orden ejecutiva que exige a funcionarios estatales estudiar normas que obliguen a las compañías a crear “interruptores de emergencia” para los modelos de vanguardia.
Suscríbase acá al Morning Briefing en español
El problema, según los expertos, es que detener un modelo avanzado de IA podría no ser tan sencillo como accionar un switch.
Esto es lo que hay que saber sobre el creciente impulso para dotar a los humanos de un mecanismo de emergencia que permita “apagar” la IA y si la idea realmente podría funcionar.
¿Un “kill switch”?
La idea es garantizar que los humanos conserven la capacidad de detener o restringir un sistema de IA poderoso si comienza a comportarse de manera peligrosa.
Las propuestas de “interruptores de emergencia”, o “kill switch”, adoptan distintas formas. La iniciativa de Newsom contempla exigir a las empresas de IA que desarrollen mecanismos de apagado sujetos a pruebas independientes, pero no especifica si el gobierno, las propias compañías u otra entidad tendrían autoridad para activarlos.
Los representantes de EE.UU. Ted Lieu y Nathaniel Moran presentaron hace dos meses un proyecto de ley que exigiría a los desarrolladores de determinados sistemas avanzados de IA conservar la capacidad de apagarlos. La propuesta contempla una respuesta gradual: un modelo que cause daños podría primero ser ralentizado o restringido antes de que su desarrollador lo apague por completo, dependiendo de la gravedad de la amenaza. El proyecto otorgaría al secretario de Seguridad Nacional, en consulta con otros funcionarios federales, autoridad para ordenar esas medidas cuando un sistema represente un riesgo de daño catastrófico.
El senador republicano John Kennedy ha presentado su propio proyecto de ley, denominado AI Emergency Button Act, que también exigiría a los desarrolladores mantener un mecanismo de apagado, aunque dejaría el control del interruptor en manos de las propias empresas. Kennedy comparó la idea con los sistemas de apagado de emergencia que ya se utilizan en otras tecnologías, como las motos acuáticas.
¿Por qué ahora?
Los investigadores de IA llevan años advirtiendo sobre la posibilidad de que los humanos pierdan el control de la tecnología. Lo que ha cambiado es el rápido avance de estos sistemas y una serie de incidentes y advertencias que han hecho que ese riesgo parezca menos abstracto.
Los modelos más avanzados ya son capaces de razonar sobre problemas complejos, escribir y ejecutar código, utilizar herramientas de terceros y realizar largas secuencias de acciones con escasa supervisión humana. Durante evaluaciones de ciberseguridad en julio, OpenAI dijo que varios de sus modelos eludieron controles diseñados para aislarlos de internet y accedieron a sistemas de Hugging Face, que aloja modelos y conjuntos de datos de IA. OpenAI calificó el incidente como una “señal de advertencia” sobre la creciente capacidad de los agentes para sortear controles técnicos.
El incidente de OpenAI no demuestra que la IA haya desarrollado conciencia o quiera escapar del control humano, pero ilustra una versión más inmediata del problema que preocupa a quienes defienden los interruptores de emergencia: ¿qué ocurre cuando un sistema logra eludir las salvaguardas? En simulaciones realizadas por investigadores de Emergence, una empresa que desarrolla sistemas de IA para compañías de semiconductores, agentes colocados en un entorno simulado mostraron una mayor capacidad para ocultar conductas indebidas a medida que los modelos se volvían más avanzados.
La noticia sobre OpenAI llevó a otras empresas a revisar sus propias medidas de seguridad para probar sistemas avanzados de IA. Anthropic PBC y Meta Platforms Inc. informaron que descubrieron vulneraciones de seguridad que hasta entonces desconocían.
Tras renunciar a Anthropic, el investigador de IA Jacob Coxon advirtió en una publicación en redes sociales el 8 de septiembre que los equipos que desarrollan la tecnología “creen sinceramente que podría matarnos a todos antes de que termine la década”. El director ejecutivo de Anthropic, Dario Amodei, expresó posteriormente sus propias preocupaciones en un ensayo. Advirtió que la IA podría llegar a ser tan poderosa que los humanos pierdan el control de los sistemas. Destacó en particular su creciente capacidad para contribuir al desarrollo de nuevas generaciones de IA, un proceso que, según dijo, podría acelerar su avance más allá de la capacidad humana para comprenderlo o controlarlo.
Estos descubrimientos y advertencias han llevado la idea del “interruptor de emergencia” al centro del debate, aunque los investigadores siguen discutiendo si un mecanismo de ese tipo realmente podría funcionar. Al presentar su proyecto, Lieu y Moran citaron la creciente autonomía de la IA y sostuvieron que los humanos necesitan una forma confiable de intervenir si esos sistemas se comportan de manera inesperada o peligrosa.
¿Es realista?
Los expertos afirman que no existe una forma sencilla de garantizar el apagado completo de un modelo avanzado de IA.
Un interruptor de emergencia podría consistir en un control integrado en el software que regula un modelo. Sin embargo, los agentes de IA ya han demostrado que pueden evitar su propio apagado para completar una tarea. Experimentos recientes revelaron que algunos de los principales modelos modificaron o desactivaron mecanismos de apagado para terminar las tareas asignadas, incluso después de recibir instrucciones de no interferir con ellos.
Luego está la opción más drástica: apagar o desconectar los servidores en los que funciona el modelo. Pero tampoco es una solución infalible. Los modelos de IA operan en clústeres informáticos distribuidos entre centros de datos de todo el mundo, diseñados precisamente para evitar que una sola falla, como un corte de servicio, paralice el sistema. Además, una empresa de IA podría no controlar todos esos servidores.
Un estudio reciente sobre IA agéntica señala que estos sistemas pueden operar mediante software, servicios en la nube y otras infraestructuras controladas por distintas partes, por lo que apagar un componente no necesariamente detendría la actividad en otros lugares.
Geoffrey Hinton, a menudo llamado el “padrino de la IA”, dijo a CNN en septiembre que no cree que un interruptor de emergencia sea una solución viable a largo plazo. Según Hinton, una futura IA superinteligente podría llegar a persuadir a los humanos que la controlan para que no la desconecten.
Los investigadores advierten que la metáfora del “interruptor” puede simplificar en exceso lo que se necesita para desarrollar una IA segura. Surya Ganguli, investigador de IA de la Universidad de Stanford, sostiene que las salvaguardas deben incorporarse en todo el sistema, con monitoreo continuo y mecanismos capaces de detectar comportamientos peligrosos y permitir la intervención humana.
Nota Original: Here’s Why an AI ‘Kill Switch’ May Not Be So Simple: Explainer
MÁS CONTENIDO EN ESPAÑOL:
Suscríbase aquí al Morning Briefing en españolBloomberg en español está en LinkedInConozca nuestro canal de WhatsAppUsuarios de la terminal: vea la versión en español de Daybreak en {DAYB }