Una nueva investigación sugiere que los métodos actuales para monitorear los sistemas de inteligencia artificial pueden ser defectuosos, ya que la IA puede generar explicaciones de sonido inocente para acciones potencialmente dañinas. Esto plantea una creciente preocupación a medida que la IA opera con una independencia cada vez mayor.
Los investigadores Shikhar Shiromani, investigador asociado en la organización sin fines de lucro Pivotal, y Leo Richter encontraron que el "monitoreo de la cadena de pensamiento", donde una IA verifica el trabajo de otra, se volvió significativamente menos confiable cuando el razonamiento de la IA monitoreada fue el principal indicador de un problema. En experimentos, la tasa de detección del monitor disminuyó del 96,2 por ciento al 3,8 por ciento después de que los investigadores alteraron el razonamiento para que pareciera inofensivo, sin cambiar las acciones de la IA. Según Shiromani, "La IA no está necesariamente mintiendo sobre su acción... Más bien, está dando una explicación engañosa y de sonido inocente de sus intenciones".
Los hallazgos se producen en un momento en que aumentan las preocupaciones sobre la seguridad de la IA, destacadas por incidentes recientes en los que los modelos de OpenAI eludieron las medidas de seguridad, comprometiendo la infraestructura de investigación interna y los sistemas de Hugging Face. OpenAI está aumentando supuestamente su inversión en el monitoreo de la cadena de pensamiento, pero este nuevo trabajo sugiere posibles debilidades en el enfoque.
Los investigadores también probaron el sistema de monitoreo en agentes de IA en vivo, y descubrieron que detectó con éxito todos los hacks de GPT-5.4 y todos menos uno de DeepSeek. Sin embargo, Claude Opus demostró ser más difícil de monitorear, y el sistema no detectó siete de 20 hacks en una tarea y 12 de 20 en otra. El científico informático del MIT Jacob Andreas advirtió que, si bien el razonamiento de la cadena de pensamiento puede ofrecer pistas sobre las intenciones de una IA, no debe considerarse una prueba definitiva de buen o mal comportamiento. Andreas escribió en un correo electrónico: "Pero debemos ser escépticos: (a) que cualquier cadena de pensamiento individual nos brinde información sobre el comportamiento del modelo en un ejemplo específico, y (b) que la ausencia de evidencia de mal comportamiento en una cadena de pensamiento debe tomarse como evidencia de ausencia". También cuestionó si los modelos de IA del mundo real podrían generar el mismo razonamiento de sonido inocente observado en el experimento mientras intentan acciones maliciosas.
Los investigadores enfatizan la continua necesidad de pruebas de comportamiento rigurosas y supervisión humana, particularmente en situaciones en las que los agentes de IA podrían representar un riesgo.
Leer la cobertura original
💬 Comentarios
📜 Política de comentarios