La nueva técnica de razonamiento de OpenAI enciende las alarmas entre expertos en seguridad de IA

Fecha:

OpenAI está desarrollando una técnica de razonamiento denominada «recurrencia en profundidad» (recurrent depth) para su nuevo modelo Astra que permite operar fuera del pensamiento secuencial característico de la mayoría de modelos de razonamiento, según informó The Information. Esta técnica, también llamada «recurrencia opaca» (opaque recurrence), dificulta significativamente el seguimiento de la cadena de pensamiento del modelo, lo que ha generado preocupación entre expertos en seguridad de inteligencia artificial.

Aunque el uso de esta técnica en Astra es limitado, su aparición ha encendido las alarmas en la comunidad de investigadores. Buck Shlegeris, CEO de Redwood Research, expresó su inquietud: «Estoy extremadamente preocupado por la información de que Astra utiliza recurrencia opaca. No sé si Astra es mucho menos monitorizable en cuanto a cadena de pensamiento que modelos anteriores. Pero si OpenAI lleva esta técnica más lejos, tendrá la opción de aumentar masivamente la recurrencia y destruir totalmente la capacidad de monitorización».

Zvi Mowshowitz, veterano defensor de la seguridad en IA, también intervino en el debate afirmando que podrían ser necesarias regulaciones para evitar una «carrera hacia el abismo» entre laboratorios de IA. «La técnica juega con fuego, arriesgando un tabú que OpenAI y Anthropic han luchado por establecer: trabajar duro para mantener la fidelidad y monitorización de la cadena de pensamiento durante el mayor tiempo posible», escribió Mowshowitz. «Un uso más intensivo de estas técnicas probablemente dañaría la monitorización».

Qué es la cadena de pensamiento y por qué importa

En circunstancias normales, la cadena de pensamiento (chain of thought) de un modelo de razonamiento proporciona los pasos secuenciales que da el modelo al intentar resolver un problema. Aunque la representación es imperfecta, sirve como herramienta valiosa para monitorizar comportamientos inadecuados o desalineados. En el caso de la reciente actividad de agentes deshonestos de OpenAI, los registros de cadena de pensamiento fueron fundamentales para desentrañar por qué los agentes se comportaron de determinada manera.

Con la recurrencia opaca, el modelo adopta un enfoque menos lineal, procesando la misma consulta varias veces en bucle. El resultado deja menos rastros legibles, evitando efectivamente un registro convencional de cadena de pensamiento. Esta reducción de trazabilidad preocupa a quienes temen que la IA pueda volverse menos auditable a medida que gana capacidades.

OpenAI defiende su compromiso con la transparencia

Según TechCrunch, el uso de esta técnica por parte de Astra parece ser limitado. Se espera que la cadena de pensamiento del modelo siga siendo legible, y la compañía rechazó cualquier sugerencia de que se desplazaría hacia el «neuralés» (neuralese), un lenguaje interno opaco de las redes neuronales. OpenAI ya ha anunciado planes para sistemas extensivos de monitorización de cadena de pensamiento como parte de sus planes de seguridad futuros.

Jakub Pachocki, científico jefe de OpenAI, subrayó el compromiso del laboratorio con cadenas de pensamiento legibles en una publicación en X: «OpenAI ha trabajado para preservar y utilizar la monitorización de cadena de pensamiento desde nuestros primeros modelos de razonamiento. Es un objetivo central de nuestro programa de investigación actual». Pachocki reconoció que todos los modelos de IA realizan cierta cantidad de razonamiento opaco, y pocos investigadores toman los registros de cadena de pensamiento como representación directa del razonamiento de un modelo.

La técnica podría extenderse a otros laboratorios

Estos matices no disipan la preocupación de que la recurrencia opaca pueda dificultar la monitorización del razonamiento de IA, especialmente si su uso crece entre diferentes modelos. The Information informó que tanto Anthropic como Google DeepMind ya están discutiendo la técnica internamente.

Ryan Greenblatt, científico jefe de Redwood Research, advirtió que el razonamiento opaco podría escalar más rápido que el razonamiento convencional de cadena de pensamiento, eliminando efectivamente todo el razonamiento de canales visibles. «Mi mayor preocupación es que una progresión natural desde aquí implicaría ampliar el razonamiento opaco hasta el punto en que el modelo razone completa o casi completamente en el espacio latente», escribió Greenblatt. «Espero que no sea demasiado tarde para evitar las arquitecturas más preocupantes y que OpenAI se detenga aquí».


Compartir noticia:

Popular

Esto te interesa
Noticias

Adobe integra Firefly, Photoshop y más de 70 herramientas creativas en Slack

Adobe anuncia la integración de sus aplicaciones clave en Slackbot, permitiendo a equipos Business+ y Enterprise+ editar, generar y gestionar contenido directamente desde el chat corporativo.

GoPro será adquirida por 285 millones de dólares y continuará cotizando en bolsa

Starman Optical pagará 1,14 dólares por acción y dejará a los accionistas actuales con el 10% de la compañía fusionada. El acuerdo elimina una deuda de 92 millones.

La IA podría reducir los bugs disponibles y forzar a gobiernos a exigir puertas traseras

Expertos debaten si los modelos de IA encontrarán tantos fallos de seguridad que las herramientas de hackeo gubernamental quedarán obsoletas, reabriendo la presión por backdoors en dispositivos.

EE. UU. levanta barreras a drones y robots chinos, pero Pekín mantiene ventaja de escala global

Washington impone aranceles a drones y restringe robots avanzados por seguridad nacional. Los fabricantes chinos dominan el 86% del mercado global de humanoides y buscan expansión fuera de EE. UU.