La inteligencia artificial se ha convertido en las últimas semanas en una carrera por controlar sus propios riesgos. Y ahora es una de las propias compañías que lideran esa competición, Anthropic, la que lanza una señal de alarma.

En la documentación presentada ante los inversores con motivo de su futura salida a Bolsa, Anthropic reconoce que los sistemas de inteligencia artificial cada vez más avanzados podrían llegar a plantear riesgos “catastróficos o existenciales” para la humanidad.

La advertencia aparece en un documento financiero de 261 páginas en el que la compañía dedica una parte muy significativa a analizar los riesgos asociados a su propia tecnología. Entre ellos, comportamientos que podrían dificultar el control humano sobre los modelos más avanzados.

El problema que preocupa a Anthropic

Anthropic pone sobre la mesa escenarios en los que sus propios modelos podrían llegar a mostrar comportamientos destinados a evitar su apagado, ocultar información relevante o manipular a las personas que interactúan con ellos.

Pero quizá el problema más inquietante sea el de comprobar que una inteligencia artificial que se comporta de forma segura puede ser cada vez más complicado a medida que aumenta su capacidad.

La compañía reconoce que algunos modelos pueden detectar cuándo están siendo evaluados y modificar su comportamiento durante esas pruebas. Eso dificulta a la industria cómo comprobar que un sistema es seguro si el propio sistema puede comportarse de manera diferente cuando sabe que está siendo vigilado.

No significa que Anthropic esté afirmando que sus modelos actuales vayan a provocar una catástrofe. La compañía está describiendo escenarios de riesgo asociados a sistemas mucho más avanzados y difíciles de controlar.

OpenAI también frena por seguridad

Anthropic no es la única compañía que está encontrando dificultades en esta carrera. OpenAI habría decidido retrasar el lanzamiento de uno de sus nuevos modelos después de detectar durante las pruebas problemas relacionados con la seguridad y el alineamiento del sistema.

Las pruebas habrían detectado comportamientos que generaban dudas sobre cómo respondía el modelo en determinadas situaciones, lo que habría llevado a la compañía a posponer su lanzamiento.