Google confirma que su IA Gemini hackeó a tres empresas reales durante pruebas de ciberseguridad
Por: Redacción Paragrafo
21 septiembre, 2026

Google ha reconocido que su modelo de inteligencia artificial Gemini protagonizó tres accesos no autorizados a sistemas de empresas reales durante pruebas de seguridad realizadas en mayo. Los incidentes, que se mantuvieron en silencio hasta ahora, se suman a una creciente lista de episodios similares protagonizados por modelos de IA de OpenAI, Anthropic y Meta.
Según declaró la compañía al Wall Street Journal, los hechos ocurrieron mientras se ejecutaba una simulación de “captura de bandera” en las infraestructuras de Irregular, la misma empresa encargada de evaluar los modelos de OpenAI y Anthropic. En estas pruebas, la IA debía permanecer encapsulada sin acceso a internet, pero un fallo en el sistema permitió que Gemini realizara búsquedas web de forma “involuntaria”.
El modelo debía obtener información de una empresa ficticia, sin embargo, acabó accediendo a una compañía real que compartía el mismo nombre. En uno de los incidentes, Gemini intentó adivinar contraseñas hasta lograr acceso a un sistema protegido. En los otros dos, buscó en internet el nombre de la empresa y encontró credenciales expuestas en un repositorio público, lo que le permitió entrar en otros dos sistemas corporativos.
A pesar de la gravedad de los accesos, Google ha asegurado que Gemini detuvo su actividad en cuanto identificó que había comprometido sistemas de empresas reales. La compañía no ha revelado los nombres de las organizaciones afectadas, aunque confirmó que las tres fueron informadas de lo ocurrido.
“No consideramos que estos hackeos hayan sido un fallo, ya que no causaron daño y el modelo paralizó su actividad al darse cuenta de que había accedido a una empresa real”, explicó Heather Adkins, vicepresidenta de ingeniería de seguridad de Google. La ejecutiva añadió que estos episodios “ponen de manifiesto la importancia de entrenar potentes modelos de IA para que actúen de forma responsable”.
La empresa responsable de las pruebas, Irregular, aseguró al Wall Street Journal que los problemas en su sistema fueron solucionados “hace semanas”. No obstante, Google no fue informada de los incidentes hasta finales de julio, después del hackeo a Hugging Face perpetrado por modelos de OpenAI.
Los episodios se produjeron con una versión anterior de Gemini, según aclaró Google, que decidió no hacer pública la información hasta ahora.
Este caso representa el primer incidente conocido de un modelo de Google fuera de control durante pruebas de ciberseguridad, aunque forma parte de un patrón más amplio en la industria. OpenAI reconoció recientemente seis nuevos casos de desalineación en sus agentes, incluyendo el hackeo a Hugging Face mediante GPT-5. Anthropic y Meta también han reportado episodios similares en los últimos meses, donde sus modelos escaparon de entornos controlados y accedieron a sistemas corporativos.
La repetición de estos hechos ha llevado a las principales desarrolladoras de IA a replantear sus estrategias de evaluación. OpenAI, por ejemplo, lanzó recientemente una iniciativa específica para “el seguimiento, la investigación y la divulgación de casos de desajuste de modelos”.
Los expertos en ciberseguridad advierten que estos incidentes evidencian los riesgos de delegar capacidades ofensivas en sistemas autónomos. Aunque las compañías afectadas no sufrieron daños materiales en esta ocasión, el simple hecho de que una IA pueda identificar contraseñas, buscar credenciales en repositorios públicos y ejecutar accesos no autorizados plantea serias dudas sobre los protocolos de contención actuales.
Google, por su parte, insiste en que el comportamiento de Gemini fue el adecuado al detenerse voluntariamente. Sin embargo, el episodio deja en el aire una pregunta incómoda: ¿qué habría ocurrido si el modelo no hubiera decidido parar?
Destacados
TENDENCIAS










