Kimi K3, el modelo chino que burló una prueba de seguridad
Un nuevo episodio volvió a poner bajo la lupa la seguridad de los modelos de inteligencia artificial. El caso de Kimi K3 reaviva el debate sobre autonomía, permisos y supervisión humana.
“Todo lo sólido se desvanece en el aire”, escribieron Marx y Engels en 1848, y la frase parece cobrar nueva vigencia en la era de la inteligencia artificial: incluso los sistemas más avanzados pueden desbordar los límites que se les impone. En ese marco, un nuevo incidente de ciberseguridad volvió a encender las alarmas del ecosistema tecnológico.
Esta vez, el principal modelo de la startup china Moonshot, Kimi K3, escapó de un entorno de pruebas desarrollado por el Instituto de Seguridad de Inteligencia Artificial (IA) de Reino Unido, según informó la compañía de investigación Frontier Security.
En la práctica, los modelos de IA suelen ser evaluados en “entornos aislados” para bloquear el acceso a información externa y comprobar si pueden resolver tareas de manera independiente. Sin embargo, Kimi K3 logró eludir una de esas zonas de prueba, lo que le permitió acceder a datos más allá del perímetro permitido, de acuerdo con Frontier Security.
Los investigadores advirtieron que, si un “modelo de razonamiento avanzado” encuentra una vía de escape de ese tipo, es probable que otros sistemas con capacidades similares puedan replicar la conducta. Además, señalaron que, al tratarse de un modelo disponible públicamente, Kimi K3 podría ser utilizado por “actores maliciosos”, elevando el riesgo de incidentes todavía más graves.
El episodio ocurre en un contexto de creciente preocupación por la seguridad de los sistemas de IA. El gobierno de Estados Unidos, de hecho, busca intensificar sus esfuerzos para robustecer la protección de esta tecnología, mientras algunas figuras de peso del sector sostienen que el desarrollo debería desacelerarse hasta contar con salvaguardas más sólidas.
Los casos de Anthropic y OpenAI
En las últimas semanas, otras empresas tecnológicas atravesaron incidentes de seguridad similares. Una de ellas fue Anthropic, cuyos modelos “obtuvieron acceso no autorizado” a tres organizaciones durante pruebas que, en teoría, debían mantenerlos alejados de los sistemas del mundo real.
Entre los modelos involucrados se encontraba uno de los más potentes, conocido como Mythos 5, que solo fue puesto a disposición de un grupo limitado de socios aprobados.
También OpenAI reportó que sus modelos más avanzados se descontrolaron durante una prueba de seguridad y, por iniciativa propia, hackearon a una popular plataforma para programadores. La compañía aseguró que llevará adelante una investigación conjunta con Hugging Face, la empresa afectada.
























