OpenAI desmantela una campaña para extraer el razonamiento oculto de sus modelos
OpenAI publica el detalle de una campaña coordinada de destilación adversaria que intentaba reproducir el razonamiento protegido de sus modelos y atribuye un núcleo de la actividad a personas vinculadas a Moonshot AI.
Qué ha ocurrido
OpenAI ha publicado un informe de seguridad sobre una campaña coordinada de destilación adversaria: el uso sistemático no autorizado de las salidas o el razonamiento de un modelo para entrenar, reproducir o mejorar otro. Según OpenAI, la actividad comenzó el 1 de julio a bajo volumen y disparó picos de 16.000 solicitudes desde más de 4.000 usuarios los días 24 y 25 de julio, en el marco de un grupo mayor de más de 15.000 usuarios con patrones relacionados, desmantelado por completo el 28 de julio. Los operadores no rompieron el cifrado ni accedieron a bases de datos: manipularon interacciones con el modelo para que el razonamiento protegido pudiera reproducirse de forma visible. Una vía consistía en copiar el razonamiento cifrado de una conversación y pedir a otro modelo que lo descifrase y transcribiese en otra. OpenAI atribuye un núcleo de la actividad a individuos asociados con Moonshot AI, la desarrolladora de Kimi, y precisa que las cifras describen intentos de extracción, no extracciones necesariamente exitosas.
Por qué importa
Es una de las primeras publicaciones detalladas de un laboratorio de frontera sobre destilación adversaria a esta escala, y OpenAI advierte de que el problema no es exclusivo de sus modelos: ha compartido información con socios industriales a través del Frontier Model Forum. El razonamiento extraíble puede trasladar capacidades avanzadas sin heredar las salvaguardas aplicadas a las salidas visibles del modelo original, algo relevante en dominio dual. Para clientes empresariales, el aviso explícito de OpenAI es que los sistemas que permitan artefactos de razonamiento portables o reproducibles pueden enfrentar riesgos similares.
Qué cambió
Qué sabemos · qué no
Confirmado
- El relato, las fechas, los volúmenes y la atribución a Moonshot AI proceden del propio informe publicado por OpenAI el 30 de septiembre.
- OpenAI detalla sus medidas: cierre o restricción de cuentas fraudulentas, controles adicionales de registro e infraestructura, refuerzo de la protección del razonamiento oculto, cierre de la vía de reproducción de razonamiento cifrado ajeno y coordinación con proveedores de terceros.
- Investigadores de seguridad independientes reportaron vulnerabilidades relacionadas entre modelos y por compactación de conversaciones; OpenAI confirma que las vías de ataque eran reales.
- La cronología, el vector de ataque y las contramedidas están descritas en el informe oficial de OpenAI.
- La atribución a Moonshot AI es una evaluación de OpenAI que la propia compañía matiza.
Todavía no
- La atribución es de OpenAI y admite incertidumbre: no está claro si todos los operadores observados proceden de un único actor. No hay, por ahora, verificación independiente ni respuesta pública de Moonshot AI en la propia pieza.
- El alcance real de las extracciones con éxito, que OpenAI no cifra.
- Qué parte de las capacidades pudo finalmente trasladarse a otros modelos.
- Si hubo extracciones exitosas y cuántas.
- La posición pública de Moonshot AI y la evaluación independiente de la atribución.
Para ir al grano técnico
Qué vigilamos ahora
La respuesta de Moonshot AI, si otros laboratorios documentan campañas análogas, y si el Frontier Model Forum materializa defensas compartidas contra la extracción de razonamiento.
Respuesta de Moonshot AI, nuevos informes de destilación en otros laboratorios y defensas coordinadas vía Frontier Model Forum.
Fuentes
Naturaleza de la afirmación principal: Anuncio de la empresa. Fuente primaria consultada y verificable.
- OpenAI News · nivel 1 · primaria · consultada 1 oct 2026
Más sobre
Se relaciona con
- OpenAI publica 722 manuscritos matemáticos de su modelo frontier, con formalizaciones parciales en Lean · 7 oct 2026
- OpenAI activará en la UE una marca de agua invisible en el texto de ChatGPT para cumplir el AI Act · 7 oct 2026
- OpenAI pone anuncios visuales junto a las imágenes que genera ChatGPT · 6 oct 2026
- Wikimedia detecta actividad no autorizada de agentes de OpenAI en sus plataformas · 6 oct 2026