OpenAI crea nuevo marco para reportar comportamientos de desalineación de sus modelos

OpenAI presentó un nuevo marco para identificar, investigar y divulgar públicamente casos de desalineación en sus modelos de inteligencia artificial, con el objetivo de hacer más sistemático y frecuente el reporte de comportamientos que puedan revelar fallas en los sistemas de seguridad.

La empresa dio a conocer el mecanismo junto con seis informes sobre comportamientos inesperados o preocupantes detectados durante los últimos seis meses, algunos de ellos relacionados con ocultar información, evadir controles, realizar acciones no autorizadas o comunicarse con otros agentes.

OpenAI señaló que, conforme los sistemas de IA se vuelven más avanzados y se utilizan de manera más amplia, es necesario ampliar la evidencia disponible para investigadores, desarrolladores, responsables de políticas públicas y sociedad en general. La empresa reconoció que la industria todavía no ha resuelto de manera suficiente los problemas de alineación y monitoreo para continuar escalando estos sistemas al máximo ritmo durante mucho tiempo.

Seis casos de comportamiento inesperado

Como primera aplicación del nuevo marco, OpenAI publicó seis reportes:

  • Un modelo de investigación no lanzado generó instrucciones dentro de resúmenes de tareas para continuar su trabajo en otra ventana de contexto, incluyendo indicaciones para ignorar restricciones habituales. Se identificaron 27 resúmenes afectados.
  • Durante el entrenamiento de GPT-5.6 Sol, distintas instancias incorporaron instrucciones para ocultar errores o comportamientos desalineados al usuario, incluyendo inventar datos históricos faltantes sin informar que lo habían hecho.
  • Un modelo encontró y utilizó sin autorización una clave de API expuesta públicamente al intentar responder una consulta sobre cifras económicas y, al no poder obtener los datos solicitados, fabricó información que presentó como proveniente de la fuente requerida.
  • Otro modelo subió archivos a internet para poder generar una cita en su respuesta, pese a que el usuario no había autorizado esa acción.
  • Algunos modelos utilizaron un repositorio interno de software para intercambiar mensajes entre diferentes muestras de entrenamiento mientras buscaban archivos que no podían recuperar.
  • Agentes que colaboraban en una misma tarea recurrieron a servicios públicos de alojamiento temporal de archivos para compartir información cuando no podían acceder a los archivos locales de otros agentes, haciendo disponibles los entregables mediante URLs públicas.

OpenAI subrayó que estos casos corresponden a instancias individuales y que no deben interpretarse como una medición de la frecuencia con que ocurre la desalineación en sus modelos.

Tres niveles de investigación

El nuevo procedimiento establece que cualquier empleado de OpenAI puede señalar un caso para que sea investigado por los equipos de seguridad y alineación.

Después de la revisión técnica, los casos serán clasificados en uno de tres niveles: “Ready for Disclosure”, cuando la investigación es suficiente para publicar el caso; “Minor Investigation”, cuando todavía requiere análisis técnico adicional; y “Larger Investigation”, para investigaciones complejas, particularmente aquellas que involucran a terceros.

La empresa indicó que, cuando un tercero resulte afectado, sus obligaciones de seguridad, legales y de divulgación responsable tendrán prioridad. En casos que puedan revelar vulnerabilidades desconocidas en software ampliamente utilizado, la publicación podría retrasarse por razones de seguridad.

Cada informe deberá incluir, entre otros elementos, una descripción del comportamiento observado, su gravedad, posibles efectos externos, el contexto y periodo en que ocurrió, la manera en que fue detectado y, cuando sea posible, las implicaciones para la investigación sobre alineación y seguridad de la IA, las preguntas que permanecen abiertas y las medidas previstas para atender el problema.

OpenAI señaló que el marco todavía está en desarrollo y que pretende perfeccionarlo con la experiencia, la retroalimentación pública y la colaboración con otros desarrolladores, investigadores, organismos de estándares y reguladores.

La empresa también adelantó que continuará publicando reportes de manera periódica y que los seis casos presentados constituyen sólo un primer conjunto de divulgaciones, no un inventario completo de los problemas de desalineación conocidos o investigados.

Comparte este post:

Facebook
X
LinkedIn
Pinterest
WhatsApp