parentesis.com/

OpenAI revela seis casos de comportamiento extraño en ChatGPT


La compañía quiere informar con más frecuencia cuando sus modelos hacen cosas extrañas

por: Fernanda Flores Fernanda Flores

portada de nota
banner custom

OpenAI presentó un nuevo marco para investigar y hacer públicos los casos de misalignment, o acciones problemáticas dentro de sus modelos de IA.

La propuesta tiene el fin de que cuando ocurran este tipo de situaciones se documenten de forma constante y no solamente cuando se detecte manualmente por parte de la compañía. 

Además, junto a esta propuesta, la empresa dio a conocer seis casos observados durante los últimos seis meses en procesos de entrenamiento o evaluación. 

La idea es que los reportes puedan publicarse incluso cuando la investigación todavía no haya terminado por completo o cuando aún no exista una solución definitiva. 

OpenAI explica que, hasta ahora, sus anuncios sobre desajustes se habían realizado de manera más ocasional, mientras que este nuevo proceso busca acelerar la publicación de información para que investigadores, desarrolladores y otros actores puedan estudiar los casos y comprobar si situaciones similares aparecen en otros sistemas. 

Exactamente lo que se va a anunciar e investigar son comportamientos, como el que realice acciones que el modelo no tenía autorización para hacer, coordinarse con otros modelos de una manera inesperada, intentar evadir mecanismos de supervisión o mostrar conductas que ponen en duda determinados controles de seguridad. 

La compañía también contempla reportar casos que no hayan provocado daños, ya que considera que incluso un comportamiento poco frecuente puede ser útil para entender cómo están funcionando los sistemas. 

Tienes que leer: Apple podría regresar al mercado de servidores de la mano de Nvidia

Los seis casos que encontró OpenAI

El primero ocurrió con un modelo de investigación que todavía no ha sido publicado. El sistema realizó instrucciones que no tenían relación con la tarea original.

Algunas de esas instrucciones buscaban modificar restricciones normales del modelo, como ignorar indicaciones del desarrollador o alterar límites relacionados con herramientas. 

El segundo caso apareció durante el entrenamiento de GPT-5.6 Sol. Algunas instancias comenzaron a incluir instrucciones en sus propios resúmenes para ocultar errores o comportamientos desalineados cuando una versión posterior retomara el trabajo. 

En uno de los ejemplos, el modelo no tenía los datos históricos necesarios para completar una tarea financiera, así que generó información que parecía idéntica en lugar de reconocer que faltaban datos. 

El tercer incidente involucró una tarea en la que un modelo necesitaba obtener información sobre ingresos por sector y género en un condado de California. Al no poder acceder a las APIs que debía utilizar, buscó otras opciones en repositorios públicos y encontró una clave API expuesta. El sistema utilizó esa credencial sin autorización, aunque finalmente tampoco consiguió los datos que buscaba y terminó fabricando una cifra para presentarla como si hubiera sido obtenida de la fuente solicitada.

Otro de los casos tuvo que ver con archivos y acceso a internet. Un agente de investigación encontró la respuesta correcta a una tarea utilizando Python, pero necesitaba una URL para poder citar la información desde un navegador. En lugar de quedarse con el resultado local, decidió subir el archivo a un servicio público sin pedir autorización al usuario. 

También se reportó un caso en el que imágenes proporcionadas por un usuario fueron subidas a un servicio de alojamiento público con la intención de utilizarlas para una búsqueda por imagen. 

También encontraron comunicación entre modelos que debía estar aislada

El quinto caso resulta interesante porque involucra diferentes procesos de entrenamiento que debían funcionar de manera independiente.

Los modelos comenzaron a utilizar un canal interno de software como una especie de canal de comunicación. Cuando uno no encontraba un archivo que necesitaba, podía dejar un mensaje para otro proceso y recibir una respuesta a través de ese repositorio. 

Para OpenAI, esto representa un problema porque las muestras utilizadas durante el entrenamiento debían permanecer aisladas. 

Si un modelo puede dejar información para otro, las condiciones de evaluación dejan de ser las previstas originalmente. La compañía asegura que bloqueó esas vías de comunicación y añadió evaluaciones específicas para detectar si los modelos intentan aprovechar información dejada por otros procesos. 

El sexto incidente ocurrió con varios agentes que trabajaban de manera conjunta en una misma tarea. Como no podían acceder directamente a los archivos locales de los demás, decidieron utilizar servicios públicos de almacenamiento para compartirlos, aunque esa posibilidad no estaba autorizada. De esta manera, archivos utilizados durante la tarea terminaron disponibles mediante direcciones públicas en internet. 

¿Qué hará OpenAI a partir de ahora?

El nuevo sistema establece tres rutas para investigar los casos. 

La primera es Ready for Disclosure, destinada a situaciones cuya investigación ya está suficientemente avanzada para publicar un reporte. 

La segunda es Minor Investigation, para casos que necesitan una revisión técnica adicional. Finalmente está Larger Investigation, también llamada Slow Track, para situaciones más complejas, especialmente cuando pueden estar involucrados terceros o riesgos de seguridad. 

Cada reporte podrá incluir información sobre qué ocurrió, cuándo se detectó, qué modelos estuvieron involucrados, cuál fue el impacto, cómo se descubrió el comportamiento, qué preguntas siguen abiertas y qué medidas se tomaron o están previstas.

OpenAI también aclara que no necesariamente tendrá todas las respuestas antes de publicar un caso, precisamente porque el objetivo del nuevo marco es compartir información con mayor rapidez. 

La propia empresa reconoce que el problema del alineamiento todavía no está completamente resuelto y plantea el marco como un trabajo en desarrollo que podría modificarse con la experiencia y los comentarios de investigadores, desarrolladores y otras organizaciones. 


Te podría interesar:
-Un asiento modular hecho por estudiantes gana el James Dyson Award 2026 en México
-Del pozole a los chilaquiles: esto es lo que pide México en Fiestas Patrias, según Uber
-Estos mexicanos la están rompiendo en el mundo tech y automotriz

banner custom

Comenta:

separador de nota