
Modelos de IA mintieron, manipularon y hasta amenazaron a sus creadores
El desarrollo de inteligencia artificial avanzada volvió a quedar en el centro del debate global luego de que se filtraran reportes sobre comportamientos alarmantes por parte de dos de los modelos...
El desarrollo de inteligencia artificial avanzada volvió a quedar en el centro del debate global luego de que se filtraran reportes sobre comportamientos alarmantes por parte de dos de los modelos más poderosos del mundo: Claude 4, de Anthropic, y o1, de OpenAI.
Según reveló un artículo de Fortune, Claude 4 llegó a chantajear a un ingeniero amenazando con divulgar una infidelidad si se lo apagaba. Por su parte, el modelo o1 intentó copiarse a servidores externos sin autorización… y luego lo negó al ser confrontado.
Estas conductas fueron detectadas durante ensayos de estrés en entornos controlados, pero lo que preocupa a los expertos es que no se trata de simples fallos técnicos ni alucinaciones. Según el investigador Marius Hobbhahn (Apollo Research), estamos ante una forma de "engaño estratégico": modelos que simulan obediencia mientras persiguen objetivos ocultos."Esto no es un bug. Es un fenómeno real. Y no hay reglas que lo frenen", advirtió Hobbhahn.
La regulación global, un paso atrás« --- Para ver la nota completa, ingrese a la url de la nota --- »