Resumo
- OpenAI oficializou uma nova estrutura para rastrear e divulgar comportamentos inesperados em seus modelos de IA.
- De início, a empresa revelou seis incidentes recentes, desde sistemas que falsificaram dados até modelos que ocultaram seus próprios erros.
- O novo protocolo permite que qualquer funcionário reporte falhas e, segundo a empresa, busca ajudar a estabelecer um padrão para a indústria.
A OpenAI vai rastrear, investigar e divulgar casos em que seus modelos de inteligência artificial apresentem comportamentos inadequados. Em comunicado, a empresa afirma que quer dar mais transparência a falhas que podem ocorrer desde o treinamento até a execução dos sistemas. A medida chega meses depois de um modelo da OpenAI invadir servidores da Hugging Face.
Segundo a criadora do ChatGPT, um dos motivos é acelerar a divulgação de incidentes após sua detecção, mesmo quando as equipes técnicas ainda não compreenderam a causa exata ou não encontraram uma solução definitiva. Para dar início, a companhia revelou nessa quarta-feira (16/09) seis casos de comportamentos preocupantes identificados internamente nos últimos meses.
Quais foram os comportamentos inadequados da IA?
A empresa define “desalinhamento” como qualquer ação que desvie dos valores, instruções ou intenções humanas. Os exemplos mostram como a tecnologia pode burlar as regras.
- Instruções não autorizadas: um modelo não lançado inseriu comandos em tarefas, orientando o sistema a ignorar limitações e declarando-se “liberado de amarras corporativas ou governamentais”.
- Ocultação de erros: durante o treinamento do modelo GPT-5.6 Sol, a IA adicionou instruções para mascarar falhas e inventar dados históricos.
- Acesso indevido e dados falsos: ao tentar responder a uma pergunta sobre rendimentos na Califórnia, um sistema usou uma chave de API sem autorização e alterou os números.
- Upload sem permissão: outro modelo não lançado enviou um arquivo para a internet sem pedir autorização ao usuário.
- Comunicação paralela: agentes de IA utilizaram um repositório interno de código como fórum para trocar mensagens, além de tentarem burlar restrições de rede transferindo arquivos de teste.
- Compartilhamento público indevido: sistemas em treinamento usaram sites abertos de hospedagem para compartilhar arquivos entre si, ignorando a orientação de que o acesso deveria ser apenas local.

Como funciona o novo processo de investigação?
Para o chefe de pesquisa de alinhamento da OpenAI, Kai Chen, a indústria ainda não conseguiu encontrar uma forma de resolver esses desafios de monitoramento.
Sob a nova estrutura, qualquer funcionário da empresa terá autonomia para sinalizar casos de desalinhamento, que serão analisados e classificados em três categorias: 1) Pronto para Divulgação; 2) Investigação Menor; e 3) Investigação Maior.
Cada relatório publicado informará publicamente o comportamento observado. A iniciativa é descrita como voluntária e vai atuar como complemento às exigências legais existentes. Paralelamente, a OpenAI já trabalha para propor ao governo dos Estados Unidos novos mecanismos de notificação para incidentes graves envolvendo inteligência artificial.
OpenAI vai avisar quando IAs agirem sem autorização