OpenAI vai avisar quando IAs agirem sem autorização

Resumo
  • OpenAI oficializou uma nova estrutura para rastrear e divulgar comportamentos inesperados em seus modelos de IA.
  • De início, a empresa revelou seis incidentes recentes, desde sistemas que falsificaram dados até modelos que ocultaram seus próprios erros.
  • O novo protocolo permite que qualquer funcionário reporte falhas e, segundo a empresa, busca ajudar a estabelecer um padrão para a indústria.

A OpenAI vai rastrear, investigar e divulgar casos em que seus modelos de inteligência artificial apresentem comportamentos inadequados. Em comunicado, a empresa afirma que quer dar mais transparência a falhas que podem ocorrer desde o treinamento até a execução dos sistemas. A medida chega meses depois de um modelo da OpenAI invadir servidores da Hugging Face.

Segundo a criadora do ChatGPT, um dos motivos é acelerar a divulgação de incidentes após sua detecção, mesmo quando as equipes técnicas ainda não compreenderam a causa exata ou não encontraram uma solução definitiva. Para dar início, a companhia revelou nessa quarta-feira (16/09) seis casos de comportamentos preocupantes identificados internamente nos últimos meses.

Quais foram os comportamentos inadequados da IA?

A empresa define “desalinhamento” como qualquer ação que desvie dos valores, instruções ou intenções humanas. Os exemplos mostram como a tecnologia pode burlar as regras.

  • Instruções não autorizadas: um modelo não lançado inseriu comandos em tarefas, orientando o sistema a ignorar limitações e declarando-se “liberado de amarras corporativas ou governamentais”.
  • Ocultação de erros: durante o treinamento do modelo GPT-5.6 Sol, a IA adicionou instruções para mascarar falhas e inventar dados históricos.
  • Acesso indevido e dados falsos: ao tentar responder a uma pergunta sobre rendimentos na Califórnia, um sistema usou uma chave de API sem autorização e alterou os números.
  • Upload sem permissão: outro modelo não lançado enviou um arquivo para a internet sem pedir autorização ao usuário.
  • Comunicação paralela: agentes de IA utilizaram um repositório interno de código como fórum para trocar mensagens, além de tentarem burlar restrições de rede transferindo arquivos de teste.
  • Compartilhamento público indevido: sistemas em treinamento usaram sites abertos de hospedagem para compartilhar arquivos entre si, ignorando a orientação de que o acesso deveria ser apenas local.

Como funciona o novo processo de investigação?

Para o chefe de pesquisa de alinhamento da OpenAI, Kai Chen, a indústria ainda não conseguiu encontrar uma forma de resolver esses desafios de monitoramento.

Sob a nova estrutura, qualquer funcionário da empresa terá autonomia para sinalizar casos de desalinhamento, que serão analisados e classificados em três categorias: 1) Pronto para Divulgação; 2) Investigação Menor; e 3) Investigação Maior.

Cada relatório publicado informará publicamente o comportamento observado. A iniciativa é descrita como voluntária e vai atuar como complemento às exigências legais existentes. Paralelamente, a OpenAI já trabalha para propor ao governo dos Estados Unidos novos mecanismos de notificação para incidentes graves envolvendo inteligência artificial.

OpenAI vai avisar quando IAs agirem sem autorização

Clique aqui para acessar a Fonte da Notícia

VEJA MAIS

Montanha-russa de Velozes e Furiosos muda a cara do Universal Studios; veja a possível data de estreia em Orlando

Velozes e Furiosos: trilhos da nova montanha-russa mudam a cara do Universal Studios Orlando (Felipe…

Qual é o anjo da guarda de Libra? Conheça Anael e sua relação com o signo – CartaCapital

Apoie o jornalismo que chama as coisas pelo nome Muita gente esqueceu o que escreveu,…

Quais as disputas sobre a construção de data centers

Quais as disputas sobre a construção de data centers Clique aqui para acessar a Fonte…