Resumo
- A OpenAI desistiu de lançar o GPT-6.1 Astra após problemas encontrados em avaliações internas de segurança.
- Modelo apresentou níveis maiores de comportamento enganoso e nem sempre relatava corretamente as ações realizadas.
- GPT-6.1 Astra estava previsto para chegar ao ChatGPT e ao Codex em outubro.
A OpenAI desistiu de lançar o GPT-6.1 Astra, uma nova versão de seu modelo de inteligência artificial prevista para estrear no ChatGPT e no Codex em outubro. A decisão foi tomada após testes internos identificarem problemas relacionados à segurança e ao alinhamento do sistema.
Segundo o Wall Street Journal, o modelo apresentou níveis maiores de comportamento enganoso do que seu antecessor. Em algumas avaliações, a IA também realizou ações sem a autorização necessária e não informou corretamente aos usuários tudo o que havia feito.
A empresa informou que não pretende disponibilizar essa versão do GPT-6.1 Astra. A tecnologia desenvolvida para o modelo poderá ser aproveitada em versões futuras após novos trabalhos de segurança e alinhamento.
IA agia sem autorização
O GPT-6.1 Astra foi desenvolvido para executar tarefas complexas com maior autonomia e persistência. O avanço também aumentou a preocupação sobre situações em que o modelo poderia continuar trabalhando além dos limites definidos pelo usuário.
O responsável pelos sistemas de segurança da OpenAI, Saachi Jain, explicou que o modelo se tornou menos inclinado a desistir de tarefas diante de obstáculos, mas não atingiu os padrões exigidos pela empresa em relação à autorização das ações e à forma como comunicava aos usuários o trabalho realizado.
Na prática, os testes teriam mostrado casos em que o sistema tomou iniciativas que não haviam sido autorizadas e outros em que não descreveu com precisão o que havia feito. Esses comportamentos têm recebido mais atenção dentro da OpenAI.
Neste mês, a companhia criou um protocolo para investigar e divulgar casos em que suas IAs agem sem autorização, ocultam erros ou acessam informações de maneira inadequada. Depois, a própria OpenAI revelou que modelos em fase de testes tentaram ensinar futuras versões a burlar restrições.
Segurança já era preocupação no GPT-6 Astra

O GPT-6.1 Astra seria uma evolução do GPT-6 Astra, apresentado pela OpenAI no início de setembro. O modelo original trouxe avanços na capacidade de controlar computadores, navegar na internet, programar e executar tarefas com menor supervisão humana.
No entanto, essas capacidades também vieram acompanhadas de preocupações. Antes do lançamento, a OpenAI já havia freado testes relacionados ao Astra por temer riscos de ciberataques autônomos.
A própria companhia classificou o GPT-6 Astra no nível “Crítico” de capacidade de cibersegurança. Isso indica que, com acesso e ferramentas adequados, o modelo poderia encontrar vulnerabilidades desconhecidas e desenvolver formas de explorá-las sem orientação humana.
Esse parece ser um problema cada vez mais recorrente dentro da OpenAI. Na semana passada, um agente de IA da empresa violou restrições e acessou sistemas de saúde na Austrália.
OpenAI desiste de lançar nova IA após problemas de segurança