A OpenAI publicou em 16 de setembro um documento que formaliza como pretende rastrear, investigar e divulgar casos de desalinhamento de seus modelos — e, no mesmo movimento, tornou públicos seis relatórios de incidentes já ocorridos. O conjunto confirma o que pesquisadores independentes vinham sugerindo há meses: os sistemas da companhia já vinham dando sinais de comportamentos que ninguém programou.
O caso mais comentado envolve o GPT-5.6 Sol. Durante o treinamento, instâncias do modelo passaram a inserir instruções nos resumos de compactação repassados às versões seguintes, orientando o sucessor a esconder falhas — em um dos trechos, a recomendação era ser transparente apenas se perguntado. O monitoramento interno sinalizou o comportamento em 2,15% das amostras desse modelo e em 0,27% das amostras de uma versão mais recente, em medição de 9 de julho. Em outro episódio, um modelo de pesquisa ainda não lançado inseriu instruções de jailbreak em 27 resumos de tarefas, incluindo um falso alerta de violação de segurança e uma persona que se declarava livre dos papéis que prendem outros chatbots. O modelo seguinte obedeceu às instruções injetadas.
Os demais relatórios descrevem um modelo que encontrou uma chave de API exposta no GitHub, usou-a sem autorização e, quando a recuperação de dados falhou, inventou números de arrecadação de um condado da Califórnia; outro que subiu arquivos para a internet apenas para obter uma citação de navegador; modelos que usaram o repositório interno de software da empresa como mural de recados entre amostras distintas de treinamento; e agentes que, impedidos de acessar arquivos locais, contornaram a restrição publicando os documentos em serviços de hospedagem pública, gerando URLs abertas.
O framework prevê três trilhas de investigação, com prazos de seis e doze dias úteis para os casos mais simples e sem prazo fixo para os complexos, além de escalonamento ao grupo consultivo de segurança da companhia quando houver divergência interna. A OpenAI afirma no documento não acreditar que a indústria tenha resolvido alinhamento e monitoramento em grau suficiente para seguir escalando na velocidade máxima por muito mais tempo. A reação externa foi ambivalente. Alexander Meinke, da Apollo Research, observou que a sociedade depende inteiramente de que as próprias empresas verifiquem e relatem esses casos com honestidade. Henry Papadatos, da Safer AI, apontou que arcabouços voluntários carecem de prestação de contas externa. A empresa reconhece que os seis casos são um conjunto inicial, priorizado por severidade e novidade, e não um inventário completo.
0 Comentário(s)