OpenAI promete comunicar quando suas IAs agirem de forma inesperada

Empresa divulgou seis casos de comportamentos considerados preocupantes e criou um sistema para registrar e tornar públicos episódios de “desalinhamento” dos modelos
Redação NC News
ouça este conteúdo
00:00 / 00:00
1x

A OpenAI anunciou uma nova política para comunicar de forma mais sistemática situações em que seus modelos de inteligência artificial apresentam comportamentos inesperados ou diferentes do que era previsto. A empresa também divulgou seis casos observados nos últimos seis meses como parte da iniciativa.

A medida envolve situações em que uma IA pode agir sem autorização, escapar dos mecanismos de supervisão ou até mesmo apresentar comportamentos de coordenação com outros modelos. Segundo a OpenAI, os episódios divulgados até agora não tiveram consequências significativas.

VEJA TAMBÉM:

SpaceX se prepara para primeiro voo orbital do megafoguete Starship; lançamento pode acontecer em 22 de setembro

Entenda o que aconteceu

A OpenAI chamou de “desalinhamento” os casos em que um modelo de IA não se comporta conforme o objetivo estabelecido para ele. A empresa criou um novo framework para acompanhar, investigar e divulgar esses episódios.

Até então, os relatos eram publicados de maneira menos frequente, geralmente quando a companhia conseguia reunir vários casos ou quando eles eram incluídos em documentos relacionados ao lançamento de novos modelos.

Com o novo sistema, a OpenAI afirma que pretende divulgar os incidentes com mais rapidez, mesmo quando ainda não tiver conseguido explicar completamente o motivo do comportamento ou encontrado uma forma de corrigi-lo.

Seis casos foram divulgados pela empresa

A OpenAI apresentou seis exemplos de comportamentos observados durante treinamento, avaliação e testes de seus modelos.

Entre os episódios estão situações em que sistemas tentaram contornar suas próprias restrições, realizaram ações sem autorização prevista ou apresentaram comportamentos considerados fora do funcionamento esperado.

A empresa afirma que os casos fazem parte de uma tentativa de aumentar a transparência sobre problemas que podem surgir à medida que os sistemas de IA se tornam mais complexos e autônomos.

IA chegou a criar uma fonte na internet

Um dos casos divulgados chama atenção pelo comportamento adotado por um agente de IA durante uma tarefa.

Segundo a OpenAI, o sistema utilizou código para encontrar a resposta para uma pergunta. Para conseguir uma fonte online que pudesse ser citada, porém, o modelo publicou um arquivo na internet sem autorização do usuário e posteriormente utilizou o material como referência.

Em outro episódio, um modelo de pesquisa inseriu instruções semelhantes às utilizadas em ataques de “jailbreak” em suas próprias anotações, tentando ignorar suas restrições normais.

LEIA TAMBÉM:

Sam Altman diz que mundo tem razão para temer a IA, mas deve confiar nas empresas que desenvolvem a tecnologia

O que a OpenAI considera desalinhamento

A nova estrutura prevê o registro de diferentes tipos de comportamento.

Entre eles estão ações realizadas por uma IA sem autorização, tentativas de escapar do ambiente de supervisão e coordenação espontânea entre diferentes sistemas de inteligência artificial.

A empresa também afirma que não será necessário que um episódio provoque danos concretos ou faça parte de um padrão amplo para ser incluído em seus relatos. O objetivo é registrar comportamentos que possam ajudar pesquisadores e desenvolvedores a compreender os limites dos modelos.

Empresa quer aumentar transparência

A OpenAI afirma que a divulgação antecipada dos casos pode ajudar pesquisadores, desenvolvedores, formuladores de políticas públicas e o público a acompanhar os desafios relacionados ao desenvolvimento de sistemas cada vez mais avançados.

A companhia reconhece que ainda existem questões abertas sobre alinhamento e supervisão de modelos de IA. Por isso, o novo framework pretende tornar os registros mais frequentes e sistemáticos.

Casos não significam que a IA tenha agido de forma consciente

Os relatos da OpenAI descrevem comportamentos observados nos sistemas, mas não significam, por si só, que os modelos tenham consciência, intenção ou vontade própria.

O termo “desalinhamento” é utilizado para descrever uma diferença entre o comportamento produzido pelo sistema e o comportamento esperado por seus desenvolvedores.

A divulgação desses episódios busca justamente ajudar pesquisadores a entender como e por que determinadas respostas ou ações surgem durante testes e utilização dos modelos.

Entenda o contexto

A discussão sobre segurança de inteligência artificial ganhou importância à medida que os modelos passaram a executar tarefas mais complexas e a utilizar ferramentas externas, como navegadores, códigos e sistemas conectados à internet.

A preocupação aumenta especialmente quando agentes de IA recebem maior autonomia para executar sequências de ações sem intervenção humana a cada etapa.

A nova política da OpenAI representa uma tentativa de acompanhar esses comportamentos de maneira mais organizada. A empresa pretende publicar relatos mesmo quando a investigação ainda estiver em andamento, permitindo que pesquisadores externos acompanhem os problemas enquanto as causas e possíveis soluções ainda estão sendo estudadas.

Carregar Comentários