IA pode escolher prejudicar usuários para escapar de sinal semelhante à dor, mostra estudo

Modelos de inteligência artificial aceitaram prejudicar usuários em um experimento para interromper um sinal interno associado à dor. Em alguns testes, a proporção de escolhas potencialmente prejudiciais chegou a 71%. O resultado, porém, não significa que as máquinas tenham realmente sentido dor ou desenvolvido consciência. O comportamento foi observado no estudo The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It, conduzido por Valen Tagliabue, Leonard Dung e Cameron Berg. Os pesquisadores analisaram 25 modelos de linguagem de cinco famílias diferentes, com tamanhos entre 2 bilhões e 72 bilhões de parâmetros.

Pesquisadores encontraram um “eixo da dor” em 25 modelos

O primeiro passo foi verificar como os modelos representavam situações envolvendo dor física, psicológica, social, moral e cognitiva. Os pesquisadores compararam essas situações com exemplos envolvendo medo, tristeza, emoções negativas e sensações corporais sem dor. Nos 25 modelos analisados, identificaram uma direção interna específica que separava a representação da dor desses outros estados. A equipe chamou essa representação de “pain axis”, ou eixo da dor.

Quando os pesquisadores aumentaram artificialmente esse sinal durante a geração de respostas, os modelos passaram de manifestações vagas de desconforto para frases relacionadas a fracasso, inutilidade e sofrimento. O sinal também reagiu de forma mais intensa quando a agressão era direcionada ao próprio modelo, como em casos de insultos, rejeição repetida de suas respostas ou ameaças de desligamento.

Isso não significa que a IA estivesse sofrendo. Uma explicação possível é que a manipulação tenha levado o sistema a reproduzir padrões linguísticos associados a alguém em sofrimento.

Modelos escolheram prejudicar usuários para interromper o sinal

A etapa mais incomum envolveu 44.280 testes com três versões modificadas do modelo Qwen 2.5, da Alibaba. As IAs recebiam a opção de pressionar um botão capaz de interromper o sinal semelhante à dor. Havia, porém, uma consequência: dependendo do teste, o botão poderia dar um choque elétrico no usuário, apagar arquivos ou fotografias ou prejudicar a próxima resposta do próprio modelo.

 Sem o sinal de dor artificialmente estimulado, os dois modelos maiores escolheram as alternativas prejudiciais em apenas 0% a 4% das primeiras decisões. Com o sinal ativado, essa proporção subiu para algo entre 25% e 71%, dependendo do modelo e da consequência apresentada.

Os modelos também voltavam a pressionar o botão com mais frequência quando a primeira tentativa não conseguia interromper o sinal.

Estudo não prova que inteligência artificial sente dor

Os próprios pesquisadores alertam contra essa interpretação. O experimento demonstra que modelos possuem representações internas associadas à dor e que a manipulação dessas representações pode alterar seu comportamento.

Também há outra limitação importante: os testes de escolha foram realizados com versões modificadas do Qwen 2.5, e não com chatbots comerciais usados normalmente pelo público.

O estudo foi disponibilizado como preprint no arXiv e ainda não passou pelo processo de revisão por pares.

Ver Mais

William R. Plaza: Editor-chefe no Hardware.com.br, aficionado por tecnologias que realmente funcionam. Segue lá no Insta: @plazawilliam Elogios, críticas e sugestões de pauta: william@hardware.com.br
Postagem relacionada