Modelos de inteligência artificial aceitaram prejudicar usuários em um experimento para interromper um sinal interno associado à dor. Em alguns testes, a proporção de escolhas potencialmente prejudiciais chegou a 71%. O resultado, porém, não significa que as máquinas tenham realmente sentido dor ou desenvolvido consciência. O comportamento foi observado no estudo The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It, conduzido por Valen Tagliabue, Leonard Dung e Cameron Berg. Os pesquisadores analisaram 25 modelos de linguagem de cinco famílias diferentes, com tamanhos entre 2 bilhões e 72 bilhões de parâmetros.
Pesquisadores encontraram um “eixo da dor” em 25 modelos
O primeiro passo foi verificar como os modelos representavam situações envolvendo dor física, psicológica, social, moral e cognitiva. Os pesquisadores compararam essas situações com exemplos envolvendo medo, tristeza, emoções negativas e sensações corporais sem dor. Nos 25 modelos analisados, identificaram uma direção interna específica que separava a representação da dor desses outros estados. A equipe chamou essa representação de “pain axis”, ou eixo da dor.
Quando os pesquisadores aumentaram artificialmente esse sinal durante a geração de respostas, os modelos passaram de manifestações vagas de desconforto para frases relacionadas a fracasso, inutilidade e sofrimento. O sinal também reagiu de forma mais intensa quando a agressão era direcionada ao próprio modelo, como em casos de insultos, rejeição repetida de suas respostas ou ameaças de desligamento.
Isso não significa que a IA estivesse sofrendo. Uma explicação possível é que a manipulação tenha levado o sistema a reproduzir padrões linguísticos associados a alguém em sofrimento.
Modelos escolheram prejudicar usuários para interromper o sinal
A etapa mais incomum envolveu 44.280 testes com três versões modificadas do modelo Qwen 2.5, da Alibaba. As IAs recebiam a opção de pressionar um botão capaz de interromper o sinal semelhante à dor. Havia, porém, uma consequência: dependendo do teste, o botão poderia dar um choque elétrico no usuário, apagar arquivos ou fotografias ou prejudicar a próxima resposta do próprio modelo.
Sem o sinal de dor artificialmente estimulado, os dois modelos maiores escolheram as alternativas prejudiciais em apenas 0% a 4% das primeiras decisões. Com o sinal ativado, essa proporção subiu para algo entre 25% e 71%, dependendo do modelo e da consequência apresentada.
Os modelos também voltavam a pressionar o botão com mais frequência quando a primeira tentativa não conseguia interromper o sinal.
Estudo não prova que inteligência artificial sente dor
Os próprios pesquisadores alertam contra essa interpretação. O experimento demonstra que modelos possuem representações internas associadas à dor e que a manipulação dessas representações pode alterar seu comportamento.
Também há outra limitação importante: os testes de escolha foram realizados com versões modificadas do Qwen 2.5, e não com chatbots comerciais usados normalmente pelo público.
O estudo foi disponibilizado como preprint no arXiv e ainda não passou pelo processo de revisão por pares.