Um dos pesquisadores responsáveis por estudar como manter sistemas avançados de inteligência artificial sob controle acredita que existe mais de 10% de chance de a tecnologia levar à extinção humana na próxima década. A estimativa é de Evan Hubinger, líder de Alignment Science da Anthropic, empresa responsável pelo Claude. Hubinger apresentou a probabilidade como sua avaliação pessoal e posteriormente esclareceu que considera baixo o risco oferecido pelos modelos disponíveis atualmente. Sua preocupação está concentrada em sistemas futuros capazes de participar do desenvolvimento de IAs ainda mais avançadas.
“Nós realmente acreditamos, sinceramente, que a IA poderia matar todos os humanos. Pessoalmente, acho que a chance disso acontecer é superior a 10% na próxima década”, escreveu Hubinger.
Anthropic ainda não tem solução para controlar uma superinteligência
O ponto mais relevante da declaração vai além dos 10%. Hubinger reconheceu que a Anthropic ainda não possui um plano para resolver o problema de alinhamento de uma eventual superinteligência e afirmou que a empresa não está claramente no caminho para encontrar essa solução. Alinhamento, nesse contexto, é o conjunto de técnicas destinadas a fazer com que uma IA suficientemente poderosa continue agindo de acordo com objetivos e restrições definidos por humanos.
A preocupação de Hubinger envolve especialmente a chamada melhoria recursiva: um cenário hipotético em que sistemas de IA passam a contribuir para o desenvolvimento de versões mais capazes de si próprios. Segundo o pesquisador, esse processo está avançando mais rapidamente do que se esperava.
Isso não significa que o Claude ou outros modelos disponíveis atualmente estejam próximos de exterminar a humanidade. A discussão envolve sistemas futuros com capacidades muito superiores às atuais, e não existe método confiável para transformar esse risco hipotético em uma probabilidade precisa.
Pesquisador deixou a Anthropic por temer corrida pela superinteligência
As declarações surgiram depois que Jacob Coxon, ex-pesquisador da OpenAI e da Anthropic, anunciou sua saída da indústria. Coxon trabalhava com pré-treinamento de modelos e criticou a velocidade da corrida entre os laboratórios para desenvolver uma inteligência artificial capaz de melhorar o próprio processo de desenvolvimento. Segundo ele, empresas podem acabar fazendo concessões em segurança para não ficar atrás dos concorrentes.
Hubinger respondeu publicamente ao ex-colega e confirmou compartilhar parte dessas preocupações. Ele defendeu os esforços da Anthropic na área de segurança, mas reconheceu a ausência de uma solução definitiva para o problema.
Os 10% não significam que a extinção humana foi calculada cientificamente
A distinção é especialmente importante devido à gravidade da declaração. Não existe uma base histórica de superinteligências que permita calcular estatisticamente a chance de uma delas escapar do controle humano.
Os mais de 10% representam, portanto, a avaliação de risco de Hubinger diante de um cenário futuro e incerto. O alerta ganha relevância por vir de pesquisadores que trabalham diretamente com sistemas avançados e com o problema de alinhamento. Ao mesmo tempo, não demonstra que uma catástrofe seja provável ou iminente.
A questão levantada pelo episódio é menos cinematográfica e mais concreta, empresas estão tentando construir sistemas cada vez mais capazes enquanto os próprios pesquisadores responsáveis por estudar seu controle reconhecem que ainda não sabem como garantir a segurança de uma eventual superinteligência.
Você também deve ler!