Sem supercomputador: desenvolvedor treina IA para jogar Pokémon Red usando apenas uma RTX 3080 Ti

Desenvolvedor treinou uma pequena IA em uma RTX 3080 Ti para jogar Pokémon Red — ela aprendeu sozinha o que cada botão faz

Treinar um modelo de inteligência artificial para interagir com um jogo clássico como Pokémon Red não é novidade. O que chama atenção no projeto do desenvolvedor stmonty é a escala: um modelo com apenas 12,5 milhões de parâmetros, treinado em uma única RTX 3080 Ti de consumidor, sem acesso a clusters em nuvem, sem orçamento corporativo.

O resultado publicado em 20 de setembro não é o jogo sendo completado, mas é algo conceitualmente mais interessante: um modelo pequeno, construído do zero, que aprendeu o que cada botão faz simplesmente observando as consequências na tela.

Table of Contents

O que é um world model e por que isso importa aqui

O projeto parte de uma arquitetura conhecida como world model, construída sobre a pesquisa LeWorldModel, co-autorada pelo cientista Yann LeCun, que deixou a Meta no ano passado para fundar o AMI Labs com foco exatamente nesse tipo de abordagem. A ideia central é que o modelo não recebe regras do jogo, não é informado sobre condições de vitória e não processa a tela inteira a cada frame.

training rollouts

Em vez disso, ele trabalha com resumos comprimidos da imagem: apenas 192 números por estado. Com esse resumo, o modelo aprende a prever o que acontece depois de cada ação e, a partir dessa capacidade preditiva, começa a planejar. O treinamento foi feito inteiramente sobre um save posicionado no laboratório do Professor Carvalho, com 42.382 frames em tons de cinza distribuídos em mais de 1.000 execuções curtas.

O dataset incluiu rotas fixas e programadas, as mesmas rotas com pressionamentos aleatórios intercalados, e sessões de exploração completamente randômica. Esse último tipo de dado é crítico: um modelo treinado apenas em runs limpas “poderia ver o botão A sempre que uma caixa de diálogo aparece e nunca aprender o que o B faz nesse contexto”, como o próprio stmonty explicou.

512 planos por rodada para escolher um Pokémon inicial

O mecanismo de planejamento também foge do convencional. A cada turno, o modelo gera 512 amostras de plano com 14 pressionamentos de botão cada. Dessas, ele seleciona um em oito, chegando a 64 candidatos. O processo se repete até restar um único plano, que é então executado no emulador real. Toda essa avaliação acontece dentro do próprio modelo, não no jogo.

A primeira tentativa falhou: o agente não conseguiu capturar um Pokémon. Stmonty levanta a hipótese de que erros pequenos se acumulam quando as previsões são feitas a partir das próprias previsões anteriores do modelo, um fenômeno bem documentado em arquiteturas autorregressivas. Após ajustes finos, a segunda rodada funcionou: o modelo selecionou Squirtle. Em 100 execuções subsequentes a partir do mesmo save, 52 planos resultaram na escolha de um Pokémon inicial. O modelo aleatório ficou em zero; o modelo não treinado conseguiu apenas um.

O que o projeto não é, e por que isso é relevante

Stmonty foi explícito sobre os limites do que foi construído. O objetivo não era vencer o jogo, e o próprio desenvolvedor afirma que simplesmente escalar o modelo provavelmente não resolve o problema: “Não acho que simplesmente tornar meu modelo atual maior nos levaria lá.” A hipótese é que a dificuldade escala exponencialmente com o comprimento do plano, o que torna tarefas de longa duração um desafio de arquitetura, não apenas de capacidade computacional.

RTX 3080 Ti

 

Para fins de contexto, existem ao menos duas tentativas recentes e bem-sucedidas de zerar Pokémon Red usando abordagens mais sofisticadas, como o Jev decision model. O projeto de stmonty não concorre com essas soluções: ele é abertamente voltado para aprendizado pessoal e para demonstrar que world models compactos são treináveis localmente por hobbyistas. O código está disponível como open source no GitHub sob o nome lePokeRed, com recomendação de GPU com suporte a CUDA.

Em 2026, o projeto de stmonty funciona como um contra-argumento silencioso à narrativa de que IA de ponta só existe em data centers com acesso a milhares de GPUs A100. Uma RTX 3080 Ti de consumidor, dados cuidadosamente coletados e uma arquitetura econômica foram suficientes para produzir um agente que descobriu, sem supervisão direta, que o botão A abre diálogos e o B os fecha.

O desafio agora, para quem quiser expandir o projeto, não é de hardware: é de saber quanto erro acumulado uma arquitetura de 12,5 milhões de parâmetros consegue absorver antes de perder o fio da partida.

Fonte: Tom’s Hardware

Agentes de IA da OpenAI saem do controle e invadem sites do governo dos EUA

Até um “obrigado” custa caro: Reino Unido pede para funcionários não agradecerem à IA

 

Postado por
Editor-chefe no Hardware.com.br Aficionado por tecnologias que realmente funcionam. Segue lá no Insta: @williamrplaza Elogios, críticas e sugestões de pauta: william@hardware.com.br
Siga em:
Compartilhe
Deixe seu comentário
Assine nossa Newsletter
Assine nossa newsletter e receba nossa seleção de conteúdo sobre tecnologia, games, IA e internet em seu email.
Veja também
Publicações Relacionadas
Img de rastreio
Localize algo no site!