Homem reúne três placas de vídeo, incluindo uma modificada, e monta servidor com 70 GB de VRAM para IA

Homem reúne três placas de vídeo para montar um servidor de IA com 70 GB de VRAM, incluindo uma RTX 2080 Ti modificada de 11 GB para 22 GB.

Montar uma máquina com 70 GB de memória de vídeo normalmente remete a hardware profissional caro. Um usuário do Reddit, porém, chegou a essa capacidade por um caminho bem menos convencional: combinou duas NVIDIA Titan RTX de 24 GB com uma GeForce RTX 2080 Ti modificada para 22 GB e colocou as três placas sob refrigeração líquida.

O computador foi mostrado pelo usuário Cleric07 no subreddit LocalLLaMA, comunidade dedicada principalmente à execução local de modelos de inteligência artificial. Além dos 70 GB de VRAM somados, a configuração utiliza um Ryzen 9 5950X e 64 GB de memória DDR4. O uso principal da máquina envolve desenvolvimento com LLMs e trabalhos criativos, além de modelagem 3D e CAD/CAM para usinagem CNC.

 

Server rebuild to custom loop. 2x RTX Titans 24gb, 1x 22gb 2080ti | T: 70GB VRAM.
by
u/Cleric07 in
LocalLLaMA

Refrigeração líquida derrubou temperaturas de quase 90 °C para cerca de 45 °C

Uma das mudanças mais significativas veio da reconstrução do sistema de refrigeração. Antes do custom loop, as GPUs chegavam à faixa superior dos 80 °C sob carga. Com o circuito líquido, o proprietário relata aproximadamente 30 °C em repouso e 45 °C durante uso intenso.

O sistema emprega dois radiadores de 360 mm. De acordo com Cleric07, cada placa pode chegar a 320 W, embora o consumo real da máquina fique normalmente entre 500 e 600 W, com picos maiores. A fonte utilizada tem capacidade de 1.200 W.

RTX 2080 Ti teve a memória dobrada de 11 GB para 22 GB

A peça mais incomum do servidor é justamente a mais antiga. Lançada originalmente com 11 GB de GDDR6, a RTX 2080 Ti usada no projeto foi modificada para oferecer 22 GB.

Esse tipo de modificação substitui os chips de memória originais de 1 GB por componentes de 2 GB. Serviços especializados já oferecem a conversão e também precisam alterar resistores de configuração da placa para que a nova capacidade seja reconhecida corretamente. Na prática, isso permite reaproveitar uma GPU lançada em 2018 em cargas modernas nas quais a quantidade de VRAM pode ser mais importante que ter a arquitetura mais recente.

Máquina roda DeepSeek e Qwen localmente

O proprietário também publicou alguns resultados obtidos com modelos de IA.

Segundo ele, uma versão quantizada do DeepSeek V4 Flash distribuída pelas três GPUs alcança cerca de 24 tokens por segundo com contexto de 96 mil tokens. Já o Qwen 3.8 27B Q8, executado apenas nas duas Titan RTX conectadas por NVLink, chega a aproximadamente 55 tokens por segundo com MTP ativado e 27 tokens por segundo sem o recurso. Modelos MoE podem superar 85 tokens por segundo dependendo da quantização e do tamanho do contexto.

Ainda assim, a máquina ilustra uma alternativa peculiar para quem precisa de muita VRAM, em vez de partir diretamente para aceleradores profissionais atuais, combinar GPUs antigas de alta capacidade, incluindo uma placa fisicamente modificada, para manter modelos relativamente grandes rodando dentro de casa.

Você também deve ler!

Estudante monta homelab com 24 TB, Core i9 e IA local para levar à faculdade

Como a Skyone preparou Hardware.com.br e GameVicio antes da migração para a nuvem

Postado por
Editor-chefe no Hardware.com.br/GameVicio Aficionado por tecnologias que realmente funcionam. Segue lá no Insta: @williamrplaza Elogios, críticas e sugestões de pauta: william@hardware.com.br
Siga em:
Compartilhe
Deixe seu comentário
Assine nossa Newsletter
Assine nossa newsletter e receba nossa seleção de conteúdo sobre tecnologia, games, IA e internet em seu email.
Veja também
Publicações Relacionadas
Img de rastreio
Localize algo no site!