Duas NVIDIA A100 de 40 GB, originalmente usadas em uma startup, acabaram transformadas no coração de um servidor doméstico capaz de executar localmente um modelo de inteligência artificial com 180 bilhões de parâmetros. O projeto apareceu no subreddit r/LocalAIServers. Segundo o autor, as duas A100 SXM4 foram cedidas pela startup onde trabalhava depois que a empresa decidiu substituí-las por versões de 80 GB. Junto com as GPUs vieram adaptadores SXM para PCIe que, segundo ele, são amostras de desenvolvimento da própria NVIDIA.
O resultado está longe da aparência de um servidor convencional. As placas trabalham abertas sobre uma estrutura, acompanhadas por grandes dutos metálicos de refrigeração. Os ventiladores de servidor originais eram barulhentos demais para o mesmo ambiente, então o proprietário os substituiu por duas ventoinhas Noctua NF-A8 e reduziu o limite de potência das GPUs para 250 W cada.
Dual A100 40Gb running qwen3.8 flash-next
by
u/not_nisesen in
LocalAIServers
Duas A100 oferecem 80 GB de memória para os modelos
Cada A100 utilizada no projeto possui 40 GB de memória HBM2. A NVIDIA especifica largura de banda de até 1.555 GB/s para a variante de 40 GB. Somadas, as duas placas disponibilizam 80 GB de VRAM ao sistema, embora essa memória permaneça distribuída entre GPUs distintas.
O restante da máquina também vem do mundo dos servidores: uma placa-mãe Supermicro H11SSL-i, processador AMD EPYC 7401P de 24 núcleos e 48 threads e 64 GB de DDR4. As A100 estão conectadas por PCIe x16 Gen3 e não utilizam NVLink.
No software, o servidor roda Proxmox VE, enquanto a inferência acontece dentro de um container utilizando llama.cpp com CUDA.
Modelo de 180 bilhões de parâmetros ocupa cerca de 76 GB
O teste mais curioso envolve o Qwen3.8-Flash-Next, listado oficialmente pelo projeto Qwen como um modelo de 180 bilhões de parâmetros.
Com uma versão quantizada em aproximadamente 4,27 bits por peso, o proprietário conseguiu fazer o modelo ocupar cerca de 76 GB de VRAM, deixando pouca memória livre nas duas A100.
Nos testes publicados, o modelo chegou a uma mediana de 89 tokens por segundo em código repetitivo. O número não representa seu desempenho em qualquer situação, o próprio autor observou que o prefill ficou aproximadamente duas vezes mais lento e que um Qwen3.8-27B menor ainda levou vantagem quando o contexto chegou a 64 mil tokens.
O experimento mostra um destino curioso para hardware corporativo substituído. Em vez de aposentadas, duas aceleradoras originalmente projetadas para data centers agora rodam, dentro de casa, um modelo que dificilmente caberia na memória de uma única GPU de consumo.
Você também deve ler!
Estudante monta homelab com 24 TB, Core i9 e IA local para levar à faculdade
Esta postagem foi modificada pela última vez em 21/09/2026 11:23