A China ganhou espaço na corrida da inteligência artificial apostando em modelos capazes de entregar bons resultados sem exigir necessariamente uma infraestrutura gigantesca. Agora, algumas das maiores empresas do país estão se movimentando na direção oposta: construir modelos cada vez maiores, chegando à casa dos trilhões de parâmetros. Empresas como Alibaba e Moonshot AI já trabalham com sistemas enormes, enquanto os próximos projetos chineses podem atingir entre 5 trilhões e 10 trilhões de parâmetros.
Modelos chineses já chegaram aos trilhões de parâmetros
Um dos exemplos mais claros dessa escalada é o Kimi K3, da Moonshot AI, que alcança cerca de 2,8 trilhões de parâmetros. A Alibaba também entrou nesse território com o Qwen3.8-Max, que possui aproximadamente 2,4 trilhões de parâmetros. Para comparação, o DeepSeek-V3, que chamou bastante atenção pelo equilíbrio entre desempenho e eficiência, possui cerca de 671 bilhões de parâmetros, enquanto o Kimi K2 já havia ultrapassado a marca de 1 trilhão.
Os números, porém, exigem uma explicação importante. Ter trilhões de parâmetros não significa que todos eles sejam utilizados ao mesmo tempo. Boa parte desses modelos utiliza uma arquitetura chamada Mixture of Experts (MoE). Nesse sistema, diferentes grupos de parâmetros funcionam como especialistas. Dependendo da tarefa solicitada pelo usuário, apenas uma fração deles é ativada.
No caso do Qwen3.8-Max, por exemplo, o modelo possui 2,4 trilhões de parâmetros no total, mas utiliza aproximadamente 95 bilhões de parâmetros durante cada etapa de processamento.
Isso permite criar modelos extremamente grandes sem que todo o sistema precise ser executado simultaneamente.
Alibaba quer modelos com até 10 trilhões de parâmetros
A Alibaba revelou que o Qwen 4 já está em treinamento e indicou que sua estratégia para futuras versões, como Qwen 4.5 e Qwen 5, envolve modelos situados na faixa de 5 trilhões a 10 trilhões de parâmetros. A ByteDance, empresa responsável pelo TikTok, também estaria estudando modelos com escala semelhante, embora a companhia ainda não tenha confirmado publicamente esses números.
Isso colocaria as empresas chinesas em uma corrida por modelos de dimensões poucas vezes divulgadas publicamente no setor.
Uma comparação direta com empresas americanas, entretanto, é difícil. OpenAI e Anthropic, por exemplo, não divulgam oficialmente o número de parâmetros de seus modelos mais recentes.
Mais parâmetros não significam necessariamente uma IA melhor
Apesar dos números impressionantes, o tamanho de um modelo não determina sozinho sua qualidade. Um exemplo clássico ocorreu com o Chinchilla, desenvolvido pelo Google DeepMind. O modelo possuía 70 bilhões de parâmetros e conseguiu superar o Gopher, com 280 bilhões, em diversas avaliações.
Entre os fatores que também influenciam o desempenho estão a qualidade e quantidade dos dados utilizados no treinamento, a arquitetura escolhida e a quantidade de poder computacional disponível. Por isso, a estratégia chinesa parece caminhar em duas direções. De um lado estão os modelos menores e eficientes, capazes de funcionar em dispositivos com recursos limitados. Do outro, surgem modelos colossais destinados a tarefas mais complexas e executados em enormes infraestruturas de data centers.
Em vez de escolher apenas eficiência ou tamanho, as gigantes chinesas querem competir nos dois extremos da inteligência artificial.