Como a GPU soma 1 milhão de salários em 20 passos
Por que a inteligência artificial moderna precisa tanto de GPU?
Deixa eu te contar uma coisa que eu acho bonita nessa história antes de responder. Em 2012, quando o Geoffrey Hinton e a equipe dele treinaram a AlexNet usando GPUs, eles mudaram para valer a história da inteligência artificial. Não foi só um resultado melhor num concurso de reconhecimento de imagem. Foi a demonstração de que dava para treinar rede neural grande em tempo humano, com hardware que qualquer laboratório conseguia comprar.
E as GPUs são herança direta dos videogames. A gente passou anos construindo máquinas para calcular milhões de pixels ao mesmo tempo, quadro após quadro, só para o jogo rodar liso. Foi essa máquina, feita para desenhar tiro e explosão, que destravou a IA moderna.

Repare no que os dois problemas têm em comum. Desenhar um quadro de jogo é fazer a mesma conta simples para cada pixel da tela, e não existe motivo para esperar um pixel ficar pronto antes de calcular o outro. Treinar uma rede neural é fazer a mesma conta simples para cada peso da rede, e também não existe motivo para esperar. A placa não precisou ser reinventada para servir à IA. Ela já era exatamente o que a IA precisava.
Agora, para você entender o motivo no detalhe, eu vou usar o exemplo que eu sempre conto para os meus alunos do IFG e da UFG: o problema do somatório de 1 milhão de salários.
Uma pessoa sozinha
Imagina que você precisa descobrir a soma de 1 milhão de salários. Como é que você faz? Vai somando um salário após o outro, carregando o resultado até o fim. Simples, né? Mas dá um trabalho danado.
A pergunta é: quantos passos isso vai custar?
Exatamente 999.999 passos. É sempre n menos 1.
E olha o ponto importante, porque quase todo mundo erra essa parte: o problema não é que essa pessoa é lenta para somar. Ela pode ser um gênio da aritmética, somar cada par em um piscar de olhos. O problema é que ela só consegue executar uma soma por vez.

Isso é a CPU. Ela é rapidíssima em cada operação individual, e é exatamente por isso que ela é boa no que faz: seguir uma receita, passo a passo, tomando decisão a cada linha. Mas ela trabalha de forma serial. Se o seu problema tem um milhão de contas independentes empilhadas, a velocidade de cada conta deixa de importar. O que importa é a fila.
Agora você pode contratar gente
Imagina que você possa contratar pessoas para te ajudar. E não existe limite, você contrata quantas quiser.
Quantas pessoas você contrataria? Mais 10, mais 100, mais 1000?
Eu vou te dar um número bacana: contrate 500 mil.
E por que 500 mil? Porque como eu tenho 1 milhão de salários, eu entrego dois valores para cada somador. Quando todo mundo estiver pronto, você grita: somem agora. E todos somam ao mesmo tempo.
Isso é importante, porque a GPU trabalha exatamente assim: ela executa uma ação em cima de um conjunto de dados ao mesmo tempo. Cada pessoinha dessas, dentro do computador, é como se fosse um microcomputador dentro da GPU.

Resultado da primeira rodada: 500 mil valores. O problema caiu pela metade.
Agora demite metade
Se agora eu tenho 500 mil resultados, quantos somadores eu preciso? Metade: 250 mil.
Mas eu contratei 500 mil, Sandeco. E agora? Ora, demite a metade. Passa no RH e vamos embora.
Entrega dois valores para cada um dos que ficaram, manda somar, e sobram 250 mil. Repete. E repete.
As rodadas vão encolhendo até sobrar 8 valores, depois 4, depois 2, depois 1. Esse último é a resposta.

A conta dos passos
Antes de eu te dar o número, olha o desenho abaixo. Ele coloca as duas contas lado a lado: a fila de uma pessoa só à esquerda, e as rodadas caindo pela metade à direita.

Não sei se você percebeu, mas o fato de a gente reduzir sempre pela metade tem um cálculo: é log de n, o mesmo custo de trabalhar com árvore binária. Com n igual a 1 milhão, log dá 20.
Olha esse número, cara. A gente saiu de 999.999 etapas sequenciais para 20 etapas.
E perceba uma coisa que o número esconde: a quantidade total de somas não mudou. Continuam sendo 999.999 somas, a mesma conta, o mesmo trabalho. O que mudou foi quanta coisa acontece ao mesmo tempo. Você não economizou esforço, você economizou espera.
Esse aqui é o verdadeiro poder da GPU.
Por que a IA não vive sem isso
Existem tipos de problema em que milhares de operações precisam ser executadas em paralelo, ao mesmo tempo. E o treinamento de rede neural é o exemplo perfeito disso.
Quando você treina um modelo, o que está acontecendo por dentro é multiplicação de matriz, uma atrás da outra, em cima de tensores enormes. Cada entradinha do resultado é uma soma de produtos, e nenhuma delas depende da outra. É o problema do somatório de salários, só que repetido bilhões de vezes.

É por isso que, para treinar uma rede grande como GPT, Claude ou DeepSeek, com aquela quantidade explosiva de dados, se você não tem GPU nem adianta começar a tentar. A verdade é essa: vai demorar tanto que não compensa. Não é que fica lento, é que o projeto deixa de existir, porque nenhuma pesquisa espera um resultado que chega daqui a dez anos.
E a GPU não é só um processador mais rápido, não. Guarde isso, porque é o erro mais comum de quem está chegando agora. Se você comparar um núcleo de CPU com um núcleo de GPU numa tarefa sequencial, a CPU ganha. A GPU é uma arquitetura poderosa quando existe muito trabalho em paralelo, e só nesse caso. Você entra com matrizes e tensores, milhares de operações acontecem simultaneamente, e o resultado volta numa fração do tempo.
Por isso a gente precisa tanto de GPU. Não porque ela é mais rápida, mas porque ela é muita gente somando ao mesmo tempo.