A arquitetura por trás do novo Kimi, explicada sem matemática
Todo mundo ficou impressionado com a capacidade do Kimi 3 diante dos modelos top do mercado, tipo o Fable 5 e o GPT Sol. Só que o que o pessoal não técnico não sabe é que a turma do Kimi está mexendo na forma como as redes Transformers calculam os tokens internamente.
Vem comigo que eu te explico passo a passo, de forma descomplicada e sem álgebra.
Relembrando o mecanismo de atenção
As palavras formam centros de massa matemáticos dentro do modelo. Imagina duas regiões: uma com "ônibus" e "passageiro", outra com "corte".
Agora a pergunta que eu sempre faço aos meus alunos na disciplina de inteligência artificial: onde é que vai ficar a palavra "ponto"?
Ela vai ser atraída, atraída mesmo, como se fosse gravidade, para o centro de massa que corresponde ao assunto daquele contexto. Ponto de ônibus ou ponto de corte, dependendo de onde o texto está.
O problema é que, na atenção tradicional, o modelo precisa observar o universo inteiro de palavras e de assuntos a cada passo. Isso é multiplicação de matriz em cima de multiplicação de matriz, muita álgebra linear ali dentro.
Quanto maior o texto, mais relações para analisar. Com um milhão de partes de texto, podem surgir cerca de 1 trilhão de pares para comparar numa única etapa. É muito processamento, cara.
Pensa num cruzamento onde todos os carros tentam passar ao mesmo tempo. Com 10 carros funciona. Com milhares, o trânsito trava e ninguém sai do lugar.
O que o Kimi Delta Attention faz
Ele esquece.
Ele traz a atenção só para o que está perto do assunto atual. Tem mecanismo de troca de assunto, claro, mas o padrão é olhar para a vizinhança.
A melhor analogia é um jogo de mundo aberto, tipo GTA ou os Batman Arkham. Nesse mundo aberto você não carrega o jogo inteiro. Você carrega o que está perto de você, e o que está longe fica meio embaçado. Esse ficar longe é a esquecidinha que o modelo dá.
E esquecer também é inteligência, viu? O KDA não esquece tudo na mesma velocidade: cada parte da memória tem seu próprio ritmo. Os detalhes antigos vão desaparecendo aos poucos, enquanto o que é útil permanece e fica cada vez mais ativo.
O ganho
Como a quantidade de informação que entra na conta cai drasticamente, o modelo fica muito mais rápido que os atuais. Os números estão no artigo técnico da Moonshot AI, publicado no arXiv:
- até 75% de redução na memória temporária;
- respostas até cerca de 6 vezes mais rápidas em textos gigantescos.
O efeito colateral no mercado
Por causa dessa eficiência, o próprio lançamento do Kimi pressionou as ações da Nvidia no mesmo dia. Já existia uma tensão anterior, não foi só efeito do Kimi, mas em 27 de julho as ações estavam caindo 4%.
E faz sentido, né? Se a mesma resposta exige menos cálculo, a conta de hardware do mundo inteiro muda de tamanho.
O pessoal da Moonshot arrebentou nessa. Vale muito a pena você começar a se aprofundar nesse tipo de arquitetura nova, porque o mecanismo de atenção é a peça que permitiu a gente ter as redes generativas que temos hoje. Se quiser ir a fundo, tem a playlist de redes Transformers lá no canal, com toda a matemática por dentro.