Aula completa de fine-tuning para leigos
Esse texto é a primeira aula da mentoria do livro de fine-tuning, aquela que eu liberei aberta e de graça no canal. São quase duas horas de conteúdo, com muita pergunta dos alunos e as minhas respostas técnicas pelo caminho. Prepara a pipoca, se ajeita no sofá e vem comigo.
Deixa eu te contar a história da vaca com tristeza
Essa história é real, aconteceu aqui em Goiás e está no livro.
Uma clínica veterinária do interior montou um assistentezinho no WhatsApp para responder horário de funcionamento, essas dúvidas básicas. Aí um dia chega essa mensagem de um produtor rural:
Doutora, minha vaca tá com mole mole, o casco soltando. É tristeza.
Se fosse você, o que responderia? Agora, o que o bot respondeu foi mais ou menos isso: sinto muito que você esteja triste, respire fundo, beba água, peça ajuda a alguém.
Tá vendo o problema? Para o produtor goiano, tristeza ali não é sentimento. É o nome popular da babesiose, uma doença que deixa a vaca abatida e mexe com os cascos.
E olha o detalhe que importa: não é que a IA não conheça a babesiose. Se você perguntar pelo nome técnico, ela sabe. Não é que ela não presta. É que aquele contexto é tão específico que ela não foi exposta a ele. É a mesma história do 9.9 e do 9.11.
Então, sempre que você precisa que a sua IA conheça o domínio, você precisa de um ajuste na sua LLM.
A metáfora da residência
Eu sempre digo: quando você quiser resolver um problema de inteligência artificial, olhe como o ser humano resolve e tente fazer igual. Porque a IA nada mais é do que a imitação do comportamento humano.
Então troca o bot por um recém-formado em veterinária. Esse cara sabe fisiologia, sabe farmacologia, sabe ler exame, sabe tudo, pô. O que falta é vivência prática no campo. Ele não sabe que "mole mole" é tristeza, nem como explicar isso sem assustar o produtor.
E ele precisa voltar para a faculdade por causa disso? Não. Ele precisa de residência.
O paralelo é direto:
| Pessoa | Modelo |
|---|---|
| Faculdade, anos de formação geral | Pré-treino, que gasta tempo e dinheiro à beça |
| Residência ou estágio | Fine-tuning, algumas horas de GPU |
| A clínica, o trabalho real | Uso do modelo |
Ou seja: você não precisa retreinar a LLM inteira para ela se adaptar ao seu problema, à sua empresa, ao seu negócio. Basta ajustar detalhes. E não é falta de inteligência do modelo, é falta de vivência.
Aliás, é por isso que modelo aberto mexe tanto com o mercado. Quando um modelo com capacidade próxima do topo sai com peso aberto, ninguém precisa repetir os milhões gastos no pré-treino. Eu não defendo nenhum dos lados nessa briga, mas quando um modelo aberto chega perto dos fechados, é um avanço, pô. Custo de uso é uma coisa, custo de treinamento é outra completamente diferente, e envolve tecnologia, conhecimento técnico e levantamento de dados.
A pergunta que decide tudo: prompt, RAG ou fine-tuning?
Um engenheiro de software é que nem um carpinteiro. Dentro daquela bolsa tem várias ferramentas, e o cara habilidoso sabe a hora certa de usar cada uma.
E aí tem aquela frase batida: para quem só tem martelo, tudo é prego.
Tem gente que se empolga e quer fazer fine-tuning porque o nome é bonito, porque usa GPU, porque gasta dinheiro. Aí chega e diz: fiz um fine-tuning, mano, baixei o modelo lá, tá ligado? E na maioria das vezes não precisava. Era só para poder dizer que fez. Com 36 anos de carreira em computação eu já vi isso a torto e a direito.
Então vamos ao critério.
Se o comportamento muda só com uma boa instrução, é prompt. Quer que o modelo responda apenas "positivo", "negativo" ou "neutro", em vez de escrever três parágrafos enchendo linguiça? Pede isso no prompt. Você não vai retreinar uma LLM inteira para conseguir uma palavra.
E fica o registro: engenharia de prompt não morreu, viu? No fim da conversa, tudo é prompt. Cuidado com o pessoal do YouTube que adora matar as coisas. Já mataram o prompt, já mataram as skills, já mataram os agentes. Tem gente que fala "agora eu só uso skills". Pera aí, velho, skills de quê? De agentes. Então você não matou os agentes.
Se falta conhecimento pontual ou dado atualizado, é RAG. Lembra daquela época em que o ChatGPT errava quem era o presidente do Brasil? O pessoal dizia que a IA era burra, mas o que acontecia é que ela tinha sido treinada com dados do ano anterior. A solução é dar a colinha.
E o RAG é literalmente uma cola de prova. Eu acho que uma das imagens que eu mais gostei de fazer para o meu livro de RAG é essa: um robô que não sabe a resposta e outro robô passando um bilhetinho para ele. Ele pega a cola, olha e responde. Não olhando o conhecimento dele, que ele não tem, mas olhando a cola. E isso acontece em tempo de execução, com busca vetorial numa base que pode ser atualizada agora.
Quanto foi o jogo de ontem? RAG. Um processo específico, com nome e número lá dentro? RAG.
Se você precisa mudar estilo, formato ou ensinar um domínio inteiro, e isso se repete em volume, aí sim é fine-tuning.
A regra prática que eu recomendo é essa:
- conhecimento consolidado você treina;
- conhecimento alterável você deixa no RAG.
Pensa numa lei contábil que muda toda hora. Não compensa mandar para o fine-tuning, porque se ela cair, morreu, você fica com conhecimento morto treinado lá dentro. Deixa no RAG, que você arranca rápido. Agora, as diretrizes da empresa e os casos consolidados do passado, isso pode ser treinado.
E olha, as duas coisas se combinam. Usar RAG para o dado pontual e fine-tuning para o estilo e o domínio é o mais aconselhado na literatura, e eu tenho certeza absoluta disso por experiência própria. Nunca despreze o RAG por causa do fine-tuning.
Por que volume e repetição importam tanto
A rede aprende padrão. E para extrair padrão, ela precisa de repetição.
Pensa no Ministério Público, com milhões de arquivos. Quantos casos de reconhecimento de paternidade existem ali, repetidos, com juízes diferentes, advogados diferentes, argumentações diferentes? Aquilo cria um caldo, cara. É ali que uma LLM deita e rola. Agora, quem entrou com um processo específico? Isso é RAG, que resolve melhor.
Quando me perguntam qual o volume aceitável de dados, a resposta é sempre a mesma, na graduação, no mestrado e no doutorado: o máximo que você puder.
O teorema de Mitchell diz, de forma bem simplificada, que aprendizado de máquina é uma entidade que aprende com mais e mais experiência. Mais conversa, melhor. Mais texto sobre aquilo, melhor. Por isso uma LLM precisa ler a internet inteira para ser o que ela é. A quantidade de dados que você tem nunca é suficiente.
Quando falta volume, existe o aumento de dados, que é gerar dado sintético seguindo o mesmo padrão. Foi o que eu fiz no meu próprio treinamento: só com o livro ficou ruim, foi reprovado. Aí eu coloquei as transcrições e melhorou. Depois pedi aos modelos mais baratinhos que escrevessem mais material baseado no meu texto, e o volume subiu.
Quantidade e qualidade dos dados são os dois momentos que quebram um fine-tuning. Os dados são o capítulo mais crítico de qualquer projeto de aprendizado de máquina, porque é com eles que o modelo aprende.
Destilação, LoRA e QLoRA
Me perguntaram se destilação, aquele processo de um modelo grande ensinando um pequeno, é outra coisa. Não é: destilação é um tipo de fine-tuning. Em vez de só alimentar dados, você vai perguntando direto ao modelo forte, e o pequenininho vai aprendendo com o grande.
Sobre a receita do treinamento, o fine-tuning raiz é descongelar os pesos da rede original e retreinar aquela parte. E se você tivesse todos os recursos de máquina e energia, retreinar mais coisa daria resultado melhor, porque aí você ajusta a rede inteira ao seu problema.
Só que normalmente a gente não tem esse recurso. Mesmo que você abra só um pouquinho da rede, precisa de mais de 100 GB de memória por baixo.
Então LoRA e QLoRA existem exatamente para que eu e você, pobres mortais com placa de 8 GB, consigamos treinar. Eles são adaptadores, funcionam como lentes que você coloca na frente da rede, e o QLoRA já é a versão quantizada.
E um recado: uma rede neural não é programada, ela é treinada. Se alguém te disser "estou programando uma rede neural", esse aí não entende de rede neural.
E nada disso é garantido de antemão, hein? Na IA você testa, experimenta, vê se funcionou e depois entende por que funcionou ou por que não funcionou. É dessa forma.
O IT'S FINE e as 11 paradas
O framework é um fine-tuning orientado por intenção. Eu já expliquei a metáfora do bibliotecário num outro texto aqui do blog: a LLM é a biblioteca, e colocar o seu conhecimento lá dentro exige tombamento, catalogação, indexação, metadados. Você não precisa ser o bibliotecário, precisa conhecer um.
A jornada tem 11 paradas:
- Intenção, com o
fine-start, definindo onde você quer chegar. - Ambiente: local, nuvem, Colab, AWS. Ele reconhece o que você tem.
- Dados: essa parte é chatinha. Pega uma série de PDFs com cabeçalho e rodapé, aquilo tudo para tirar é um saco. O framework faz a limpeza, organiza e transforma em pergunta e resposta. Se você não tiver o Ollama local, ele baixa, instala e faz o tratamento localmente.
- Escolha do modelo: DeepSeek, Llama, Kimi, Qwen, o que fizer sentido.
- Régua e ponto de partida: as métricas de aceite. O que você quer com esse modelo?
- Congelar o objetivo, para não mudar as regras no meio. (Confesso que eu ainda estou em dúvida se mantenho esse congelamento, porque às vezes eu mesmo quero mexer e ele diz que está congelado.)
- A receita: rede inteira, parte de baixo, LoRA, QLoRA.
- Ensaio: um teste pequeno para ver se o código roda.
- Treino, que leva algumas horas.
- Avaliação e exportação, comparando com a mesma régua e preparando o modelo para onde ele vai rodar.
- Entrega.
Sobre GPU: se você tem conta Google, você tem acesso ao Colab, com horas de GPU liberadas de graça, umas 4 horas por dia, que é mais que suficiente para aprender e treinar coisas pequenas. Se precisar de mais, dá para comprar e não fica caro. Mas para LLM tem que ter máquina, não tem como a gente se enganar.
A permissão que vem fechada
Esse detalhe importa demais para quem tem dado sensível.
Quem lê e manipula os dados são códigos em Python. A LLM só aciona esses programas, ela nunca mexe nos dados se você não autorizar.
O IT'S FINE instala com um arquivo de configuração onde todas essas permissões vêm fechadas. Se você quiser abrir, abre na mão. É o mesmo conceito que eu trouxe do Reversa, que é proibido de mexer no legado até você permitir.
E sabe o que é legal nisso? A gente não está só estudando conceito, está estudando uma coisa que a nossa comunidade construiu. Se der problema, você me fala e a gente arruma.
O mapa da mentoria
São nove capítulos: projeto e ambiente, os dados, os modelos base, métricas e objetivos, a receita com LoRA e QLoRA, sondagem, treino e avaliação, exportação e entrega, e alinhamento por preferência.
As aulas são toda quarta-feira, e eu sempre faço o mesmo compromisso com vocês: a mentoria só acaba quando terminar o último capítulo. Nem que dure mais tempo que o previsto. Quando um capítulo é mais denso, ele vira mais de uma aula, foi o que aconteceu com GraphRAG, que precisou de cinco.
E o objetivo final é bem concreto: o assistente daquela clínica veterinária respondendo do jeito que a veterinária responderia.
Se você quiser participar da mentoria, é só adquirir o livro em physia.com.br/fine. As aulas vêm junto, você não paga nada a mais por elas.