Fine-tuning é o processo de continuar o treinamento de um modelo de linguagem já pronto usando um conjunto de dados adicional e mais específico, ajustando os pesos internos do modelo para que ele passe a se comportar de um jeito determinado — um tom, um formato de resposta, o vocabulário de uma área técnica, jurídica ou médica, por exemplo. É diferente de mandar contexto no prompt ou buscar informação externa em tempo real (RAG): fine-tuning muda o próprio modelo, não o que é enviado a ele em cada chamada.
O que é fine-tuning, na prática
Todo LLM começa com um pré-treinamento (pretraining): o modelo aprende padrões gerais de linguagem processando uma quantidade enorme de texto genérico. Fine-tuning é uma segunda etapa de treinamento, sobre esse modelo já pronto, usando um conjunto de dados menor e mais específico — pares de exemplo (entrada e saída esperada) que ensinam o modelo a se comportar de um jeito determinado. É uma técnica de machine learning, não um produto de um fornecedor específico: pode ser feita com modelos abertos (Llama, Gemma, Mistral) via ferramentas open source, ou com modelos fechados, quando o fornecedor oferece essa opção.
Para entender a base sobre a qual o fine-tuning atua, vale revisar [o que é um LLM](/artigo/o-que-e-um-llm-guia-modelos-linguagem) e como [tokens e janela de contexto](/artigo/tokens-janela-de-contexto-llm) funcionam — o dataset de fine-tuning também é medido e cobrado em tokens, do mesmo jeito que um prompt.
Como funciona o processo de fine-tuning
- Reunir um dataset de exemplos: pares de entrada e saída (prompt e resposta ideal), geralmente em formato JSONL, representando o comportamento que o modelo deve aprender.
- Preparar e limpar os dados: remover exemplos inconsistentes, duplicados ou de baixa qualidade — a qualidade do dataset importa mais do que o volume.
- Escolher hiperparâmetros: taxa de aprendizado (learning rate), número de épocas (quantas vezes o modelo vê o dataset inteiro) e tamanho de lote (batch size).
- Rodar o treinamento: o modelo processa os exemplos e ajusta seus pesos internos por retropropagação (backpropagation), tentando reduzir o erro entre o que gerou e a resposta esperada.
- Avaliar o modelo resultante: testar em exemplos que não estavam no treinamento, para checar se o modelo generalizou o comportamento ou só decorou o dataset.
- Servir o modelo ajustado: publicar a versão treinada para uso, geralmente como um modelo derivado do original, referenciado por um identificador próprio.
Não existe um número mágico de exemplos. Dependendo do provedor e da complexidade da tarefa, datasets podem variar de algumas dezenas a milhares de exemplos — o que importa é que cada exemplo represente bem o comportamento desejado, sem contradições entre si.
Os principais métodos de fine-tuning
- Full fine-tuning: ajusta todos os parâmetros do modelo. Tem o maior potencial de qualidade, mas exige mais dados, mais memória de GPU e mais custo — pouco viável para modelos muito grandes fora de uma infraestrutura dedicada.
- PEFT (Parameter-Efficient Fine-Tuning): em vez de treinar todos os parâmetros, congela os pesos originais e treina só um pequeno conjunto de parâmetros adicionais, reduzindo drasticamente o custo computacional.
- LoRA (Low-Rank Adaptation): a técnica de PEFT mais usada — em vez de atualizar a matriz de pesos original, treina duas matrizes menores que representam a mudança necessária, o que pode reduzir os parâmetros treináveis em até 90% mantendo qualidade próxima do full fine-tuning.
- Instruction tuning: fine-tuning supervisionado com pares de instrução e resposta, focado em ensinar o modelo a seguir comandos e formatos — é a base sobre a qual RLHF e DPO normalmente são aplicados depois.
- RLHF (Reinforcement Learning from Human Feedback): treina um modelo de recompensa a partir de preferências humanas (qual resposta é melhor entre duas) e depois otimiza o modelo principal por reforço (tipicamente PPO) contra esse modelo de recompensa. É o pipeline usado para alinhar modelos como o ChatGPT ao comportamento esperado.
- DPO (Direct Preference Optimization): alcança um objetivo parecido ao do RLHF, mas sem treinar um modelo de recompensa separado nem rodar reinforcement learning — otimiza o modelo diretamente sobre pares de resposta "escolhida" e "rejeitada", com um pipeline mais simples de implementar.
Exemplo: fine-tuning com LoRA usando Hugging Face PEFT
O trecho abaixo é simplificado — só para ilustrar a estrutura de um fine-tuning com LoRA usando a biblioteca open source PEFT, da Hugging Face, sem tratamento de erro, avaliação ou otimização de hiperparâmetros. Rodar um treinamento de verdade exige GPU, um dataset preparado e ajustes específicos para o modelo escolhido.
from transformers import AutoModelForCausalLM, AutoTokenizer, TrainingArguments, Trainer
from peft import LoraConfig, get_peft_model
from datasets import load_dataset
model_name = "meta-llama/Llama-3.1-8B"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name)
# LoRA: congela os pesos originais e treina só matrizes de baixo posto
lora_config = LoraConfig(
r=8, # rank das matrizes treináveis
lora_alpha=16,
target_modules=["q_proj", "v_proj"],
lora_dropout=0.05,
task_type="CAUSAL_LM",
)
model = get_peft_model(model, lora_config)
model.print_trainable_parameters() # normalmente < 1% dos parâmetros totais
dataset = load_dataset("json", data_files="exemplos_treinamento.jsonl")
training_args = TrainingArguments(
output_dir="./modelo-ajustado",
per_device_train_batch_size=4,
num_train_epochs=3,
learning_rate=2e-4,
)
trainer = Trainer(model=model, args=training_args, train_dataset=dataset["train"])
trainer.train()Fine-tuning vs RAG: quando usar cada um
As duas técnicas resolvem problemas diferentes e a dúvida entre elas é uma das mais comuns de quem está planejando um projeto de IA. Para o pipeline completo do outro lado dessa comparação, veja [o que é RAG](/artigo/rag-retrieval-augmented-generation-o-que-e-como-funciona).
- Fine-tuning ensina comportamento, estilo, formato ou vocabulário — ajusta como o modelo responde, não necessariamente o que ele sabe.
- RAG dá acesso a informação externa e atualizada, buscando em uma base de dados a cada consulta — ideal para fatos que mudam com frequência ou dados privados.
- Fine-tuning exige investimento antes do deploy (dataset, treinamento, avaliação); RAG exige mais recursos em tempo de execução (busca a cada chamada).
- Atualizar conhecimento em RAG é trocar o índice; atualizar conhecimento aprendido por fine-tuning exige treinar de novo.
- Fine-tuning tende a ser mais consistente para tarefas de formato fixo (classificação, extração estruturada, tom de voz de marca); RAG tende a ser melhor quando a resposta precisa citar uma fonte verificável e atualizada.
As duas técnicas se combinam: um modelo pode passar por fine-tuning para dominar o jargão e o formato de respostas de um domínio (jurídico, médico, financeiro) e, ao mesmo tempo, usar RAG para buscar os documentos mais recentes daquele domínio a cada pergunta.
Riscos e limitações
- Catastrophic forgetting: ao ser ajustado com um dataset pequeno e específico, o modelo pode perder parte das capacidades gerais que tinha antes do fine-tuning, especialmente quando treinado por muitas épocas sobre poucos dados.
- Overfitting: se o dataset for pequeno demais ou repetitivo, o modelo pode "decorar" os exemplos em vez de generalizar o comportamento — funciona bem nos exemplos de treino e mal em casos novos.
- Dependência da qualidade do dataset: exemplos inconsistentes, com erros ou vieses indesejados são aprendidos pelo modelo do mesmo jeito que os exemplos bons — não há filtro automático de qualidade.
- Custo de manutenção: qualquer mudança relevante no comportamento desejado, ou nos dados que embasaram o treinamento, exige rodar o fine-tuning de novo — diferente de RAG, em que basta atualizar o índice.
- Não é uma solução garantida contra alucinação: fine-tuning pode ajudar o modelo a admitir quando não sabe algo, mas treinar com dados de baixa qualidade ou desalinhados pode piorar as alucinações em vez de reduzi-las. Para lidar com respostas incorretas sobre fatos específicos, RAG costuma ser mais eficaz — veja [o que é alucinação em IA e como reduzir o risco](/artigo/alucinacao-em-ia-por-que-modelos-erram-como-reduzir).
Fine-tuning muda o comportamento do modelo de forma persistente. Um dataset de treinamento com viés, erro factual sistemático ou tom inadequado não é um problema pontual — ele se torna parte do modelo até um novo treinamento.
Panorama das plataformas em 2026
A disponibilidade de fine-tuning self-service varia bastante entre fornecedores e muda com o tempo — por isso vale checar a documentação oficial antes de decidir uma plataforma. Em agosto de 2026: a OpenAI anunciou o encerramento gradual da sua plataforma de fine-tuning self-service, com novos clientes já sem acesso a partir de maio de 2026 e bloqueio total de novos jobs de treinamento previsto para janeiro de 2027, atribuindo a decisão à capacidade de modelos mais novos seguirem instruções sem precisar de ajuste fino; modelos já ajustados continuam disponíveis para inferência até a descontinuação dos modelos-base. A Anthropic não oferece fine-tuning self-service pela API direta da Claude — a rota disponível é fine-tuning do Claude 3 Haiku via Amazon Bedrock, além de programas corporativos sob contrato para modelos customizados. O Google Cloud Vertex AI mantém tuning supervisionado (incluindo LoRA) para modelos abertos e da linha Gemini. E o ecossistema open source, via bibliotecas como PEFT da Hugging Face, segue sendo a rota mais estável e independente de fornecedor para quem quer manter controle total sobre o processo.
Esse cenário de disponibilidade por fornecedor tende a mudar — o que não muda é o conceito por trás da técnica: treinar mais um modelo já pronto com dados específicos para ajustar seu comportamento.
Quando vale a pena usar fine-tuning
Fine-tuning costuma valer a pena quando o problema é de comportamento consistente, não de acesso a informação: manter um tom de voz de marca em todas as respostas, forçar um formato de saída estruturado, ensinar um vocabulário técnico muito específico, ou reduzir a necessidade de instruções longas repetidas em todo prompt (economizando tokens a cada chamada). Faz menos sentido quando o problema é a resposta precisar de dados que mudam com frequência, ou quando ainda não existe um dataset de qualidade suficiente para treinar — nesses casos, [RAG](/artigo/rag-retrieval-augmented-generation-o-que-e-como-funciona) ou um bom uso de contexto no prompt costumam resolver com menos risco e menos manutenção. Para tarefas que envolvem orquestrar chamadas de ferramentas ou passos automatizados, vale também considerar se o problema é resolvido por [um agente de IA](/artigo/o-que-e-um-agente-de-ia-guia-completo) bem projetado antes de investir em um treinamento customizado.
Perguntas frequentes
Não. Fine-tuning ajusta o comportamento, tom ou formato do modelo através de treinamento adicional; RAG dá acesso a informação externa e atualizada em tempo de consulta. Resolvem problemas diferentes e costumam ser combinados: fine-tuning para o comportamento, RAG para os fatos.