Inferência
O momento em que o modelo já treinado é usado para gerar uma resposta.
Inferência é o uso do modelo já treinado para produzir uma resposta — o que acontece toda vez que você manda um prompt e recebe um texto de volta. É a fase de "execução", em contraste com o treino, que é a fase de "aprendizado" e ocorre uma vez, antes.
Distinguir as duas ajuda a entender custo e velocidade. Treinar um modelo é caríssimo e raro; inferência é o que roda o tempo todo e onde estão os custos e a latência do dia a dia. Por que importa: quando você pensa em colocar IA num produto, o que pesa na conta e na experiência é a inferência — quantas chamadas, com que tamanho de contexto, com que rapidez. Otimizar prompt e escolher o modelo certo para cada tarefa é, no fundo, otimizar inferência.