Janela de contexto
Quanto texto o modelo consegue considerar de uma vez. Passou disso, ele esquece.
Janela de contexto é a quantidade máxima de texto — medida em tokens — que um modelo consegue levar em conta em uma única interação. Ela inclui tudo: o prompt do sistema, o histórico da conversa, os documentos que você colou e a resposta que está sendo gerada.
Quando a conversa ultrapassa a janela, o conteúdo mais antigo sai — por isso um chat longo parece "perder o fio". Janelas maiores (dezenas ou centenas de milhares de tokens) permitem analisar documentos inteiros de uma vez, mas não são de graça: mais contexto custa mais e, na prática, o modelo presta menos atenção ao que está no meio de um texto muito longo. Por que importa: quando você precisa que a IA raciocine sobre uma base grande, muitas vezes é melhor buscar só os trechos certos (ver RAG) do que jogar tudo na janela.