Janela de contexto
Também conhecido como: context window · comprimento de contexto · limite de contexto
Quanto a IA consegue ter presente de uma vez; tudo o que fica fora é invisível para o modelo quando responde.
Porque importa
Cada conversa com uma IA decorre dentro de um limite rígido. Cole um contrato de 200 páginas e o modelo pode estar a ler apenas parte dele. Não o vai avisar: responde com confiança a partir do que consegue ver, e o que não consegue ver simplesmente não existe. Muitas queixas de 'a IA ignorou as minhas instruções' são problemas de contexto, não de inteligência.
Como funciona
Tudo o que um modelo lê antes de responder (as suas instruções, a conversa até ao momento, os documentos que colar) tem de caber num espaço fixo: a janela de contexto. Mede-se em tokens, não em páginas, e inclui a resposta que o modelo está a escrever, além de tudo o que lhe deu.
Quando uma conversa cresce para lá da janela, algo tem de ceder. Conforme o produto, as mensagens mais antigas são descartadas, resumidas em silêncio ou cortadas. O modelo não anuncia isto. Responde simplesmente com o que ainda cabe.
Dois esclarecimentos que poupam discussões mais tarde: a janela é por conversa, não por conta, e reinicia sempre que abre um chat novo. Nada de “aprendido” numa conversa passa para a seguinte, a menos que o produto tenha uma funcionalidade explícita de memória por cima.
Onde corre mal na prática
A falha clássica é o corte silencioso. Uma sessão de trabalho longa, uma decisão acordada há duas horas, e uma resposta perto do fim que a contradiz. O modelo não mudou de ideias. A decisão saiu da janela e, para o modelo, deixou de existir.
A falha mais subtil: caber não é o mesmo que ser lido. Os modelos distribuem a atenção de forma desigual em textos longos, e o material enterrado no meio de uma colagem grande é usado com menos fiabilidade do que o material no início ou no fim. As equipas testam com uma pergunta sobre a página 2, funciona, e concluem que o documento inteiro está coberto. Não está. A literatura de investigação chama a isto “lost in the middle”.
E há uma fatura. Paga-se por cada token que o modelo lê, em cada pedido. Colar o manual de políticas inteiro em cada pergunta é a forma cara de obter respostas piores.
O que fazer quanto a isso
Hábitos primeiro, ferramentas depois. Mantenha uma tarefa por conversa e abra chats novos sem hesitar. Repita as decisões que importam em vez de confiar que o modelo se lembra delas. Coloque o material de que a resposta depende no início ou no fim do prompt, não no meio. E quando o mesmo corpus é preciso em muitas conversas, pare de colar: esse é o problema que o RAG existe para resolver.
A pergunta a fazer antes de confiar numa
Não é “qual é o modelo com a maior janela”. A janela é um orçamento, e cada pedido gasta-o. A pergunta é: para esta tarefa, o que é que o modelo precisa mesmo de ver, e quem está a decidir o que fica de fora? Se a resposta for “o que a ferramenta calhar de manter”, as falhas serão silenciosas e vai encontrá-las em produção.
Perguntas frequentes
Porque é que a IA se esquece do que dissemos no início da conversa?
Porque a conversa ultrapassou a janela. Quando o texto total excede o limite, as trocas mais antigas são descartadas ou comprimidas para abrir espaço, e o modelo responde como se nunca tivessem existido. Não é descuido; a informação desapareceu mesmo. A solução é processual: repita o que importa, mantenha uma tarefa por conversa e desconfie de conversas muito longas.
Uma janela de contexto maior significa melhores respostas, certo?
Não por si só. Uma janela maior significa que cabe mais, não que tudo o que lá está recebe a mesma atenção. Textos longos são lidos de forma desigual, as secções do meio com menos fiabilidade do que todas as outras, e cada token adicional acrescenta custo e latência. Um conjunto pequeno e bem escolhido de passagens vence rotineiramente uma colagem gigante. O tamanho da janela é capacidade, não compreensão.
Quanto texto cabe, na prática?
As janelas medem-se em tokens, e um token corresponde aproximadamente a três quartos de uma palavra. Uma página densa de texto anda na ordem dos 500 tokens, pelo que uma janela de 128.000 tokens dá, em teoria, algumas centenas de páginas. Na prática, reserve espaço para a própria conversa e para a resposta a ser escrita, e lembre-se de que caber não é o mesmo que ser lido com atenção.
A janela de contexto é o mesmo que a memória do modelo?
Não. A janela é memória de trabalho: contém esta conversa e esvazia-se quando a conversa termina. Os produtos que parecem lembrar-se de si entre sessões estão a acrescentar uma funcionalidade separada por cima, normalmente guardando notas e reinserindo-as na janela mais tarde. O que não for escrito de novo é esquecido.
A trabalhar nisto com a sua equipa?
A Olaia Labs desenvolve programas de formação e automação com IA para PMEs. Comece com um diagnóstico: analisamos onde a sua equipa já usa IA, onde falha e o que vale a pena automatizar.
Pedir um diagnóstico