Respostas
A busca acha o documento certo e a resposta ainda sai com a linha desatualizada do começo dele. Por que a recuperação parece correta quando a resposta não é?
Porque recuperar e montar são dois passos, e número verde no primeiro não diz nada sobre o segundo. O que chega ao modelo aqui não é um documento para alguma camada seguinte recortar: é uma afirmação, entregue como uma linha autorada que carrega o ponto operativo, e o corpo inteiro só volta quando alguém pede aquela memória pelo nome. Não existe topo de arquivo para truncar nem parágrafo para escolher errado. Afirmação substituída não é vizinha pior ranqueada da substituta — ela é aposentada no mesmo ato que aceita a substituição, com o motivo e o autor guardados na linha arquivada. E afirmação que alguém viu divergindo da fonte chega marcada como contrariada, em vez de chegar limpa. Qual versão vale se decide uma vez, por uma pessoa, no registro; não se redecide a cada chamada por quem tiver a última palavra sobre o prompt.
Última atualização 22 de setembro de 2026
O recall responde a pergunta de um passo antes da que dói
Métrica de recuperação mede a busca: o documento certo era encontrável, e em que posição ele veio. O que produz a resposta errada está adiante — o texto que de fato entrou no modelo depois de alguma coisa decidir o que cabia. Entre os dois pontos existe uma camada que trunca, resume ou guarda os primeiros N caracteres do que recebeu, e ela faz essa escolha com noção de semelhança e nenhuma de vigência. Documento cresce por acréscimo, então a correção costuma estar no fim e a afirmação original no começo; camada que guarda o começo guarda a versão mais velha de todo arquivo que toca. Todo painel desse caminho segue verde, porque cada camada fez o trabalho pelo qual ela é medida. A falha só existe no vão entre elas, que é exatamente onde ninguém olha.
Serve-se uma afirmação, não um documento para recortar
Cada memória aqui é uma afirmação, e ela viaja como uma linha autorada — nunca a primeira frase de um corpo maior, que é o atalho que traz o mesmo problema de volta com outro nome. A linha diz o ponto operativo; o corpo inteiro é recuperável, mas só quando alguém pede aquela memória pelo nome. O ranqueamento, então, escolhe QUAIS afirmações voltam, e não qual parágrafo de uma grande entra. É um trabalho mais estreito, e é um trabalho que erra de forma visível: o pior caso é memória relevante ficar de fora, e a leitura diz isso em voz alta — em vez de memória relevante entrar pela metade velha, que nada diz.
Vigência se decide uma vez, no registro, não a cada chamada
Quando algo é substituído, a substituta nomeia o que ela contradiz, e aceitá-la aposenta a afirmação anterior no mesmo ato, com o motivo guardado na linha arquivada. A versão velha não é irmã que poderia ganhar da própria sucessora numa consulta escrita de outro jeito — ela está fora de circulação e só volta como histórico. Onde a divergência foi vista mas ainda não foi resolvida, o registro carrega isso também: quem abriu a fonte e a viu discordar anota o que a fonte diz de fato, e dali em diante a memória chega marcada em vez de chegar como se nada tivesse acontecido. Tudo isso é decidido por pessoas, uma vez, e lido por toda sessão depois. A alternativa — decidir qual das duas versões vale dentro da montagem do prompt, a cada chamada, só por semelhança — é o arranjo que produz resposta confiante de março.
Como isso aparece na prática
Um time guarda o processo de release num arquivo de contexto. A seção foi escrita em março. Em agosto alguém acrescenta um título novo no fim: release não é mais etiquetado à mão. Perguntam ao assistente como sai um release. A recuperação funciona perfeitamente — o arquivo certo, na primeira posição, com pontuação confiante. A montagem, então, tem um orçamento, o arquivo é maior que o orçamento, e ela repassa a primeira parte. O modelo responde com março, em detalhe, no tom de quem consultou. Quem perguntou não tem como ver que a resposta veio de um parágrafo que outro parágrafo do mesmo arquivo contradiz. Nada nesse caminho reporta falha. O recall da recuperação é o número que o time acompanha, e ele está certo. Quem escreveu o parágrafo de agosto fez a coisa certa, no lugar certo. A camada que o descartou estava fazendo aquilo para o que ela existe. Com afirmações o formato é outro, porque não há arquivo para cortar. A afirmação de março e a de agosto são duas; a segunda nomeia a primeira como aquela que ela substitui; aceitá-la aposentou a primeira. A leitura devolve a afirmação de agosto como linha, sem nada acima dela para truncar e sem irmã mais velha para perder.
Perguntas que as pessoas fazem sobre isso
- Isso não é problema de chunking? Dividir melhor resolveria.
- Dividir melhor melhora a chance de cada chamada e não muda o formato. A montagem continua tendo que escolher, toda vez, e continua escolhendo por semelhança — que não distingue o parágrafo vigente daquele que ele substituiu, já que os dois falam do mesmo assunto, que é justamente por que os dois pontuam bem. Dá para tornar a escolha errada mais rara e não dá para torná-la visível, porque documento truncado não reporta o que ficou de fora. O que remove a classe de falha não é escolher melhor na leitura; é não ter documento para escolher.
- Como saber que a afirmação que voltou é a vigente, e não uma antiga que ranqueou bem?
- Porque ser substituída é um ato com registro, não questão de ranqueamento. A substituta tem que nomear o que contradiz, e na aceitação a afirmação anterior é arquivada com o motivo e o autor, então ela deixa de ser algo que uma consulta possa devolver. Duas afirmações vigentes que discordam de verdade são outro caso, e esse se trata como conflito a expor, nunca como empate a desfazer em silêncio. O que não volta nunca é versão anterior apresentada como se fosse a atual.
- A gente mede recall de recuperação e ele é alto. O que deveríamos medir no lugar?
- Meça o que chegou ao modelo, contra o que estava vigente naquele momento. Recall responde se a coisa certa era encontrável. A pergunta que prevê resposta errada é se a coisa certa — e nada mais velho que ela — estava no texto que o modelo de fato leu. As duas se separam no instante em que qualquer camada entre o armazenamento e o modelo pode encurtar o que recebeu. Se for para guardar um número só, tire-o da carga entregue, nunca do resultado da busca.
Onde isto se confere
Documentação de produto neste site (Como funciona, Instalação), as respostas sobre por que RAG não substitui memória sancionada, sobre memória desatualizada lida como vigente e sobre bastão prolixo que incha todo agente seguinte, e as réguas de linha autorada, substituição, verificação e conflito na especificação sancionada do produto. Tudo descrito aqui é comportamento que as ferramentas aplicam hoje, não roadmap.
https://www.arroway.app/pt-BR/answers/retrieval-succeeds-but-assembly-uses-the-stale-part