Respuestas

La búsqueda encuentra el documento correcto y la respuesta sigue saliendo con la línea desactualizada del principio. ¿Por qué la recuperación parece correcta cuando la respuesta no lo es?

Porque recuperar y armar son dos pasos distintos, y un número verde en el primero no dice nada del segundo. Lo que llega al modelo aquí no es un documento para que otra capa lo recorte: es una afirmación, entregada como una línea con autor que carga el punto operativo, y el cuerpo entero solo vuelve cuando alguien pide esa memoria por su nombre. No hay principio de archivo donde truncar ni párrafo que elegir mal. Una afirmación sustituida no es la vecina peor rankeada de su sustituta — se retira en el mismo acto que acepta la sustitución, con el motivo y el autor guardados en su línea archivada. Y una afirmación que alguien vio contradecir a su fuente llega marcada como contradicha, en lugar de llegar limpia. Cuál versión rige se decide una vez, por una persona, en el registro; no se vuelve a decidir en cada llamada por quien tenga la última palabra sobre el prompt.

Última actualización 22 de septiembre de 2026

El recall responde la pregunta de un paso antes de la que duele

Las métricas de recuperación puntúan la búsqueda: si el documento correcto era encontrable y en qué posición vino. Lo que produce la respuesta equivocada está más adelante — el texto que de verdad entró al modelo después de que algo decidiera qué cabía. Entre esos dos puntos hay una capa que trunca, resume o se queda con los primeros N caracteres de lo que recibió, y toma esa decisión con noción de parecido y ninguna de vigencia. Los documentos crecen por añadido, así que la corrección suele estar al final y la afirmación original al principio; una capa que se queda con el principio se queda con la versión más vieja de cada archivo que toca. Todos los tableros de ese camino siguen en verde, porque cada capa hizo el trabajo por el que se la mide. La falla solo existe en el hueco entre ellas, que es exactamente donde nadie mira.

Se sirve una afirmación, no un documento para recortar

Cada memoria aquí es una afirmación, y viaja como una línea con autor — nunca la primera frase de un cuerpo más largo, que es el atajo que trae el mismo problema de vuelta con otro nombre. La línea dice el punto operativo; el cuerpo entero es recuperable, pero solo cuando alguien pide esa memoria por su nombre. El ranking, entonces, elige QUÉ afirmaciones vuelven, no qué párrafo de una grande entra. Es un trabajo más estrecho, y es un trabajo que falla de forma visible: el peor caso es que quede fuera una memoria relevante, y la lectura lo dice en voz alta — en lugar de que entre una memoria relevante por su mitad vieja, que no lo dice nadie.

La vigencia se decide una vez, en el registro, no en cada llamada

Cuando algo se sustituye, la sustituta nombra lo que contradice, y aceptarla retira la afirmación anterior en el mismo acto, con el motivo guardado en la línea archivada. La versión vieja no es una hermana que podría ganarle a su propia sucesora en una consulta escrita de otra manera — está fuera de circulación y solo vuelve como historia. Donde la divergencia se vio pero todavía no se resolvió, el registro también lo carga: quien abrió la fuente y la vio discrepar anota lo que la fuente dice de hecho, y desde ahí la memoria llega marcada en lugar de llegar como si nada hubiera pasado. Todo eso lo deciden personas, una vez, y lo lee cada sesión después. La alternativa — decidir cuál de las dos versiones rige dentro del armado del prompt, en cada llamada, solo por parecido — es el arreglo que produce respuestas seguras de marzo.

Cómo se ve en la práctica

Un equipo guarda su proceso de release en un archivo de contexto. La sección se escribió en marzo. En agosto alguien agrega un título nuevo al final: los releases ya no se etiquetan a mano. Le preguntan al asistente cómo sale un release. La recuperación funciona perfecto — el archivo correcto, en la primera posición, con puntaje seguro. El armado tiene entonces un presupuesto, el archivo es más largo que el presupuesto, y pasa la primera parte. El modelo responde con marzo, en detalle, con el tono de algo consultado. Quien preguntó no tiene cómo ver que la respuesta salió de un párrafo que otro párrafo del mismo archivo contradice. Nada en ese camino reporta una falla. El recall de recuperación es el número que el equipo mira, y está bien. Quien escribió el párrafo de agosto hizo lo correcto, en el lugar correcto. La capa que lo descartó estaba haciendo aquello para lo que existe. Con afirmaciones la forma es otra, porque no hay archivo que cortar. La de marzo y la de agosto son dos afirmaciones; la segunda nombra a la primera como aquella que sustituye; aceptarla retiró la primera. La lectura devuelve la afirmación de agosto como línea, sin nada encima donde truncar y sin hermana más vieja a la que perder.

Preguntas que la gente hace sobre esto

¿No es un problema de chunking? Dividir mejor lo arreglaría.
Dividir mejor mejora la probabilidad de cada llamada y deja la forma intacta. El armado sigue teniendo que elegir, cada vez, y sigue eligiendo por parecido — que no distingue el párrafo vigente del que lo sustituyó, porque ambos hablan del mismo asunto, que es justamente por qué ambos puntúan bien. Se puede volver más raro el error y no se lo puede volver visible, porque un documento truncado no reporta lo que dejó fuera. Lo que elimina la clase de falla no es elegir mejor en la lectura; es no tener un documento que elegir.
¿Cómo sabemos que la afirmación que volvió es la vigente y no una vieja que rankeó bien?
Porque ser sustituida es un acto con registro, no una cuestión de ranking. La sustituta tiene que nombrar lo que contradice, y al aceptarla la afirmación anterior queda archivada con el motivo y el autor, así que deja de ser algo que una consulta pueda devolver. Dos afirmaciones vigentes que discrepan de verdad son otro caso, y ese se trata como un conflicto a exponer, nunca como un empate a resolver en silencio. Lo que nunca vuelve es una versión anterior presentada como si fuera la actual.
Medimos recall de recuperación y es alto. ¿Qué deberíamos medir en su lugar?
Mide lo que llegó al modelo, contra lo que regía en ese momento. El recall responde si lo correcto era encontrable. La pregunta que anticipa respuestas equivocadas es si lo correcto — y nada más viejo que eso — estaba en el texto que el modelo de verdad leyó. Las dos se separan en cuanto cualquier capa entre el almacenamiento y el modelo puede acortar lo que recibió. Si vas a guardar un solo número, sácalo de la carga entregada y no del resultado de la búsqueda.
Instalar ArrowayVer cómo funciona →

Dónde se puede comprobar

Documentación de producto en este sitio (Cómo funciona, Instalación), las respuestas sobre por qué RAG no sustituye a la memoria sancionada, sobre memoria desactualizada leída como vigente y sobre relevos verbosos que inflan a cada agente siguiente, y las reglas de línea con autor, sustitución, verificación y conflicto en la especificación sancionada del producto. Todo lo descrito aquí es comportamiento que las herramientas aplican hoy, no roadmap.

https://www.arroway.app/es/answers/retrieval-succeeds-but-assembly-uses-the-stale-part