Cuándo usar recuperación agéntica y cuándo basta una búsqueda directa
AWS presenta una recuperación que descompone preguntas complejas en pasos. La clave no es usar más agentes, sino escoger el modo de búsqueda que la tarea necesita y poder auditarlo.
El 24 de julio de 2026, AWS explicó cómo su API AgenticRetrieveStream para Amazon Bedrock Managed Knowledge Base convierte una consulta en una pequeña investigación: puede planificar pasos, recuperar información de una base de conocimiento y devolver una traza de lo que hizo. La novedad útil no es que toda pregunta deba pasar por un agente. Es saber distinguir una pregunta que pide un dato local de otra que exige descomponer, contrastar y unir varias piezas de evidencia.
La decisión de 60 segundos
Empiece por escribir qué necesita el usuario como resultado. Si pide un dato concreto que debería estar en un documento —por ejemplo, «¿cuál es el plazo de cancelación del contrato X?»—, la recuperación directa suele ser la opción razonable. La API Retrieve de Bedrock busca fragmentos relevantes en la base de conocimiento para una consulta dada. Hay menos pasos que inspeccionar, menos demora y un camino más corto entre pregunta, fragmento y respuesta.
Si la petición contiene varias tareas encadenadas —«compara las condiciones de los tres contratos, señala qué excepción afecta a nuestra sede y cita cada cláusula»—, una única búsqueda puede traer textos relevantes sin resolver cómo combinarlos. Ahí tiene sentido evaluar recuperación agéntica. AWS la describe en su anuncio técnico como un proceso que planifica y ejecuta recuperaciones para responder consultas complejas. Es una posibilidad, no una garantía de que el resultado sea correcto. Y AWS pone cifras a cuándo compensa: sobre MuSiQue, un banco de preguntas que exigen encadenar varios documentos, la recuperación agéntica mejora el recall un 22,8% en preguntas de dos saltos, un 31,9% en las de tres y un 37,3% en las de cuatro. El patrón es la lección: cuanto más difícil la pregunta, mayor la ganancia — y, por el contrario, en una pregunta de un solo salto el agente añade coste sin añadir casi nada.
La capacidad que conviene llevarse es simple: no pregunte «¿tenemos agentes?». Pregunte «¿esta tarea requiere buscar un hecho o coordinar varias búsquedas verificables?».
Qué cambia cuando la recuperación planifica pasos
La documentación de AgenticRetrieveStream especifica que la operación transmite eventos mientras procesa la solicitud. Entre ellos puede aparecer la respuesta y la información de trazabilidad. Esa traza importa más que la etiqueta agéntica: permite revisar qué consultas intermedias se hicieron, qué resultados se consideraron y dónde se apoyó la síntesis final. La traza no es un adorno: AWS la emite como una secuencia ordenada de eventos con nombres propios —recuperación especulativa, planificación, recuperación o expansión a documento completo, y resultado—, de modo que cada vuelta del bucle queda a la vista. Ese registro es lo que convierte una caja negra en algo auditable.
Imagine una política interna repartida entre un manual de viajes, una norma de gastos y un anexo local. Una consulta directa puede recuperar los tres textos, pero no necesariamente decidir qué regla aplica primero ni detectar que una excepción geográfica cambia la conclusión. Un flujo agéntico puede dividir la tarea: localizar la política general, buscar la excepción y comprobar si el perfil del empleado entra en ella. Ese orden es útil cuando el problema tiene dependencias.
No confunda ese orden con comprensión infalible. Un sistema puede elegir una subconsulta pobre, recuperar un fragmento desactualizado o unir correctamente textos que no responden a la situación real. Por eso la salida debe conservar enlaces o identificadores de las fuentes y dejar claro qué parte es cita documental y cuál es inferencia. Si no puede revisar la evidencia, el agente solo ha hecho más opaco un error posible.
Dos APIs, dos formas de responder
La diferencia técnica entre ambas operaciones no es un detalle de manual: condiciona cómo se integra la respuesta en un producto. La recuperación directa es síncrona —una llamada, una respuesta— y devuelve fragmentos sin generar texto. La agéntica es siempre en streaming: emite sus eventos según los produce y admite, de forma opcional, generar una respuesta redactada además de la evidencia. Para una interfaz que muestra el progreso al usuario, ese flujo es una ventaja; para un proceso por lotes que solo quiere el resultado final, es una complejidad que hay que gestionar.
El caso donde la variante agéntica es claramente insustituible es el de varias fuentes. Una pregunta que cruza el manual de recursos humanos, la política de seguridad y un contrato con un proveedor no vive en una sola base de conocimiento. La recuperación directa consulta una; la agéntica reparte la pregunta entre hasta cinco, decide a cuál va cada parte leyendo la descripción de cada una, y reúne la evidencia. Ese reparto es trabajo real de coordinación, no un adorno — y es exactamente donde una sola búsqueda por similitud se queda corta por diseño, no por mala suerte.
Un procedimiento que se puede seguir
Antes de activar un modo agéntico, pruebe esta secuencia con una consulta real:
- Formule una versión mínima de la pregunta que pueda responder un solo documento. Ejemplo: «muéstrame la cláusula de cancelación del contrato X». Ejecútela con recuperación directa y compruebe el fragmento devuelto.
- Anote las dependencias que faltan. ¿Hay que comparar versiones, aplicar una excepción, calcular una condición o reunir documentos distintos? Si no las hay, no añada un agente por prestigio técnico.
- Si las hay, formule el resultado esperado y los límites: documentos permitidos, fecha de vigencia y necesidad de citas. Use recuperación agéntica para la tarea compuesta.
- Revise la traza y la evidencia antes de usar la respuesta. Una buena prueba es pedir a otra persona que llegue a la misma conclusión solo con los fragmentos citados. Si no puede, la respuesta no está suficientemente sustentada.
- Mida también el coste operativo, y hágalo en la unidad correcta. AWS cobra el modo agéntico gestionado a 4 dólares por cada 1.000 llamadas agénticas más 1 dólar por cada 1.000 llamadas de recuperación subyacentes, y advierte de que el gasto y la latencia se planifican «por iteraciones, no solo por tokens»: cada vuelta del bucle cuesta dinero y tiempo. Añada el porcentaje de salidas que una revisión humana corrige. Una respuesta más elaborada no compensa si no mejora la decisión.
Lo que está documentado y lo que todavía debe probarse
Está documentado que Bedrock ofrece tanto recuperación directa como la operación de recuperación agéntica, y que esta última expone un flujo de eventos y trazas según la configuración de la solicitud. También es documentable que el producto está pensado para bases de conocimiento gestionadas —la variante agéntica puede consultar hasta cinco a la vez, enrutando cada pregunta con una descripción en lenguaje natural de qué contiene cada base—, no para convertir cualquier fuente externa en evidencia fiable por sí misma.
No está documentado, en cambio, que el modo agéntico vaya a mejorar toda base de conocimiento o toda métrica de negocio. El efecto depende de la calidad, actualidad y permisos de los documentos, de la consulta y de cómo se evalúe la respuesta. AWS no convierte una traza en una auditoría independiente ni una cita en una conclusión correcta.
La regla durable es elegir la complejidad que se puede inspeccionar. Para un hecho puntual, recupere el fragmento y léalo. Para una pregunta compuesta, permita que el sistema planifique, pero conserve el plan, las fuentes y el derecho a decir «no hay evidencia suficiente». Así la recuperación agéntica deja de ser una palabra de moda y pasa a ser una herramienta con una condición clara: debe hacer visible, no esconder, el camino hasta la respuesta. Y la cifra de MuSiQue da la regla de bolsillo: si su pregunta es de un solo salto, pague por un solo salto; el agente rinde donde hay varios documentos que unir, y su ganancia crece justo con la dificultad que a un humano más le cuesta resolver a mano.
Fuentes de esta pieza
Esta pieza se apoya en 3 fuente(s) primaria(s), recogidas durante la investigación.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.