Una demostración de RAG puede parecer convincente con diez documentos y preguntas preparadas. Producción empieza cuando la colección cambia, los permisos importan, las preguntas son ambiguas y una respuesta incorrecta cuesta tiempo o confianza.
El sistema no debe evaluarse solo por lo fluido que redacta. Debe demostrar que encuentra evidencia pertinente, respeta el acceso, distingue ausencia de información y permite reconstruir cómo llegó a una respuesta.
Separar recuperación y generación
Si una respuesta falla, hay que saber si el problema estaba en la fuente, la indexación, la consulta, el ranking o el modelo generativo. Medir únicamente la respuesta final oculta esa cadena. Una evaluación útil conserva el conjunto de fragmentos esperados y comprueba si aparecen con suficiente prioridad.
También hay que registrar versiones: documento, fecha de indexación, configuración del recuperador y modelo. Sin esa información, comparar una mejora con el comportamiento anterior se convierte en una impresión.
Los permisos son parte de la recuperación
Filtrar después de generar es demasiado tarde. La identidad, el tenant, el rol y la clasificación documental deben limitar qué fragmentos pueden entrar en contexto. Los tests tienen que incluir intentos de cruce entre clientes, áreas o niveles de confidencialidad.
El principio es simple: una respuesta no puede revelar ni inferir contenido que el usuario no podría abrir en la fuente original.
Evidencia visible y abstención
Una cita útil apunta al fragmento y documento concretos, no a una lista genérica de fuentes. El usuario debe poder abrir el contexto y comprobar si sostiene la afirmación. Cuando la evidencia es insuficiente o contradictoria, el comportamiento correcto puede ser no responder y proponer una búsqueda o escalado humano.
- Mostrar fragmentos y metadatos relevantes.
- Diferenciar respuesta, interpretación y ausencia de evidencia.
- Señalar documentos obsoletos o en conflicto.
- Evitar que una instrucción dentro de un documento gobierne el sistema.
Evaluar con preguntas reales
El conjunto de evaluación debe cubrir preguntas fáciles, ambiguas, sin respuesta, sensibles y adversariales. Conviene revisar recuperación, fidelidad a las fuentes, utilidad y seguridad por separado. Las métricas automáticas ayudan a detectar regresiones, pero una muestra humana sigue siendo necesaria para decidir si el sistema sirve al proceso.
Antes de ampliar usuarios, debe existir un umbral acordado y un procedimiento para incidentes: qué logs se conservan, quién revisa una respuesta, cómo se corrige una fuente y cuándo se desactiva una capacidad.
El criterio de salida
RAG está listo cuando el equipo puede explicar qué corpus usa, quién puede verlo, cómo se actualiza, qué preguntas resuelve, cómo se mide y qué hace cuando no encuentra base suficiente. La latencia y el coste importan, pero no sustituyen esas garantías.
Preguntas frecuentes
¿Una cita convierte automáticamente una respuesta en fiable?
No. La cita debe ser pertinente y sostener la afirmación. Un enlace a un documento relacionado pero insuficiente solo añade apariencia de rigor.
¿Puede evaluarse RAG solo con un modelo juez?
Puede acelerar el análisis, pero debe calibrarse con revisiones humanas y pruebas deterministas de permisos, recuperación y formato.
¿Qué debe ocurrir si no hay evidencia?
El sistema debe abstenerse, explicarlo con claridad y ofrecer una ruta segura: reformular, buscar otra fuente o escalar a una persona.
