Saltar al contenido
Condictor Studio
IA
IA

Qué es RAG y cuándo compensa

RAG recupera materiales relevantes antes de responder y se los entrega al modelo como contexto. Descubre cuándo ayuda y cuánto cuesta.

Aprox. 6 min de lecturapor
Una pregunta busca fragmentos relevantes en documentos y el modelo devuelve una respuesta con una referencia a la fuente

RAG (Retrieval-Augmented Generation) es una técnica en la que el sistema busca materiales relevantes antes de formular una respuesta y se los entrega al modelo como contexto. Gracias a ello, la respuesta puede utilizar datos actuales que no están en los parámetros del modelo e indicar las fuentes. Lewis y sus coautores describieron el nombre y el mecanismo básico en el artículo original sobre RAG de 2020.

Esa es toda la idea. El resto de este artículo trata de sus consecuencias, costes y trampas.

Cómo funciona RAG paso a paso

Hay cinco etapas. La preparación de las fuentes y del índice se repite cuando cambia el material; la búsqueda y la generación se realizan con cada pregunta:

  1. Recopilación de fuentes. Documentos, contratos, procedimientos, hilos de correo y tablas. Se hace una vez y después de forma periódica al actualizarse.
  2. División y descripción del material. El documento se divide según su estructura y los fragmentos reciben metadatos. El efecto del tamaño de los fragmentos debe comprobarse en la evaluación: no existe una longitud única correcta para todas las fuentes.
  3. Indexación. En una variante habitual, los fragmentos reciben representaciones vectoriales; el índice también puede admitir búsqueda de palabras, filtros y metadatos. El mecanismo depende de las preguntas.
  4. Búsqueda al recibir la pregunta. El sistema recupera candidatos mediante método vectorial, textual, híbrido o una consulta a una fuente estructurada, y puede volver a ordenar sus resultados.
  5. Generación y control de la respuesta. El modelo recibe la pregunta y el material encontrado. Una implementación de producción debe indicar las fuentes y aplicar una regla de rechazo o escalado cuando la base sea insuficiente.

Una instrucción por sí sola no garantiza que el modelo la siga. Por ello se necesitan citas verificables, un criterio de base suficiente y una respuesta correcta de «no hay datos». RAG puede limitar las confabulaciones, pero no las elimina.

RAG o fine-tuning: tabla de decisión

RAG y el fine-tuning pueden complementarse, pero sus aplicaciones principales son distintas. RAG entrega material en el momento de responder, mientras que el ajuste modifica el comportamiento del modelo a partir de ejemplos; el ajuste por sí solo no es un almacén fiable de conocimiento actual y citable.

RAGFine-tuning
Responde a la pregunta«qué hay en nuestros datos»«con qué estilo y formato responder»
Actualización del conocimientoactualiza el índice al cambiar la fuentenormalmente exige un nuevo ciclo de ajuste
Indicación de la fuentese puede vincular la respuesta con el fragmento recuperadono surge del ajuste; exige un mecanismo separado
Coste de entradadepende de las fuentes, permisos y evaluacióndepende de los datos de entrenamiento y el proceso de ajuste
Cambio del modelo baseexige reevaluar búsqueda y respuestaspuede exigir nuevo ajuste y evaluación

La regla práctica es que el conocimiento actual y citable suele entregarse más fácilmente mediante búsqueda, mientras que el formato y el comportamiento se moldean con instrucciones, ejemplos o ajuste. Estas técnicas pueden combinarse; la elección se confirma con pruebas sobre las tareas objetivo.

Qué determina que RAG funcione bien

Hay cuatro áreas que deben probarse juntas; su efecto depende de las fuentes y del tipo de preguntas:

  • Estado de las fuentes. Versiones contradictorias de un procedimiento pueden aportar bases contradictorias. Hacen falta versionado, una persona propietaria del documento y una regla de prioridad entre fuentes.
  • Forma de dividir y enriquecer los fragmentos. Un fragmento sin contexto («el punto 4.2 no se aplica a clientes del grupo B») es inútil o perjudicial. Los fragmentos deben llevar metadatos: de dónde proceden, de qué versión y a quién afectan.
  • Calidad de la búsqueda. La similitud vectorial sola puede tratar peor nombres propios, números y símbolos. La búsqueda híbrida y el reranking son hipótesis que deben comprobarse con un conjunto de preguntas, no una receta automática.
  • Evaluación. Un conjunto de preguntas con respuestas esperadas que se ejecuta después de cada cambio. Sin ello, «hemos mejorado» significa «hemos cambiado algo y esperamos que funcione».

Cuándo RAG no es una buena solución

  • Cuando no puede obtenerse el conocimiento de forma fiable. El texto se puede indexar directamente; las imágenes o escaneos, después de extraerlos o mediante un flujo multimodal. Si la respuesta existe solo en la cabeza de una persona, primero hay que documentarla.
  • Cuando las preguntas exigen cálculos o agregaciones. «¿Cuántos clientes se fueron en junio?» es una consulta a una base de datos, no a una búsqueda semántica aislada. Se necesita una capa analítica o un mecanismo controlado para crear y validar consultas.
  • Cuando las preguntas requieren cálculos o recorrer relaciones. «¿Qué contratos con este subcontratista vencen antes de la auditoría?» se atiende mejor con una consulta a datos estructurados, a veces apoyada por un grafo de conocimiento, que con la similitud de fragmentos por sí sola.
  • Cuando un conjunto pequeño y estable cabe con seguridad en el contexto. Entregarlo completo puede ser más simple que un pipeline, siempre que coste, permisos y calidad de respuesta superen una prueba.

Cuánto cuesta implantar RAG

Nuestras horquillas para agosto de 2026: piloto sobre una parte del conocimiento: 12 000–30 000 zł netos (orientativamente 3–5 semanas, con evaluación); sistema de producción con integración: 30 000–120 000 zł netos; mantenimiento de calidad: 2 000–6 000 zł netos/mes.

A esto se suma el coste corriente de modelos e infraestructura, que depende, entre otras cosas, del volumen, la longitud del contexto, la caché y los reintentos. Un piloto permite medir la calidad, el uso por las personas usuarias y el coste con datos propios antes de decidir pasar a producción.

Preguntas frecuentes

¿Nuestros documentos se usarán para entrenar el modelo?

RAG no lo determina por sí solo. Los documentos pueden permanecer en tu base, pero los fragmentos recuperados siguen llegando al modelo elegido. El uso para entrenamiento, la retención y el lugar de procesamiento dependen del servicio, el plan y el contrato. Estas condiciones deben comprobarse antes de implantarlo.

¿RAG elimina las alucinaciones?

Las limita, no las elimina. El modelo todavía puede interpretar mal un fragmento o responder cuando debería decir «no lo sé». Por eso exigimos citar la fuente y medimos con qué frecuencia el sistema responde sin base.

¿Cuántas fuentes hacen falta para que tenga sentido?

No hay un número mínimo de fuentes. Calcula la frecuencia y el coste de búsqueda, el riesgo de una respuesta errónea, la calidad de los documentos y el coste de crear y mantener el sistema. Un conjunto pequeño puede justificar una búsqueda más simple o entregar todo el contexto controlado, en vez de un pipeline completo.


RAG y los grafos de conocimiento son tecnologías; para ti cuenta el resultado que llamamos second brain para empresas. Describimos nuestras propias herramientas en el laboratorio de grafos de conocimiento: las hemos construido para nosotros y por eso separamos con claridad la experiencia de investigación de los resultados de clientes.

Maciej Szukalski

Autor

Maciej Szukalski

Fundador de Condictor · arquitecto de sistemas · investigación y desarrollo

Diseña y desarrolla productos digitales desde 2014. Se especializa en arquitectura, investigación y aplicaciones con capas de automatización e inteligencia.

¿Tienes un problema que resolver?

Veamos cuál es el mejor primer paso

Describe tu situación en unas frases. Volveremos con preguntas o una propuesta concreta para el siguiente paso.

Describe tu tema

Ver también

Todos los artículos