Volver a las guías

Montar un RAG interno

Documentos acotados, búsqueda con fuente, y un chat o una API que el equipo pueda usar.

Un RAG interno es un conjunto acotado de documentos, una búsqueda que devuelve trozos con fuente, y un chat o una API en vuestro entorno. Stack habitual: OpenAI, LangChain, un backend en Python o FastAPI. Docker cuando tiene que correr fuera de un cuaderno.

Qué documentos entran

Esta es la decisión que más pesa. No se indexa «todo lo que hay en Drive». Se elige lo que el equipo ya usa para responder: procedimientos, políticas, manuales, tickets cerrados de un tipo. Se deja fuera contratos ajenos al caso, datos de personas, secretos y borradores que nadie ha validado.

Formatos: PDF, wiki, Markdown, exportes de Drive o de una API. Antes de embeder, se limpia: portadas, pies, tablas rotas, duplicados. Si no se puede citar, no debería entrar. Si no sabéis de dónde salió, es ruido.

Búsqueda que se pueda defender

El modelo no se lee el archivo entero. Se parte, se embede, se busca, y solo entra el contexto recuperado. El equipo tiene que ver la fuente: título, fragmento, enlace o ruta. Sin eso, la respuesta es una ocurrencia.

  • Partir por secciones reales, no por un tamaño que rompa el sentido.
  • Metadatos: origen, fecha, quién puede verlo, idioma. Filtran antes de generar.
  • Si no hay nada útil, se dice. Inventar es peor que callar.

LangChain o un pipeline propio en Python vale si el equipo puede leerlo. pgvector, Pinecone o Chroma se eligen por dónde va a vivir el sistema, no por moda.

Chat o API

Chat interno: un canal que el equipo ya abre. API: el RAG se consume desde un producto, un agente o n8n. Los dos sirven. Quien pregunta entra con la cuenta de la empresa.

Hace falta autenticación, registro de preguntas y una forma de reindexar cuando cambian los archivos. FastAPI o Node llegan. Angular o React solo si hace falta una UI propia.

Cómo se opera

Quién lo despliega. Dónde están las claves. Cómo se actualiza el índice. Qué se hace cuando una respuesta es mala. Docker es el mínimo para no depender de un portátil. Kubernetes, Terraform, AWS o Azure entran si el equipo ya opera así.

Si quieres que lo monte, está en RAG y agentes. El detalle de qué entra y quién pregunta está en datos y acceso para un GPT privado. Madrid.

Contacto

Escríbeme

Si hay que montar un agente, un RAG o un flujo con n8n, escribe o llama.