Guía de implementación de vector DB / RAG — del RAG ingenuo a producción
Sabes "qué es RAG", pero cuando construyes uno la respuesta sale mal, porque sigue siendo RAG ingenuo: trocear descuidadamente y hacer una simple búsqueda vectorial. Como continuación de implementación del artículo 030, esto explica etapa por etapa el pipeline de RAG práctico de 2026 (chunking inteligente, embedding, vector DB, búsqueda híbrida, reranking): estrategias de chunking (recursive 512 por defecto, semantic/structural/parent-child, Contextual Retrieval que según se reporta reduce los fallos de recuperación hasta un 67%), la elección de un modelo de embedding (text-embedding-3-large, etc.), una comparativa de seis vector DB (Chroma para prototipar, pgvector con Postgres, Qdrant de baja latencia, Pinecone totalmente gestionado, Weaviate campeón de la híbrida, Milvus a gran escala), búsqueda híbrida que fusiona BM25 + vectores densos con RRF, retrieve-then-rerank con un bi-encoder y luego un cross-encoder (Cohere/Voyage/BGE/Jina), el reparto entre LlamaIndex (recuperación) y LangChain/LangGraph (control), por qué una ventana de 1M de tokens no reemplaza al RAG (lost in the middle, distracción) y precauciones para producción como construir primero un conjunto de evaluación.