向量 DB / RAG 实现指南——从 naive RAG 到生产环境
你已经懂了“什么是 RAG”,可一旦动手搭建,答案却偏了——因为它依然是 naive RAG:随意切碎再做普通向量检索。作为第 030 篇文章的实现篇续篇,本文逐阶段讲解 2026 年的实用 RAG 流水线(聪明的 chunking、embedding、向量 DB、混合检索、reranking):chunking 策略(recursive 512 默认,semantic/structural/parent-child,Contextual Retrieval 据报告把检索失败最多减少 67%)、选择 embedding 模型(text-embedding-3-large 等)、六款向量 DB 对比(原型用 Chroma、有 Postgres 用 pgvector、低延迟的 Qdrant、全托管的 Pinecone、混合冠军 Weaviate、超大规模的 Milvus)、用 RRF 融合 BM25 + 稠密向量的混合检索、先 bi-encoder 后 cross-encoder 的 retrieve-then-rerank(Cohere/Voyage/BGE/Jina)、LlamaIndex(检索)vs LangChain/LangGraph(控制)的分工、为何 1M-token 窗口不会取代 RAG(lost in the middle、干扰),以及先建立 eval 集等生产化注意事项。