Руководство по vector DB / RAG — от наивного RAG к продакшену
Вы знаете, «что такое RAG», но при сборке ответ выходит мимо — потому что это всё ещё наивный RAG: небрежная нарезка и обычный векторный поиск. Как практическое продолжение статьи 030, здесь поэтапно разбирается практический конвейер RAG 2026 года (умный chunking, embedding, vector DB, гибридный поиск, reranking): стратегии chunking (recursive 512 как дефолт, semantic/structural/parent-child, Contextual Retrieval, по сообщениям сокращающий неудачи извлечения вплоть до 67%), выбор модели embedding (text-embedding-3-large и др.), сравнение шести vector DB (Chroma для прототипирования, pgvector с Postgres, низколатентный Qdrant, полностью управляемый Pinecone, чемпион по гибриду Weaviate, крупномасштабный Milvus), гибридный поиск со слиянием BM25 + плотных векторов через RRF, retrieve-then-rerank с bi-encoder, затем cross-encoder (Cohere/Voyage/BGE/Jina), разделение LlamaIndex (извлечение) против LangChain/LangGraph (управление), почему окно в 1M токенов не заменяет RAG (lost in the middle, отвлечение) и нюансы вывода в продакшн, такие как построение набора для eval в первую очередь.