Guide d'implémentation base vectorielle / RAG — du RAG naïf à la production
Vous savez « ce qu'est le RAG », mais quand vous en construisez un la réponse sort à côté — parce que c'est encore du RAG naïf : découper sans soin et faire une simple recherche vectorielle. En tant que volet implémentation de l'article 030, cet article explique le pipeline RAG pratique de 2026 (chunking intelligent, embedding, base vectorielle, recherche hybride, reranking) étape par étape : stratégies de chunking (recursive 512 par défaut, semantic/structural/parent-child, Contextual Retrieval réduisant les échecs de récupération jusqu'à 67 % selon les rapports), le choix d'un modèle d'embedding (text-embedding-3-large, etc.), un comparatif de six bases vectorielles (Chroma pour le prototypage, pgvector avec Postgres, Qdrant faible latence, Pinecone entièrement managé, Weaviate champion de l'hybride, Milvus grande échelle), la recherche hybride fusionnant BM25 + vecteurs denses avec RRF, le retrieve-then-rerank avec bi-encoder puis cross-encoder (Cohere/Voyage/BGE/Jina), la répartition LlamaIndex (récupération) vs LangChain/LangGraph (contrôle), pourquoi une fenêtre de 1M tokens ne remplace pas le RAG (lost in the middle, distraction), et les précautions de mise en production comme construire d'abord un ensemble d'évaluation.