Guia de Implementação de Vector DB / RAG — Do RAG Ingênuo à Produção
Você sabe "o que é RAG", mas, ao construir um, a resposta sai errada — porque ainda é RAG ingênuo: picar de qualquer jeito e fazer uma busca vetorial simples. Como o complemento de implementação ao artigo 030, este texto explica o pipeline de RAG prático de 2026 (chunking inteligente, embedding, vector DB, busca híbrida, reranking) etapa por etapa: estratégias de chunking (recursive 512 como padrão, semantic/structural/parent-child, Contextual Retrieval reduzindo falhas de retrieval em até 67%), a escolha de um modelo de embedding (text-embedding-3-large, etc.), uma comparação de seis vector DBs (Chroma para prototipagem, pgvector com Postgres, Qdrant de baixa latência, Pinecone totalmente gerenciado, o campeão de híbrida Weaviate, Milvus para grande escala), busca híbrida fundindo BM25 + vetores densos com RRF, retrieve-then-rerank com um bi-encoder e depois um cross-encoder (Cohere/Voyage/BGE/Jina), a divisão entre LlamaIndex (retrieval) e LangChain/LangGraph (controle), por que uma janela de 1M de tokens não substitui o RAG (lost in the middle, distração) e cuidados na produção, como construir um conjunto de avaliação primeiro.