What costs belong in a RAG pipeline?
Include document parsing, embeddings, vector storage and queries, reranking, LLM input and output, observability, data transfer, and maintenance.
Free · Private · Editable assumptions
Estimate RAG ingestion, embedding, vector database, retrieval, LLM generation, and monthly operating costs.
01 · Pipeline inputs
02 · Decision view
One-time embedding cost
$0.160Monthly operating cost
$214.5Cost per 1,000 answers
$2.15Methodology
ingestion = document tokens × embedding rate
monthly = LLM query cost + vector store + monitoring & operationsThis planning model excludes parsing/OCR, reranking, data transfer, cache effects, provider minimums, evaluation runs, and labor outside the entered operations allowance. Use invoice or benchmark data when available.
Questions people ask
Include document parsing, embeddings, vector storage and queries, reranking, LLM input and output, observability, data transfer, and maintenance.
Initial embedding is usually an ingestion cost. Re-embedding changed documents creates recurring spend, which you can model by entering the monthly changed-document volume.
At scale, answer-generation tokens often dominate. At low volume, vector infrastructure minimums and engineering operations can matter more.
No. Retrieval quality, answer accuracy, latency, security, and evaluation matter. Cheap retrieval that produces unsupported answers is not economical.