结论先行:RAG部署GPU主要跑embedding和LLM生成。embedding模型小,7B LLM推理24GB显存够用,70B需要40GB以上。
一、RAG组件显存
Embedding模型:几百MB。Rerank模型:1GB以内。LLM推理:7B FP16约14GB,70B INT4约40GB。向量数据库:CPU内存即可,不占GPU。
二、推荐配置
个人项目:单卡4090跑7B模型加bge-large embedding,显存绰绰有余。企业生产:A10或L40S跑70B INT4,支持多并发。
三、性能优化
Embedding批量计算,不要逐句调。Rerank只对top 10做。LLM用vLLM加速,KV Cache复用。
四、成本估算
单卡4090按量跑RAG,一天约几十元。包月更划算。
补充:向量数据库选Chroma或Milvus,都在CPU上跑不占GPU。Embedding模型选bge-large-zh-v1.5,7B模型选Qwen2或Llama3。
RAG部署GPU实例可在GPU算力平台选择。




