广告图片
TOP云-靠谱的企业级公有云服务平台

云服务器、物理服务器、云安全、SSL证书限时3折抢购!

双路E5-2640V4(40核)64G内存480G SSD硬盘30M独享带宽物理机仅需368元;香港铂金云服务器2H/2G/15M仅需19.8元/月;4H/4G/25M仅需29.8元/月,

TOP云-靠谱的企业级公有云服务平台:双路E5-2640V4(40核)64G内存480G SSD硬盘30M独享带宽物理机仅需368元;香港铂金云服务器2H/2G/15M仅需19.8元/月;4H/4G/25M仅需29.8元/月,云服务器、物理服务器、云安全、SSL证书限时3折抢购!点击这里立即抢购! 展开广告

大模型RAG部署:GPU显存需求清单

9 月 16, 2026

结论先行:RAG部署GPU主要跑embedding和LLM生成。embedding模型小,7B LLM推理24GB显存够用,70B需要40GB以上。

一、RAG组件显存

Embedding模型:几百MB。Rerank模型:1GB以内。LLM推理:7B FP16约14GB,70B INT4约40GB。向量数据库:CPU内存即可,不占GPU。

二、推荐配置

个人项目:单卡4090跑7B模型加bge-large embedding,显存绰绰有余。企业生产:A10或L40S跑70B INT4,支持多并发。

三、性能优化

Embedding批量计算,不要逐句调。Rerank只对top 10做。LLM用vLLM加速,KV Cache复用。

四、成本估算

单卡4090按量跑RAG,一天约几十元。包月更划算。

补充:向量数据库选Chroma或Milvus,都在CPU上跑不占GPU。Embedding模型选bge-large-zh-v1.5,7B模型选Qwen2或Llama3。

RAG部署GPU实例可在GPU算力平台选择。

xtyly

发表回复