结论:RAG部署的算力需求分两块——Embedding和大模型推理。前者很小,后者看你用多大模型。多数企业内部RAG,单张中端显卡就能跑,不必为”大模型”三个字就上最贵的卡。
RAG的算力花在哪
文档切分、Embedding、向量检索都很轻量;真正吃显存的是生成回答用的大模型。七B模型量化后单卡可跑,七十B才需要更大显存或多卡。先想清楚你的生成模型选多大。
配置建议
- 七B模型推理:单张十六G以上;
- 十四B模型:单张二十四G;
- 多用户并发:加卡或选大显存。
在 gpu.topyun.vip 上,先租一张中端卡跑通RAG流程,再按真实并发量决定是否加卡。把向量库和应用层跑顺,比一开始堆硬件更重要。
一句话
RAG的难点在数据和流程,不在算力,别本末倒置。
常见疑问
问:RAG要不要自己训练模型?答:多数不用,用现成开源模型加检索就够,把精力放在文档切分和提示词上。
问:多人并发怎么办?答:先估并发量,不够再加卡或选大显存,别一开始就堆硬件。




