企业想把内部文档、技术手册变成可问答的知识库,部署一个私有RAG系统即可。不需要顶级GPU,一张24GB显存卡就能跑起来。本文给出完整部署方案。
一、私有RAG的算力构成
系统分三块:文档解析和向量化(CPU可承担)、向量检索(CPU即可)、大模型生成(吃GPU)。真正需要GPU的是生成模型,7B模型量化后5GB显存,24GB卡绰绰有余。
二、推荐配置
| 规模 | GPU建议 | 说明 |
|---|---|---|
| 部门级 | 1张24GB | 几十人 |
| 公司级 | 1张48GB | 上百人并发 |
| 多业务线 | 多实例 | 按业务隔离 |
三、部署步骤
- 整理文档,统一格式。
- 向量化入库。
- 部署模型和检索服务。
- 上线测试,持续优化。
企业私有知识库数据敏感,选支持内网隔离的云GPU更安心。需要部署私有RAG时,可参考GPU私有部署,按规模选配置。
实际部署中,文档质量决定了问答效果。垃圾进垃圾出,把扫描件先做文字识别,表格单独处理,否则检索出来的内容乱七八糟,模型回答也跟着错。建议知识库定期增量更新,新文档单独向量化,不必全量重建。权限上不同部门的知识库分开,员工只能问自己有权限看的内容。上线前用真实问题测一轮,挑出答不准的反复调。
四、上线小结
文档清洗、增量更新、权限隔离、真实问题测试,是私有知识库好用的四步。
知识库更新安排在夜间低峰,不影响白天员工正常问答。
私有知识库上线后,员工使用反馈很重要,定期看哪些问题没人答好,针对性补充文档,系统才会越用越好用。不要指望一次建成就完美,它是个持续优化的过程。
总之,文档质量和持续迭代决定私有知识库的实际效果,算力反而是次要的。
持续看问答日志,哪里答不好补哪里。
文档要定期清洗更新,系统才能保持好用。
用好这套系统的关键在持续维护知识库,而非一开始堆算力。
常见问题
问:私有部署数据安全吗?答:数据留在企业内网模型上,不经过外部公网服务,比调用公开API更可控。




