自建RAG客服要多大显存?把硬件账和SaaS账拆开算
客服工单里 70% 是重复问题,这是中小企业想上 AI 客服最直接的动因。但真正动手时,第一个卡点往往不是模型选型,而是「要买多大显存的机器」,以及「这笔钱和直接买 SaaS 客服比,到底哪个划算」。下面按运维和开发者能直接照做的口径拆开算。
一、显存怎么估:先看模型参数量,再看并发
RAG 客服的显存占用分两块:一是基座模型本身,二是向量检索与上下文缓存。经验口径如下(FP16 推理):
- 7B 模型:权重约 14GB,加 KV Cache 与上下文,单卡 16GB 是底线,24GB 更稳。
- 14B 模型:权重约 28GB,一般需要 2×24GB 或单卡 48GB。
- 32B 模型:权重约 64GB,通常要 2×48GB 或 4×24GB 起步。
- 若用 4bit 量化(GPTQ/AWQ),显存可压到 FP16 的约 1/3,7B 在 8GB 卡上也能跑,但首字延迟和长上下文稳定性会下降。
向量库本身不吃显存,吃内存和磁盘。10 万条知识切片用 FAISS 或 Milvus,内存 8~16GB 量级基本够用,真正吃资源的是 embedding 模型和 rerank 模型,这两个小模型可以用 CPU 或共享 GPU 跑,不必占推理卡。
并发是第二个变量。以 7B 模型为例,单张 24GB 卡在 FP16 下,通常能支撑 5~10 路并发对话;量化后能到 15~20 路。中小企业的客服并发一般不高,日均几百到几千次咨询、峰值同时在线十几路,7B 量化 + 24GB 卡就能覆盖。如果客服是 7×24 且有大促峰值,建议按峰值并发 ×1.5 预留。
二、首字延迟与线路:比显存更容易被忽略
用户对 AI 客服的容忍线大致是首字 1~2 秒。影响它的不只是 GPU,还有网络往返。机房选在哪个地区,直接决定延迟:
- 用户主要在国内:香港机房走 CN2 或优化线路,往返通常在 30~60ms;
- 用户在日本、东南亚:日本或新加坡机房更合适,延迟 20~50ms;
- 用户在欧洲或北美:硅谷、法兰克福节点,跨太平洋线路一般 120~180ms。
这里有个合规前提:如果知识库包含客户订单、个人信息,数据不出境往往是硬约束,此时只能选境内或香港节点,不能为了省 GPU 钱把数据放到海外。反过来,如果做的是出海独立站客服,把推理节点放在目标市场附近,比放在国内再绕出去体验好得多。
三、成本账:自建 vs SaaS,三年怎么比
SaaS 客服的定价通常按坐席或按对话量计费,市场行情大致是每坐席每月几十到几百元,AI 增值包另算。一个 3~5 人客服团队,一年 SaaS 支出量级在几千到两三万元;如果按对话量计费,量大时成本会线性上升。
自建的成本分三块:
- 硬件/租用:入门级 GPU 物理机月租从百元级到千元级不等,视显卡型号和带宽而定;
- 模型与开发:开源模型本身免费,但 RAG 管线、知识库清洗、评测调优需要人力,通常 1~2 人月起步;
- 运维:电费、备份、模型更新、监控,小团队一般每月几个工时。
判断标准很简单:如果客服并发低、知识库更新频繁、且团队没有 GPU 运维经验,SaaS 前两年更省心;如果对话量大、数据敏感、或希望把 AI 能力复用到其他业务(如工单分类、文档问答),自建在第二年之后边际成本明显更低,且模型和数据完全自主。
四、选购时该对比的参数清单
- 显存与卡型:能否满足目标模型的最低显存,是否支持量化推理;
- 内存与磁盘:向量库和日志吃内存,SSD 容量决定知识库能放多大;
- 带宽与线路:10M 还是 100M,是否 CN2/优化线路,直接影响首字延迟;
- 地区与合规:数据是否允许出境,用户主要在哪;
- 可扩展性:能否加卡、加内存,避免业务翻倍时整机换掉;
- 计费方式:月付还是年付,是否支持随时升级。
避坑要点:不要只看显卡型号不看显存,GT 系列和入门卡跑 7B 量化模型只能算「能跑」,不适合生产;不要用 10M 带宽扛图片或文件类知识库的上传;不要忽略备份,模型和向量库一旦损坏重建成本很高。
选购推荐
如果只是先跑通 RAG 客服原型、验证效果,建议从入门 GPU 物理机起步,控制试错成本。香港显卡物理服务器 E5-2660 配置为 GT740(4GD5)/16G/240G SSD+1T HDD/10M 带宽,月付 124.95 元,适合做小规模知识库问答和流程验证,国内访问延迟友好。若需要更稳的推理性能,香港显卡物理服务器 2*E5-2660(1050 Ti)提供 1050 Ti/64G/240G SSD+1T HDD/10M 带宽,月付 196.35 元,64G 内存对向量库更宽裕,是 7B 量化模型跑生产客服的务实选择,可参考 香港显卡物理服务器2*E5-2660 (1050 Ti)。如果客服面向海外用户、且数据允许出境,硅谷节点的 GPU 机型在带宽和跨区访问上更有优势,可按目标市场就近选择。
决策建议
显存按「模型参数量 ×2 + 并发余量」估,7B 量化 + 24GB 显存是多数中小企业 RAG 客服的甜点配置;机房按用户位置和数据合规选,香港兼顾国内延迟与出海便利。成本上,先用低月租 GPU 物理机验证效果,跑通后再决定是加卡扩产还是回到 SaaS,比一上来就重资产投入稳妥得多。