DeepSeek 推理服务要压首字延迟,选云 GPU 还是自建物理机?
做跨境电商独立站的外贸团队,最近半年最常见的动作是:把 DeepSeek 这类开源模型拉到本地,接上自己的产品库和客服话术,做一个只有内部能用的 AI 客服或 RAG 知识库。测试阶段一切正常,单个人问问题,首字延迟一两秒,感觉能用;等到旺季客服同时在线二三十人,第一个字要等七八秒甚至十几秒,客户直接关掉对话框。问题不在模型本身,而在从显存到网络的一整条链路。
首字延迟高,先分清是「算不出来」还是「送不出去」
首字延迟(TTFT)大致由三段构成:请求排队、Prefill 计算、首 token 回传。中小企业踩的坑,九成集中在前两段。
第一是显存不够导致的排队。DeepSeek 蒸馏版 7B/14B 用 FP16 部署,权重加 KV Cache 通常要 16G 到 32G 显存起步;32B 级别一般要 48G 以上。显存一满,请求就只能排队,并发越高,队尾的首字延迟越难看。这也是为什么很多人拿一张消费级显卡跑 7B,单路很快、并发一上来就崩。
第二是量化与推理框架没选对。同一张卡,用 vLLM、TensorRT-LLM 这类带连续批处理(continuous batching)的框架,和用最朴素的逐条推理,并发吞吐能差出数倍。量化到 INT8 或 AWQ 4bit,显存占用能砍一半左右,代价是轻微的质量损失,客服场景通常可以接受。
第三才是网络回传。首 token 体积很小,纯带宽不是瓶颈,但跨境链路的抖动会放大延迟。服务器放在美国、客户和客服在国内,一次 RTT 就多出 150ms 以上;放在香港或新加坡,国内访问通常能压到几十毫秒量级。对首字延迟敏感的场景,机房位置的影响比很多人想象的大。
并发和配置怎么估:先算显存,再算机器
给外贸团队一个可以直接套用的估算顺序:
- 确定模型规模与量化方式:7B/14B 走 INT8 或 4bit,32B 建议至少 48G 显存,70B 级别基本要双卡或 A100/H100 级别,中小企业通常不必上。
- 估算 KV Cache:并发数 × 上下文长度 × 每 token 缓存开销,上下文开 8K 和开 32K,显存占用差好几倍。客服场景把上下文限制在 4K~8K,能显著提高可承载并发。
- 反推机器:单卡 24G 通常能撑 7B 模型 10~20 路中短上下文并发;要稳定跑 30 路以上,建议双卡或换 48G 级别卡。
- 留出 CPU 与内存余量:RAG 知识库的向量检索、文档切片、Embedding 都会吃 CPU 和内存,32G 内存是底线,64G 更稳。
这里要提醒一个常见误区:很多团队买机器时只盯着 GPU 型号,忽略了内存和磁盘 IO。向量库放在机械盘上,检索一次要几百毫秒,照样拖垮首字延迟。
云 GPU、物理机、多 IP 方案,什么场景选什么
三种主流路线的取舍很清楚:
云 GPU 按小时计费适合验证期和流量波动大的团队,不用一次性投入,缺点是长期跑下来成本高,且数据要出内网,做欧盟或东南亚客户业务时要额外评估合规。月成本量级通常从几百元到数千元不等,视卡型和时长而定。
自建物理服务器适合已经确认要长期跑推理、且对数据不出境有要求的团队。一次性投入之外,按月付的裸金属或显卡服务器方案更灵活。香港、日本、新加坡节点对国内访问延迟友好,美国硅谷节点带宽大、单价低,适合面向欧美客户的独立站客服。
多 IP 与中转主要解决的是访问稳定性和地区覆盖,不是算力问题。如果客服分布在国内和海外两地,可以考虑主推理节点放香港,另配中转或边缘节点做接入,避免所有人挤一条跨境链路。
选购时建议逐项对比的参数清单:GPU 型号与显存、是否支持直通(而非虚拟化切分)、内存容量与可否扩展、系统盘是否为 SSD、带宽与月流量、IP 数量、能否自行装驱动和推理框架、是否允许长期高负载运行、以及续费价格是否与首月一致。
选购推荐
如果只是先跑通 DeepSeek 7B/14B 的客服与知识库验证,预算有限又希望国内访问延迟可控,香港显卡物理服务器 2*E5-2660(1050 Ti)是比较好起步的一档:64G 内存给向量检索和 Embedding 留了余量,1050 Ti 配合 4bit 量化跑中小模型推理够用,10M 带宽做文字类问答也基本不紧张,月付 196.35 元,试错成本低。可参考 香港显卡物理服务器2*E5-2660(1050 Ti)。
如果客户主要在欧美,且需要更大带宽支撑素材生成、数字人这类附带业务,硅谷 GPU 服务器 III 更合适:AMD WX 7100 搭配双路 E5-2683v4、64G 内存、1T SSD、100M 带宽,月付 579 元,带宽和内存规格都留出了并发上量后的空间。可参考 硅谷GPU服务器 III。
决策建议
首字延迟这件事,先定位再花钱:单路就慢,是模型和量化的问题;并发一上来才慢,是显存和批处理的问题;只有跨境访问慢,是机房位置的问题。外贸团队比较稳妥的路径是先用香港节点跑通 7B/14B 的推理链路,把上下文长度和并发上限压到合理区间,确认业务真需要再往上升配置。选机器时优先看显存、内存、SSD 和续费价,不要只被 GPU 型号吸引。