总显存需求
0GB
私有化部署容量与成本初步测算
结果用于立项与 POC 前估算,不替代厂商实测。
先通过显存门槛,再通过吞吐门槛,最终按 8 卡服务器取整。
方案 A 的自建、租赁与云 API 采用同一业务负载口径。
成本分别使用各自 GPU 单价,容量采用同一业务目标。
把假设放在台面上,面试时才能讲清楚结果为什么可信。
① 权重显存:总参数量 × 每参数字节。模型的"脑子本体"要整个搬进显存。671B 用 FP8 就是约 671 GB。MoE 注意:显存按总参数量算(所有专家都得在场),速度才看激活参数量。
② KV 缓存:并发 × 上下文长度 × 每token缓存。每个用户对话时模型要记"草稿",人越多、聊得越长,草稿纸越多。DeepSeek 的 MLA 把草稿压到约 70KB/token(普通 70B 要 320KB)。权重精度和 KV 精度分开设置,避免 INT4 权重量化误把 KV 也压缩。
③ 两道门槛 + N+1:显存放不放得下 + 吞吐跑不跑得动,取较严者凑整到 8 卡服务器。吞吐已含 85% 多卡通信效率。生产模式额外加 1 台备用。
④ 三年 TCO:一体机 = 购置 + 3 年运维;租赁 = 月租 × 36;云 API = 输入/输出分别计费。云 API 账面便宜但医疗等强合规行业数据不出院,一票否决。
KV 缓存值均按公开架构公式验算(2 × 层数 × KV头数 × 128 × 2 / 1024 = KB/token),部分未完全公开架构的模型标注为估算。吞吐与价格非厂商承诺,正式方案需替换为 POC 实测数据与有效报价。