大模型算力选型工作台

私有化部署容量与成本初步测算

保守口径 · 可追溯假设 · POC 前评估
方案 A · 初步可行

结果用于立项与 POC 前估算,不替代厂商实测。

工程估算
总显存需求
0GB
基础容量服务器
0
实际部署服务器
0
预计业务吞吐
0tok/s

容量判断

先通过显存门槛,再通过吞吐门槛,最终按 8 卡服务器取整。

显存需求构成
模型权重KV 缓存运行开销
基础容量可用显存

三年 TCO

方案 A 的自建、租赁与云 API 采用同一业务负载口径。

价格可在左侧调整

方案 A / B 决策对比

成本分别使用各自 GPU 单价,容量采用同一业务目标。

计算口径与数据依据

把假设放在台面上,面试时才能讲清楚结果为什么可信。

更新:2026-07

核心公式(白话版,面试可直接讲)

① 权重显存:总参数量 × 每参数字节。模型的"脑子本体"要整个搬进显存。671B 用 FP8 就是约 671 GB。MoE 注意:显存按总参数量算(所有专家都得在场),速度才看激活参数量。

② KV 缓存:并发 × 上下文长度 × 每token缓存。每个用户对话时模型要记"草稿",人越多、聊得越长,草稿纸越多。DeepSeek 的 MLA 把草稿压到约 70KB/token(普通 70B 要 320KB)。权重精度和 KV 精度分开设置,避免 INT4 权重量化误把 KV 也压缩。

③ 两道门槛 + N+1:显存放不放得下 + 吞吐跑不跑得动,取较严者凑整到 8 卡服务器。吞吐已含 85% 多卡通信效率。生产模式额外加 1 台备用。

④ 三年 TCO:一体机 = 购置 + 3 年运维;租赁 = 月租 × 36;云 API = 输入/输出分别计费。云 API 账面便宜但医疗等强合规行业数据不出院,一票否决。

公开资料入口

KV 缓存值均按公开架构公式验算(2 × 层数 × KV头数 × 128 × 2 / 1024 = KB/token),部分未完全公开架构的模型标注为估算。吞吐与价格非厂商承诺,正式方案需替换为 POC 实测数据与有效报价。