大模型算力选型工作台

私有化部署容量与成本初步测算

保守口径 · 可追溯假设 · POC 前评估
方案 A · 初步可行

结果用于立项与 POC 前估算,不替代厂商实测。

工程估算
总显存需求
0GB
基础容量服务器
0台
实际部署服务器
0台
预计业务吞吐
0tok/s

容量判断

先通过显存门槛,再通过吞吐门槛,最终按 8 卡服务器取整。

显存需求构成
模型权重KV 缓存运行开销
基础容量可用显存

三年 TCO

方案 A 的自建、租赁与云 API 采用同一业务负载口径;硬件金额以 1 台 8 卡服务器计。

价格可在左侧调整

方案 A / B 决策对比

成本分别使用各自 GPU 单价,容量采用同一业务目标。

计算口径与数据依据

把假设放在台面上,面试时才能讲清楚结果为什么可信。

更新:2026-08-01

核心公式(白话版,面试可直接讲)

① 权重显存:总参数量 × 每参数字节。模型的"脑子本体"要整个搬进显存。671B 用 FP8 就是约 671 GB。MoE 注意:显存按总参数量算(所有专家都得在场),速度才看激活参数量。

② KV 缓存:并发 × 上下文长度 × 每 token 缓存。每个用户对话时模型要记"草稿",人越多、聊得越长,草稿纸越多。DeepSeek 的 MLA 约 70 KiB/token(普通 70B 约 320 KiB)。权重精度和 KV 精度分开设置,避免 INT4 权重量化误把 KV 也压缩。

③ 两道门槛 + N+1:显存放不放得下 + 吞吐跑不跑得动,吞吐门槛先换算为完整的 8 卡服务器,再取更严者。单节点只给出 8 卡工程吞吐估算;跨节点不做线性承诺,必须通过 POC。生产模式额外加 1 台备用。

④ 三年 TCO:一体机 = 购置 + 3 年运维;租赁 = 月租 × 36;云 API = 输入/输出分别计费。硬件价格以 8 卡服务器为单位,且不含 CPU、内存、存储、网络、机房、电力、软件授权和税费。云 API 账面便宜但医疗等强合规行业数据不出院,一票否决。

⑤ 量化边界:INT4 / MXFP4 按 0.5 B/参数粗算,未单独计入 scale、元数据、embedding 和混合精度层;最终显存必须按实际量化格式和服务框架复核。

公开资料入口

KV 缓存值优先按公开架构公式验算(2 × 层数 × KV 头数 × head_dim × 每元素字节 / 1024 = KiB/token);例如 Qwen3-235B-A22B 按 94 层、4 个 KV 头、128 维、FP16 约为 188 KiB/token。KDA、DeltaNet、MSA、局部注意力等混合架构按长上下文部署经验保守估算。吞吐与价格非厂商承诺,正式方案需替换为 POC 实测数据与有效报价。