大模型算力选型工作台
私有化部署容量与成本初步测算
结果用于立项与 POC 前估算,不替代厂商实测。
容量判断
先通过显存门槛,再通过吞吐门槛,最终按 8 卡服务器取整。
三年 TCO
方案 A 的自建、租赁与云 API 采用同一业务负载口径;硬件金额以 1 台 8 卡服务器计。
方案 A / B 决策对比
成本分别使用各自 GPU 单价,容量采用同一业务目标。
计算口径与数据依据
把假设放在台面上,面试时才能讲清楚结果为什么可信。
核心公式(白话版,面试可直接讲)
① 权重显存:总参数量 × 每参数字节。模型的"脑子本体"要整个搬进显存。671B 用 FP8 就是约 671 GB。MoE 注意:显存按总参数量算(所有专家都得在场),速度才看激活参数量。
② KV 缓存:并发 × 上下文长度 × 每 token 缓存。每个用户对话时模型要记"草稿",人越多、聊得越长,草稿纸越多。DeepSeek 的 MLA 约 70 KiB/token(普通 70B 约 320 KiB)。权重精度和 KV 精度分开设置,避免 INT4 权重量化误把 KV 也压缩。
③ 两道门槛 + N+1:显存放不放得下 + 吞吐跑不跑得动,吞吐门槛先换算为完整的 8 卡服务器,再取更严者。单节点只给出 8 卡工程吞吐估算;跨节点不做线性承诺,必须通过 POC。生产模式额外加 1 台备用。
④ 三年 TCO:一体机 = 购置 + 3 年运维;租赁 = 月租 × 36;云 API = 输入/输出分别计费。硬件价格以 8 卡服务器为单位,且不含 CPU、内存、存储、网络、机房、电力、软件授权和税费。云 API 账面便宜但医疗等强合规行业数据不出院,一票否决。
⑤ 量化边界:INT4 / MXFP4 按 0.5 B/参数粗算,未单独计入 scale、元数据、embedding 和混合精度层;最终显存必须按实际量化格式和服务框架复核。
公开资料入口
- DeepSeek-V4-Flash-0731 官方模型卡 · 正式版权重 / MIT / 1M 上下文
- DeepSeek 官方模型仓库 · V3 技术报告 MLA ≈ 70 KiB/token
- Qwen 官方模型仓库
- Meta Llama 官方模型仓库
- Moonshot Kimi 官方仓库
- Kimi K3 官方说明 · 2.8T / 激活 104B / 1M 上下文
- 智谱 GLM-5.2 官方模型卡
- MiniMax M3 官方模型卡
- Gemma 4 官方说明
KV 缓存值优先按公开架构公式验算(2 × 层数 × KV 头数 × head_dim × 每元素字节 / 1024 = KiB/token);例如 Qwen3-235B-A22B 按 94 层、4 个 KV 头、128 维、FP16 约为 188 KiB/token。KDA、DeltaNet、MSA、局部注意力等混合架构按长上下文部署经验保守估算。吞吐与价格非厂商承诺,正式方案需替换为 POC 实测数据与有效报价。