使用文档
显存估算
估算模型推理和训练所需显存,并查看适合的 GPU。
显存估算页用于在购买显卡、配置推理环境或准备微调前做预算。它是参数化估算器,不会读取本地用量,也不会替代框架启动后的真实峰值监控。
选择估算场景
页面支持两种场景:
| 场景 | 适合问题 | 主要组成 |
|---|---|---|
| 推理估算 | 某个模型能否放进一张卡 | 权重、KV Cache、运行时余量 |
| 训练估算 | 全量微调或 LoRA 需要多少显存 | 权重、梯度、主权重、优化器状态、激活值 |
切换场景不会共享表单参数。页面标注「施工中」的模式仍可用于早期预算,最终应结合目标框架和真实 batch size 验证。
推理估算
填写模型参数量、量化精度、上下文长度、batch size 和 KV Cache 设置后,页面会拆解权重与缓存占用,并给出带运行时余量的总显存。上下文越长、batch 越大,KV Cache 增长越明显。
结果中的「适合 GPU」按可用显存而不是标称显存筛选,默认预留一部分空间给 CUDA、框架和临时张量。多卡建议只作为容量参考,实际还要考虑张量并行、通信带宽和模型切分方式。
训练估算
训练模式需要填写词表、隐藏层、层数、注意力头、FFN、精度、优化器、micro batch、梯度累积和序列长度等参数。训练方式可切换全量微调、LoRA 和 QLoRA。
- 全量微调会计入全模型梯度和主权重。
- LoRA 只对选定目标层计算可训练参数,rank 越大占用越高。
- QLoRA 会降低基座权重占用,但不会消除激活、梯度和优化器状态。
- gradient checkpointing、Flash Attention 和显存余量会影响最终结果。
结果如何使用
页面会展示参数规模、可训练参数、各组成项显存和推荐 GPU。建议先用保守参数估算,再用真实运行的 nvidia-smi、框架 profiler 或 OOM 日志校正。
估算结果不包含所有运行时细节,例如通信 buffer、数据加载、编译缓存、显卡驱动占用和特定算子临时内存。跨卡训练时请额外预留空间。
常见问题
为什么标称 24GB 的显卡不一定能跑 24GB 的模型? 模型还需要 KV Cache、激活值和运行时空间,页面按可用显存比例筛选,而不是直接使用标称容量。
LoRA 一定比全量微调省很多吗? 通常梯度和优化器状态会明显减少,但激活值仍由 batch、序列长度和层数决定。
结果可以当作最终配置吗? 不可以。它适合做容量筛选和预算比较,正式部署前应使用目标模型、框架和请求分布做实测。
