返回首页
← 全部文档

使用文档

显存估算

估算模型推理和训练所需显存,并查看适合的 GPU。

显存估算页用于在购买显卡、配置推理环境或准备微调前做预算。它是参数化估算器,不会读取本地用量,也不会替代框架启动后的真实峰值监控。

选择估算场景

页面支持两种场景:

场景适合问题主要组成
推理估算某个模型能否放进一张卡权重、KV Cache、运行时余量
训练估算全量微调或 LoRA 需要多少显存权重、梯度、主权重、优化器状态、激活值

切换场景不会共享表单参数。页面标注「施工中」的模式仍可用于早期预算,最终应结合目标框架和真实 batch size 验证。

推理估算

填写模型参数量、量化精度、上下文长度、batch size 和 KV Cache 设置后,页面会拆解权重与缓存占用,并给出带运行时余量的总显存。上下文越长、batch 越大,KV Cache 增长越明显。

结果中的「适合 GPU」按可用显存而不是标称显存筛选,默认预留一部分空间给 CUDA、框架和临时张量。多卡建议只作为容量参考,实际还要考虑张量并行、通信带宽和模型切分方式。

训练估算

训练模式需要填写词表、隐藏层、层数、注意力头、FFN、精度、优化器、micro batch、梯度累积和序列长度等参数。训练方式可切换全量微调、LoRA 和 QLoRA。

  • 全量微调会计入全模型梯度和主权重。
  • LoRA 只对选定目标层计算可训练参数,rank 越大占用越高。
  • QLoRA 会降低基座权重占用,但不会消除激活、梯度和优化器状态。
  • gradient checkpointing、Flash Attention 和显存余量会影响最终结果。

结果如何使用

页面会展示参数规模、可训练参数、各组成项显存和推荐 GPU。建议先用保守参数估算,再用真实运行的 nvidia-smi、框架 profiler 或 OOM 日志校正。

估算结果不包含所有运行时细节,例如通信 buffer、数据加载、编译缓存、显卡驱动占用和特定算子临时内存。跨卡训练时请额外预留空间。

常见问题

为什么标称 24GB 的显卡不一定能跑 24GB 的模型? 模型还需要 KV Cache、激活值和运行时空间,页面按可用显存比例筛选,而不是直接使用标称容量。

LoRA 一定比全量微调省很多吗? 通常梯度和优化器状态会明显减少,但激活值仍由 batch、序列长度和层数决定。

结果可以当作最终配置吗? 不可以。它适合做容量筛选和预算比较,正式部署前应使用目标模型、框架和请求分布做实测。