CUDA / PyTorch 环境检查
先确认驱动和 GPU 可见,再安装或调整框架。不要只看某个版本号就判断环境一定兼容。
第一轮检查
nvidia-smi nvcc --version python3 --version python3 -m pip --version
如果 nvidia-smi 都无法执行,优先处理驱动、实例状态或镜像问题,不要先重装 PyTorch。
检查 PyTorch 是否识别 GPU
python3 - <<'PY'
import torch
print("torch:", torch.__version__)
print("cuda available:", torch.cuda.is_available())
print("cuda version:", torch.version.cuda)
print("device count:", torch.cuda.device_count())
if torch.cuda.is_available():
print("device 0:", torch.cuda.get_device_name(0))
PY
如何判断问题在哪一层
| 现象 | 优先判断 |
|---|---|
nvidia-smi 不存在 | 镜像或驱动没有准备好,先确认实例实际配置。 |
nvidia-smi 正常,PyTorch 不可用 | Python 环境中的 PyTorch/CUDA 构建不匹配,检查虚拟环境和安装来源。 |
| GPU 数量少于预期 | 确认实例 GPU 数量、容器可见设备变量和程序启动参数。 |
| 显存不足 | 查看任务的 batch size、模型副本、缓存和多卡分配,不要直接归因于平台故障。 |
版本策略:平台镜像、驱动和框架版本会变化。本页提供检查方法,不固定承诺某一组 CUDA/PyTorch 版本;安装前请按项目要求选择兼容组合。