| 显卡型号 | 核心架构 | 制程工艺 | 基础频率 | 加速频率 | 流处理 | 内存类型 | 内存频率 | 内存位宽 | TDP功耗 | ||
| NVIDIA Tesla V100 SXM2 | Volta | 12 nm | 1245 MHz | 1530 MHz | 5120 | HBM2 | 876 MHz | 4096 bit | 300W | 详细参数>> | |
| NVIDIA RTX 3090 Ti | Ampere | 8 nm | 1560 MHz | 1860 MHz | 10752 | GDDR6X | 1313 MHz 21 Gbps |
384 bit | 450W | 详细参数>> |
核心频率、CUDA 版本与显存位宽上,RTX 3090Ti 采用 Ampere 架构、CUDA 8.6,显存带宽高达 1.01 TB/s,而 Tesla V100 采用 Volta、CUDA 7.0,显存位宽为 4096 bit,带宽为 897 GB/s。
在算术运算能力方面,V100 的 FP64 8.177 TFLOPS 是 RTX 3090Ti 的 64 倍,适合需要双精度计算的数值模拟、量子化学等场景;但在 FP32 与 FP16 方面,RTX 3090Ti 分别可达 40 TFLOPS 与 40 TFLOPS,几乎是 V100 的两倍,能为游戏渲染、实时光线追踪以及大多数深度学习训练提供更快的单精度推理速度。
Tensor Core 资源:V100 拥有 640 个 Tensor Core,RTX 3090Ti 只有 336,虽然后者的 TF32 模式能在一定程度上弥补数量不足,但在需要大量混合精度训练时,V100 的总算力更有优势。
显存容量方面,V100 可选 16 GB 或 32 GB,显存位宽更宽,适合需要大量数据并行运算的高端 AI 推理;RTX 3090Ti 的 24 GB 在 384 bit 位宽下已能满足大多数游戏与 AI 训练的显存需求。
功耗与热设计:V100 的 TDP 为 300 W,RTX 3090Ti 为 450 W,后者在高负载下的功耗更高,散热和电源要求更严格。
实际使用示例
选择建议
通过以上指标与使用场景的对应,可在不涉及价格的前提下判断哪款显卡在特定任务中表现更优。