| 显卡型号 | 核心架构 | 制程工艺 | 基础频率 | 加速频率 | 流处理 | 内存类型 | 内存频率 | 内存位宽 | TDP功耗 | ||
| NVIDIA P104-100 | Pascal | 16 nm | 1607 MHz | 1733 MHz | 1920 | GDDR5X | 1251 MHz 10 Gbps |
256 bit | 200W | 详细参数>> | |
| NVIDIA CMP 30HX | Turing | 12 nm | 1530 MHz | 1785 MHz | 1408 | GDDR6 | 1750 MHz 14 Gbps |
192 bit | 125W | 详细参数>> |
核心频率与理论 FP32 性能上,GP104‑100 的 1607 MHz 频率与 6.655 TFLOPS 的单精度峰值显著高于 TU116‑100‑HX 的 1530 MHz / 5.027 TFLOPS。其 1920 个着色单元与 120 TMU 的规模在光栅化与纹理采样密集场景中仍能保持相对优势,尽管其显存位宽为 256 bit,显存类型为 GDDR5X,频率 1251 MHz,带宽 320 GB/s。
TU116‑100‑HX 则采用 12 nm 工艺,搭载 1408 个着色单元、88 TMU 与 48 ROP,显存为 6 GB GDDR6,频率 1750 MHz,带宽 336 GB/s,且 PCIe 3.0 ×4 的总线可在高带宽数据传输时提供更好的吞吐。其 FP16 双精度支持在 10.05 TFLOPS,远超 Pascal 的 104 GFLOPS,表明 Turing 在低精度算术与深度学习推理上更具潜力。
在矿业算力方面,ETHash(Dagger‑Hashimoto)与 ETCHash 对 P104‑100 的算力分别为 35 MH/s 与 38 MH/s,明显高于 CMP 30HX 的 27.5 MH/s。相反,NexaPow 算法在 CMP 30HX 上达到 32 MH/s,而 P104‑100 仅 8.55 MH/s,显示 Turing 在此哈希算法上更高效。
功耗层面,CMP 30HX 的 TDP 125 W,建议电源 300 W;P104‑100 的 TDP 未公开但建议电源 200 W,实际功耗往往接近 250 W,能耗更高。
从尺寸与接口来看,CMP 30HX 更短(229 mm vs 267 mm),并采用 PCIe 3.0 ×4,可在多卡并行配置中减少带宽瓶颈。两者均无输出接口,主要定位于矿机或服务器场景。
适用场景举例
选择建议