| 显卡型号 | 核心架构 | 制程工艺 | 基础频率 | 加速频率 | 流处理 | 内存类型 | 内存频率 | 内存位宽 | TDP功耗 | ||
| NVIDIA CMP 40HX | Turing | 12 nm | 1470 MHz | 1650 MHz | 2304 | GDDR6 | 1750 MHz 14 Gbps |
256 bit | 185W | 详细参数>> | |
| NVIDIA GTX 1070 Ti | Pascal | 16 nm | 1607 MHz | 1683 MHz | 2432 | GDDR5 | 2002 MHz 8 Gbps |
256 bit | 180W | 详细参数>> |
核心频率、显存带宽和显存类型上,CMP 40HX 采用 12 nm Turing 核心、GDDR6 8 GB、256 bit 位宽,内存频率 1750 MHz,带宽 448 GB/s;GTX 1070Ti 采用 16 nm Pascal 核心、GDDR5 8 GB、256 bit 位宽,内存频率 2002 MHz,带宽 256.3 GB/s。显存带宽几乎翻倍,能够在需要大量纹理数据的 4K 游戏、VR 或大型开源数据集渲染中提供更好的吞吐量。
在算术性能方面,GTX 1070Ti 的 FP32 浮点功率 8.186 TFLOPS 略高于 CMP 40HX 的 7.603 TFLOPS;但 CMP 的 FP16 处理能力 15.21 TFLOPS(2:1)远高于 127.9 GFLOPS,说明 Turing 的 Tensor 单元在半精度计算上更有优势,可在支持 Tensor 运算的 AI 推理或深度学习推断任务中占优。两卡的 FP64 性能相似,都是 255–237 GFLOPS。
架构层面,CMP 40HX 的 SM 数量 36 与 GTX 1070Ti 的 19 相差明显,Turing 的 TMU 数量 144 与 152 差距不大,ROP 64 对于像素写入压力相同。CMP 的 L2 缓存 4 MB 是 Pascal 的两倍,能够降低内存访问延迟,进一步提升需要大内存缓存的工作负载(例如大规模几何体渲染、实时光追)。
显卡尺寸、功耗与接口:CMP 40HX 仅占 229 mm 长、111 mm 宽、35 mm 高,且不提供任何显示输出,TDP 185 W;GTX 1070Ti 更大(267 mm × 112 mm × 40 mm),同样 180 W,但拥有 1 DVI、1 HDMI 2.0 和 3 DisplayPort 1.4a 接口,适合多屏显示或直接连接显示器。电源接口相同,均为单个 8‑pin。
跑分数据显示,CMP 40HX 在 DaggerHashimoto(36)、ETCHash(36)以及 NexaPow(48)算法上都优于 GTX 1070Ti,而 GTX 1070Ti 在 NexaPow 上仅 8。由于 CMP 设计为矿机,专门优化了 SHA‑256 相关计算,显得更适合加密货币挖矿。
选择依据示例
| 用例 | 推荐卡 | 说明 |
|---|---|---|
| 高分辨率 4K 游戏、VR | CMP 40HX | 448 GB/s 带宽可显著减少纹理瓶颈,Turing Tensor 单元也为未来光追奠定基础。 |
| 需要直接连接显示器的家庭/办公 | GTX 1070Ti | 有完整的显示端口,可在多显示器布局下使用。 |
| 需要在 GPU 上执行 AI 推理(TensorFlow、PyTorch) | CMP 40HX | Tensor 单元在 FP16 下强大,适合模型推断。 |
| 矿工 | CMP 40HX | 最高矿算力,且功耗相对低,缺乏显示接口并非障碍。 |
| 内容创作(渲染、3D 建模) | GTX 1070Ti | FP32 性能略好,且 12 nm 结构在传统渲染工作负载下更成熟。 |
在没有价格信息的前提下,选卡应依据具体工作负载决定:如果需要更大的内存带宽、Tensor 运算或加密货币挖矿,CMP 40HX 更具优势;若需要完整显示输出、传统 FP32 性能或成熟的 Pascal 生态,GTX 1070Ti 更为合适。