| 显卡型号 | 核心架构 | 制程工艺 | 基础频率 | 加速频率 | 流处理 | 内存类型 | 内存频率 | 内存位宽 | TDP功耗 | ||
| NVIDIA GTX 1070 Ti | Pascal | 16 nm | 1607 MHz | 1683 MHz | 2432 | GDDR5 | 2002 MHz 8 Gbps |
256 bit | 180W | 详细参数>> | |
| NVIDIA CMP 40HX | Turing | 12 nm | 1470 MHz | 1650 MHz | 2304 | GDDR6 | 1750 MHz 14 Gbps |
256 bit | 185W | 详细参数>> |
GTX 1070Ti 与 CMP 40HX 在多项核心指标上呈现不同侧重点。
核心架构与频率
GTX 1070Ti 基于 Pascal,主频 1607 MHz、Turbo 1683 MHz;CMP 40HX 使用 Turing,主频 1470 MHz、Turbo 1650 MHz。
Turing 的 SM 设计相对更现代,但 Pascal 在单个 SM 的核心数量与时钟上略占优势。
并行单元与 SM 数量
GTX 1070Ti 拥有 2432 个 CUDA 核心,19 个 SM;CMP 40HX 拥有 2304 个 CUDA 核心,36 个 SM。
36 个 SM 在整体并行度上更高,但每个 SM 的核心数略低,导致两卡的 CUDA 核心总量相近。
显存与带宽
两卡均配 8 GB 256‑bit 宽度。
GTX 1070Ti 采用 GDDR5,显存频率 2002 MHz;CMP 40HX 采用 GDDR6,显存频率 1750 MHz。
GDDR6 的 14 Gbps 时钟配合 4 MB L2 缓存,使得 CMP 40HX 的总带宽达到 448 GB/s,约为 GTX 1070Ti 的 256 GB/s 的 1.75 倍。
对于需要大量显存带宽的实时渲染或深度学习推理任务,CMP 40HX 的带宽优势更为明显。
理论浮点性能
图形功能
输出与使用场景
哈希率表现
需要显示输出、游戏或日常桌面使用
选择 GTX 1070Ti。它的显存类型与频率与大多数游戏兼容,Pixel Rate 107.7 GPixel/s 在纯渲染上略优;另外 8 GB GDDR5 在多数 1080p/1440p 游戏中已足够。
主要用于 GPU 密集型计算或需要大显存带宽的工作负载
CMP 40HX 更合适。其 448 GB/s 带宽与 15 TFLOPS FP16 能显著提升纹理映射、机器学习推理或深度渲染任务的吞吐。
矿机或服务器部署
CMP 40HX 由于无输出、低功耗与高算力,是矿池或计算集群的首选。
长期使用与功耗考量
两卡 TDP 均为 180‑185 W,功率差距不大;但 1070Ti 采用 16 nm 工艺,功耗与热设计略低,适合低温或长时间运行的桌面环境。
软件兼容性
若使用需要 CUDA 6.1 以上或特定驱动版本的应用,CMP 40HX 的 CUDA 7.5 与较新驱动更为友好;但大多数现代库(CUDA 10+)对两者均兼容。
综上,若目标是普通游戏或需要直接接驳显示器,GTX 1070Ti 更符合需求;若目标是 GPU 计算、挖矿或需要更高显存带宽、FP16 性能,CMP 40HX 具备更强竞争力。