核心频率与架构
- RTX 3090 采用 Ampere,基准频率 1395 MHz,Turbo 1695 MHz,核心工艺 8 nm。
- RX 9070XT 采用 RDNA 4.0,基准频率 1660 MHz,Turbo 2970 MHz,核心工艺 5 nm。
RDNA 4.0 设计在单周期吞吐上更为高效,导致 Turbo 频率相较 Ampere 翻倍,单周期着色器效率有显著提升。
单元数量
- Shading Units:RTX 3090 10496,RX 9070XT 4096。
- TMUs:RTX 3090 328,RX 9070XT 256。
- ROPs:RTX 3090 112,RX 9070XT 128。
- Tensor Cores:RTX 3090 328,RX 9070XT 128。
- RT Cores:RTX 3090 82,RX 9070XT 64。
RTX 3090 在着色单元、Tensor 与 RT 单元数量上占优,意味着在需要大规模并行计算(AI 推理、光追)时具备更高的理论峰值。
显存与带宽
- RTX 3090 24 GB GDDR6X,位宽 384 bit,带宽 936.2 GB/s。
- RX 9070XT 16 GB GDDR6,位宽 256 bit,带宽 644.6 GB/s。
RTX 3090 提供更宽的显存总线和更高的频率,适合大纹理与多显存需求的工作负载;RX 9070XT 的显存频率略高(2518 MHz 对 1219 MHz),但位宽不足,导致总带宽低于 RTX 3090。
理论浮点性能
- FP32:RTX 3090 35.58 TFLOPS,RX 9070XT 48.66 TFLOPS。
- FP16(单精度/半精度):RTX 3090 35.58 TFLOPS,RX 9070XT 97.32 TFLOPS。
- FP64:RTX 3090 556 GFLOPS,RX 9070XT 1.521 TFLOPS。
RX 9070XT 在 FP32 与 FP16 方面表现更佳,主要归因于更高的时钟与更宽的着色器并行度;在 FP64 计算上 RTX 3090 仍占优势。
功耗与接口
- TDP:RTX 3090 350 W,RX 9070XT 304 W。
- 接口:RTX 3090 1×12‑pin,RX 9070XT 2×8‑pin。
- PCIe:RTX 3090 PCIe 4.0 x16,RX 9070XT PCIe 5.0 x16。
RX 9070XT 的功耗略低,PCIe 5.0 为未来高带宽应用预留空间。
跑分对比(2560×1440 级别)
| 3DMark 评分 | RTX 3090 | RX 9070XT |
| Time Spy Score | 18739 | 26837 |
| Time Spy Graphics | 19198 | 30530 |
| Ice Storm Extreme Graphics | 614504 | 341716 |
| Cloud Gate Score | 84813.5 | 78448 |
| Cloud Gate Graphics | 231612 | 151649 |
| Fire Strike Standard Score | 38957 | 50248 |
| Fire Strike Standard Graphics | 47241 | 64925 |
| Ice Storm Graphics | 672680 | 375846 |
- 在以 DirectX 12 为主的 2560×1440 级别测试中,RX 9070XT 的得分普遍高于 RTX 3090,说明在该分辨率与渲染负载下,RDNA 4.0 的吞吐更佳。
- 在以 DirectX 11 为主的低分辨率或旧版游戏测试中,RTX 3090 的得分相对更稳固,尤其在 “Ice Storm Extreme Graphics” 与 “Cloud Gate” 系列中表现更好,显示其对传统渲染管线的兼容性更强。
- “Ice Storm Graphics” 对低端 GPU 进行评测时,RTX 3090 仍能保持较高分数,反映其整体渲染稳定性。
实际使用场景举例
- 4K 游戏 + 光追:RTX 3090 的 RT 核心数量与更宽显存总线使其在高分辨率、光追密集的游戏(如《赛博朋克 2077》、《光环:无限》)下保持更高帧率与更细腻画质。
- 高分辨率多显示器/VR:RX 9070XT 的高 FP32 与 FP16 峰值在 1440 p 多显示器组合中能提供更连贯的帧率,且功耗略低,适合对能耗敏感的工作站。
- AI 推理/深度学习:RTX 3090 的 Tensor 核心数量与显存容量是其优势所在,适合需要大批量矩阵运算与大模型存储的任务;RX 9070XT 虽然 FP16 更高,但 Tensor 核心数量不足,推理吞吐受限。
- 工作站与渲染:在需要大量显存与高精度双精度运算(如 CFD、科学计算)的场景,RTX 3090 仍是首选;RX 9070XT 在图形渲染与传统 3D 建模方面表现可接受,但显存不足可能导致大型场景受限。
如何选择
- 主攻游戏(4K + 光追):首选 RTX 3090,因其显存容量与 RT 单元优势可提供更高质量画面与更流畅体验。
- 多显示器/VR、日常游戏:RX 9070XT 在功耗与吞吐上更优,适合对功耗与散热有严格要求的系统。
- AI / 高精度计算:RTX 3090 在 Tensor 与 FP64 上更具优势,适合深度学习训练或科学计算。
- 预算受限:若不考虑价格,单纯性能对比可通过跑分与架构特性判断;若预算有限,可优先考虑 RX 9070XT 在 1440 p 级别游戏中的高得分表现。
以上结论基于官方参数与 3DMark 的标准测试,实际体验会受驱动、散热与主机配置的影响。