Speeds and feeds

Accelerator Catalog

A selectable comparison matrix for AI training and inference accelerators: memory capacity, HBM bandwidth, low-precision peaks, interconnects, power envelopes, and source-backed detail pages.

How to read this table

This page keeps chip-level and accelerator-level numbers separate from node, rack, and pod numbers where possible. Vendor peak FLOPS are useful for orientation, but sustained model throughput depends on kernels, parallelism, memory traffic, collective communication, and software maturity.

Dense and sparse tensor peaks are not interchangeable. FP4, FP6, FP8, BF16, and INT8 formats also differ across vendors, so this catalog is a starting point for analysis rather than a final benchmark ranking.

Comparison Matrix

10 of 10 chips selected

LowerHigherPer metric and mode, selected devices
Per-accelerator vendor peaks. Dense and sparse values are compared independently. NA means not reported, not zero.
MetricInstinct MI300XAMD - CDNA 3Instinct MI325XAMD - CDNA 3Instinct MI355XAMD - CDNA 4Instinct MI455XAMD - CDNA 5H200 SXMNVIDIA - HopperB200 SXMNVIDIA - BlackwellTrainiumAWS - NeuronCore-v2Trainium2AWS - NeuronCore-v3Cloud TPU v5pGoogle - TPU v5p TensorCoreCloud TPU v6e / TrilliumGoogle - TPU v6e TensorCore
Memory
CapacityGB19225628843214118034.36 (32 GiB)103.079 (96 GiB)9532
TechnologyHBM3HBM3EHBM3EHBM4HBM3EHBM3EHBMHBMHBM2eHBM
HBM bandwidthTB/s5.36823.34.880.822.92.7651.6
Compute
Dense | SparsePeak throughput
FP4PFLOPS
Dense: NASparse: NA
Dense: NASparse: NA
Dense: 10.1Sparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: 9Sparse: 18
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
BLOCK FP4PFLOPS
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: 40.265Sparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
INT4TOPS
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
FP6TFLOPS
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
BLOCK FP6PFLOPS
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: 20.133Sparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
FP8PFLOPS
Dense: 2.61Sparse: 5.22
Dense: 2.61Sparse: 5.22
Dense: 5Sparse: 10.1
Dense: 20.133Sparse: NA
Dense: 1.979Sparse: 3.958
Dense: 4.5Sparse: 9
Dense: NASparse: NA
Dense: 1.299Sparse: 2.563
Dense: NASparse: NA
Dense: NASparse: NA
BLOCK FP8PFLOPS
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: 20.133Sparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
INT8POPS
Dense: 2.6Sparse: NA
Dense: 2.6Sparse: NA
Dense: 5Sparse: NA
Dense: 5.033Sparse: 10.066
Dense: 1.979Sparse: NA
Dense: NASparse: NA
Dense: 0.38Sparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: 1.836Sparse: NA
BF16PFLOPS
Dense: 1.3Sparse: NA
Dense: 1.3Sparse: NA
Dense: 2.5Sparse: NA
Dense: 5.033Sparse: 10.066
Dense: 0.989Sparse: NA
Dense: 2.25Sparse: NA
Dense: 0.19Sparse: NA
Dense: 0.667Sparse: NA
Dense: 0.459Sparse: NA
Dense: 0.918Sparse: NA
FP32TFLOPS
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: 315Sparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
INT32TOPS
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
FP64TFLOPS
Dense: 81.7Sparse: NA
Dense: 81.7Sparse: NA
Dense: 78.6Sparse: NA
Dense: 5Sparse: NA
Dense: 34Sparse: NA
Dense: 40Sparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Dense: NASparse: NA
Platform
VendorAMDAMDAMDAMDNVIDIANVIDIAAWSAWSGoogleGoogle
ArchitectureCDNA 3CDNA 3CDNA 4CDNA 5HopperBlackwellNeuronCore-v2NeuronCore-v3TPU v5p TensorCoreTPU v6e TensorCore
UnitOAM acceleratorOAM acceleratorOAM acceleratorGPU (per accelerator)SXM GPUSXM GPUCloud accelerator chipCloud accelerator chipCloud TPU chipCloud TPU chip
Form factorOAM moduleOAM moduleOAM moduleEnhanced Accelerator Module (EAM)SXMSXMTrn1 instance chipTrn2 instance chipCloud TPU slice chipCloud TPU slice chip
Launch2023-12-062024-10-102025-06-122026-07-232023-11-132024-03-182022-11-282024-12-032023-12-062024-12-11
InterconnectAMD Infinity Fabric - 8 links, 128 GB/s peak per linkAMD Infinity Fabric - 8 links, 128 GB/s peak per linkAMD Infinity Fabric - 7 links, 153 GB/s peak per linkUALoE (UALink over Ethernet) - 3.6 TB/s peak bidirectional scale-up per GPU; 600 GB/s peak bidirectional scale-out per GPUNVIDIA NVLink - 900 GB/s per GPUNVIDIA NVLink 5 / NVSwitch - 1.8 TB/s per GPU, derived from DGX B200 aggregateNeuronLink-v2 - 384 GB/s inter-chipNeuronLink-v3 - 1.28 TB/s per chipICI 3D torus - 1200 GB/s bidirectional per chipICI 2D torus - 800 GB/s bidirectional per chip
Power750 W peak TBP1000 W peak TBP1400 W TBPNot published in cited AMD specificationsUp to 700 W configurable TDPPlatform dependent; DGX B200 is ~14.3 kW max for 8 GPUsNot published per chipNot published per chipNot published per chipNot published per chip
Software stackROCmROCmROCmROCmCUDA, TensorRT-LLM, NVIDIA AI EnterpriseCUDA, TensorRT-LLM, NVIDIA AI EnterpriseAWS Neuron SDKAWS Neuron SDKJAX, XLA, TensorFlow, PyTorch/XLAJAX, XLA, TensorFlow, PyTorch/XLA

Per accelerator, vendor peaks. NA = not reported. Single reported values are unshaded.

Hardware Roofline

Selected devices plotted as peak throughput ceilings against arithmetic intensity on log-log axes.

Instinct MI300X1.3 PFLOPS peak, knee 245.28 FLOP/byte
Instinct MI325X1.3 PFLOPS peak, knee 216.67 FLOP/byte
Instinct MI355X2.5 PFLOPS peak, knee 312.5 FLOP/byte
Instinct MI455X5.03 PFLOPS peak, knee 216.01 FLOP/byte
H200 SXM989 TFLOPS peak, knee 206.04 FLOP/byte
B200 SXM2.25 PFLOPS peak, knee 281.25 FLOP/byte
Trainium190 TFLOPS peak, knee 231.71 FLOP/byte
Trainium2667 TFLOPS peak, knee 230 FLOP/byte
Cloud TPU v5p459 TFLOPS peak, knee 166 FLOP/byte
Cloud TPU v6e / Trillium918 TFLOPS peak, knee 573.75 FLOP/byte