Menu
Back previous/next report: k j

NVIDIA NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)

Submitted by NVIDIA

Submission Info
Submitter NVIDIA
Submission ID nvidia-GB300-NVL72_GB300-288GB_aarch64x72_TRT
Submission Status
Submission Date
Publication Date
Division Closed
Model
Model Name Deepseek-R1
Division Closed
Model Precision FP4
Model Link
Calibration Link
Model Notes
Datasets
Dataset Name MLPerf-Deepseek
Dataset Type Performance
Average Input Tokens 803.791249
Dataset Link

System TPS vs. Tokens/s per User

01.0k2.0k3.0k4.0kSystem TPS50100150200Tokens/s per User

System TPS vs. Concurrency

01.0k2.0k3.0k4.0kSystem TPS050100150# of queries

Time to First Token P95 vs. Concurrency

0200400600800TTFT P95 (s)050100150# of queries

Tokens/s per User vs. Concurrency

50100150200Tokens/s per User050100150# of queries
SUT Summary
NVIDIA
System Name NVIDIA GB300 NVL72 (72x GB300-288GB_aarch64, TensorRT)
System Availability Available
System Category Datacenter · On-premise
System Size 72x GB300
Node Types 1
Total Node Count 1
Max Supported Concurrency
Node Type ID 1
Node Count 18
Software
Ubuntu
Framework TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0
Serving Framework TensorRT 10.14, CUDA 13.1, cuDNN 9.17, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0
Inference Backend
Driver
Link to Container
Operating System Ubuntu 24.04
Filesystem
Other Software TensorRT 10.14, CUDA 13.1, cuDNN 9.17, Driver 580.105, TensorRT-LLM feat/1.2-mlpinf, NVIDIA Dynamo mlperf-v6.0-dynamo-v0.8.0, vLLM CentML:mlperf-inf-mm-q3vl-v6.0
Software Notes
Hardware

Processor

Processor Model Name NVIDIA Grace CPU
Processors per Node 2
Cores Per Processor 144
VCPUs Per Processor

Accelerator

Accelerator Model Name NVIDIA GB300
Accelerators per Node 4
Memory Type HBM3e
Memory Capacity 288 GB
Accelerator Interconnect 5th-gen NVLink andNVLink Switches
Host-Accelerator Interconnect NVLink-C2C

Host / Storage

Host Memory Capacity 2.2 TB
Memory Configuration for each 4-GPU node: 2.2TB LPDDR5x
Storage Capacity for each 4-GPU node: 2 TB SSD, 5 TB CIFS
Storage Type NVMe SSD, CIFS mounted disk storage

Networking

Network Interfaces for each 4-GPU node: 4x Mellanox MT43244 BlueField-3 [ConnectX-7 Lx], 1x Intel I210 Gigabit Ethernet
Network Details Ethernet(IPoIB)
Network Topology

Other

Other Hardware
Cooling Mix of Liquid-cooled (for CPU, GPU, CX7, NVLink Switches) and Air-cooled (for the rest of the components)
Hardware Notes NVIDIA GB300 NVL72, 1400W TGP Per GPU
Run Data
Field NameRun 1Run 2Run 3Run 4Run 5Run 6Run 7Run 8Run 9Run 10
Run Date03/03/202603/03/202603/04/202603/03/202603/04/202603/04/202603/04/202603/03/202603/03/202603/03/2026
Concurrency0113511214385171
System Tokens/Second69.6136.9265.7451.3720.61,106.61,428.21,799.42,616.13,908.3
Tokens/Second per User208.8205.2199.2169.2135.1103.766.942.230.622.9
TTFT P95 (ms)30297.529498.932057.248508.354637.0169103.2364212.3649183.661579.9818481.9
Utilization1.8%3.5%6.8%11.5%18.4%28.3%36.5%46.0%66.9%100.0%
Configuration Summary
Config Type
Config Region
Target QPS
Result State
Measured Accuracy Score
Benchmark Version
Result Version
Archive URI
QPS0.01800.03510.06850.11690.18470.28300.36890.46430.69781.0439
Total Output Tokens33,926,28334,185,33134,063,49333,878,03534,233,01834,315,46633,975,93934,013,0091,564,302,8231,562,330,261
Average Output Tokens
Run Duration (s)5,076.462,602.571,335.99782.31495.04323.14247.92196.996,231.394,165.78
Total Queries8,7768,7768,7768,7768,7768,7768,7768,776417,284417,284
Total Queries Issued
Total Queries Failed
Time to First Token (TTFT) P95 (ms)
Minimum16908.416446.616051.216500.116861.917515.218957.418828.117868.718221.3
Average23042.422761.723520.627358.334300.547154.7105117.0481121.472898.8180980.9
P5023062.822164.123536.323758.629659.333960.546612.2494980.038157.441020.1
P9029233.328406.929546.941516.049482.4103672.5320195.7638910.057004.660797.8
P9530297.529498.932057.248508.354637.0169103.2364212.3649183.661579.9818481.9
P9931690.034557.946810.583235.3114692.6183958.3373950.1683704.31617735.83976554.3
P99955608.564147.464552.490778.4118624.2185595.1376104.6687289.92657904.25127347.1
Maximum59621.478513.664629.091840.5132851.1186095.5376276.7687934.42724616.75273260.1
Time Per Output Token (TPOT) (ms)
Minimum328.8330.7324.6371.1415.8441.9536.80.261553.21549.9
Average464.2464.3467.5519.7598.4677.5795.9969.32953.93756.7
P50457.9458.6461.0512.1590.5680.5787.2945.42807.43473.8
P90518.0517.0521.1581.8680.5813.8946.11140.23281.04196.5
P95527.6526.6531.4593.9694.5839.21000.01201.23309.14212.8
P99545.4547.2549.1611.3718.3872.11058.61330.03360.84386.0
P999589.6582.5571.4631.9742.8898.71104.41709.03462.27230.4
Maximum1021.6680.0593.1651.0771.7937.31128.12743.44101.36011164.9
Query Latency (ms)
Minimum108103.072085.7104029.8117250.6115243.5107222.4180759.4452474.496303.396270.3
Average1758207.31775732.71775959.51967478.12298948.92647940.03139613.83973346.911142016.713837973.8
P50955930.8964988.9984024.81091820.61234917.41417601.81724662.12500465.16244277.97724731.0
P904246460.24355810.64283481.94722249.45586557.96607260.07704190.19035883.127686948.634374763.7
P956026635.16163371.86116105.56822359.68085507.69539689.810972685.712103531.739601395.549288401.1
P998668077.68796495.68798065.59798341.411411893.113159384.515090929.516254763.656751873.470982046.5
P9999213522.29445701.29296461.410300842.212092719.614531844.716174286.117314006.265677558.883819234.7
Maximum9747750.310011402.79399291.910658160.612490970.615242298.516515959.617759264.666959603.985670529.2