Submitter AMD
Submission ID amd-mi325x-gptoss-001
Submission Status —
Submission Date 2026-02-19
Publication Date 2026-03-16
Division Closed
Model Name GPT-OSS 120B
Division Closed
Model Precision mxfp4
Model Link Hugging Face
Calibration Link —
Model Notes —
Dataset Name MLPerf Inference GPT-OSS Performance Dataset
Dataset Type Performance
Average Input Tokens 5010.64
Dataset Link Link
System TPS vs. Tokens/s per User
System TPS vs. Concurrency
Time to First Token P95 vs. Concurrency
Tokens/s per User vs. Concurrency
System Name AMD MI325X (8x MI325X, 2x EPYC 9575F)
System Availability Available
System Category Datacenter · On-premise
System Size 8x MI325X
Node Types 1
Total Node Count 1
Max Supported Concurrency —
Node Type ID 1
Node Count 1
Framework vLLM 0.6.5.dev964+mlperf50, Pytorch 2.7.0a0+git3a58512, ROCm 6.3.1
Serving Framework vLLM 0.6.5.dev964+mlperf50, Pytorch 2.7.0a0+git3a58512, ROCm 6.3.1
Inference Backend —
Driver —
Link to Container —
Operating System Ubuntu 22.04.5 LTS
Filesystem —
Other Software —
Software Notes —
Processor
Processor Model Name AMD EPYC 9575F
Processors per Node 2
Cores Per Processor 64
VCPUs Per Processor —
Accelerator
Accelerator Model Name AMD Instinct MI325X
Accelerators per Node 8
Memory Type HBM3E
Memory Capacity 256 GB
Accelerator Interconnect XGMI
Host-Accelerator Interconnect PCIe Gen5 x16
Host / Storage
Host Memory Capacity 2.25TiB
Memory Configuration 24x 96GiB Samsung M321RYGA0PB0-CWMXJ
Storage Capacity 1.7T
Storage Type NVMe SSD
Networking
Network Interfaces —
Network Details —
Network Topology —
Other
Other Hardware —
Cooling Passive OAM
Hardware Notes —
| Field Name |
|---|
| Run Date |
| Concurrency |
| System Tokens/Second |
| Tokens/Second per User |
| TTFT P95 (ms) |
| Utilization |
| Configuration Summary |
| Config Type |
| Config Region |
| Target QPS |
| Result State |
| Measured Accuracy Score |
| Benchmark Version |
| Result Version |
| Archive URI |
| QPS |
| Total Output Tokens |
| Average Output Tokens |
| Run Duration (s) |
| Total Queries |
| Total Queries Issued |
| Total Queries Failed |
| Time to First Token (TTFT) P95 (ms) |
| Minimum |
| Average |
| P50 |
| P90 |
| P95 |
| P99 |
| P999 |
| Maximum |
| Time Per Output Token (TPOT) (ms) |
| Minimum |
| Average |
| P50 |
| P90 |
| P95 |
| P99 |
| P999 |
| Maximum |
| Query Latency (ms) |
| Minimum |
| Average |
| P50 |
| P90 |
| P95 |
| P99 |
| P999 |
| Maximum |