Submitter AMD
Submission ID amd-mi355x-gptoss-001
Submission Status —
Submission Date 2026-02-19
Publication Date 2026-03-16
Division Closed
Model Name GPT-OSS 120B
Division Closed
Model Precision mxfp4
Model Link Hugging Face
Calibration Link —
Model Notes —
Dataset Name MLPerf Inference GPT-OSS Performance Dataset
Dataset Type Performance
Average Input Tokens 5010.64
Dataset Link Link
System TPS vs. Tokens/s per User
System TPS vs. Concurrency
Time to First Token P95 vs. Concurrency
Tokens/s per User vs. Concurrency
System Name AMD MI355X (8x MI355X, 2x EPYC 9575F)
System Availability Available
System Category Datacenter · On-premise
System Size 8x MI355X
Node Types 1
Total Node Count 1
Max Supported Concurrency —
Node Type ID 1
Node Count 1
Framework PyTorch 2.9.1+git8907517, ROCm 7.0.0
Serving Framework PyTorch 2.9.1+git8907517, ROCm 7.0.0
Inference Backend —
Driver —
Link to Container —
Operating System Ubuntu 22.04.5 LTS
Filesystem —
Other Software hipblaslt-1.0.0.70000-38~22.04, vllm-b026cf14, aiter-6af8b687
Software Notes —
Processor
Processor Model Name AMD EPYC 9575F
Processors per Node 2
Cores Per Processor 64
VCPUs Per Processor —
Accelerator
Accelerator Model Name AMD Instinct MI355X
Accelerators per Node 8
Memory Type HBM3E
Memory Capacity 288 GB
Accelerator Interconnect XGMI
Host-Accelerator Interconnect PCIe Gen 5 x16
Host / Storage
Host Memory Capacity 3 TB
Memory Configuration 24 x 128GB Micron Technology MTC40F2047S1RC64BB1 QSFF
Storage Capacity 3.5T
Storage Type NVMe SSD
Networking
Network Interfaces 4 x 10Gbit/s
Network Details 2 x Ethernet Controller X710 for 10GBASE-T, 2 x Ethernet Controller 10G X550T
Network Topology —
Other
Other Hardware —
Cooling Passive & Active
Hardware Notes —
| Field Name |
|---|
| Run Date |
| Concurrency |
| System Tokens/Second |
| Tokens/Second per User |
| TTFT P95 (ms) |
| Utilization |
| Configuration Summary |
| Config Type |
| Config Region |
| Target QPS |
| Result State |
| Measured Accuracy Score |
| Benchmark Version |
| Result Version |
| Archive URI |
| QPS |
| Total Output Tokens |
| Average Output Tokens |
| Run Duration (s) |
| Total Queries |
| Total Queries Issued |
| Total Queries Failed |
| Time to First Token (TTFT) P95 (ms) |
| Minimum |
| Average |
| P50 |
| P90 |
| P95 |
| P99 |
| P999 |
| Maximum |
| Time Per Output Token (TPOT) (ms) |
| Minimum |
| Average |
| P50 |
| P90 |
| P95 |
| P99 |
| P999 |
| Maximum |
| Query Latency (ms) |
| Minimum |
| Average |
| P50 |
| P90 |
| P95 |
| P99 |
| P999 |
| Maximum |