Microsoft Azure HBv4 HPC Comparison Benchmarks

Benchmarks for a future article on Phoronix looking at HBv4 Genoa-X Linux performance..

HTML result view exported from: https://openbenchmarking.org/result/2307288-NE-2307274NE45&rdt&grr.

Timed Linux Kernel Compilation

Build: allmodconfig

libxsmm

M N K: 128

libxsmm

M N K: 256

PETSc

Test: Streams

OSPRay

Benchmark: particle_volume/pathtracer/real_time

High Performance Conjugate Gradient

X Y Z: 160 160 160 - RT: 60

Blender

Blend File: Barbershop - Compute: CPU-Only

High Performance Conjugate Gradient

X Y Z: 144 144 144 - RT: 60

Timed Node.js Compilation

Time To Compile

OSPRay

Benchmark: particle_volume/scivis/real_time

PostgreSQL

Scaling Factor: 1 - Clients: 500 - Mode: Read Only - Average Latency

PostgreSQL

Scaling Factor: 1 - Clients: 500 - Mode: Read Only

PostgreSQL

Scaling Factor: 1 - Clients: 800 - Mode: Read Only - Average Latency

PostgreSQL

Scaling Factor: 1 - Clients: 800 - Mode: Read Only

OSPRay

Benchmark: gravity_spheres_volume/dim_512/scivis/real_time

OSPRay

Benchmark: gravity_spheres_volume/dim_512/ao/real_time

OSPRay

Benchmark: particle_volume/ao/real_time

High Performance Conjugate Gradient

X Y Z: 104 104 104 - RT: 60

Blender

Blend File: Pabellon Barcelona - Compute: CPU-Only

Blender

Blend File: Classroom - Compute: CPU-Only

ACES DGEMM

Sustained Floating-Point Rate

NAS Parallel Benchmarks

Test / Class: SP.C

Laghos

Test: Sedov Blast Wave, ube_922_hex.mesh

OSPRay

Benchmark: gravity_spheres_volume/dim_512/pathtracer/real_time

NAS Parallel Benchmarks

Test / Class: EP.D

Blender

Blend File: BMW27 - Compute: CPU-Only

libxsmm

M N K: 64

Liquid-DSP

Threads: 32 - Buffer Length: 256 - Filter Length: 57

7-Zip Compression

Test: Decompression Rating

7-Zip Compression

Test: Compression Rating

oneDNN

Harness: Recurrent Neural Network Training - Data Type: f32 - Engine: CPU

NAS Parallel Benchmarks

Test / Class: BT.C

Blender

Blend File: Fishy Cat - Compute: CPU-Only

oneDNN

Harness: Recurrent Neural Network Training - Data Type: bf16bf16bf16 - Engine: CPU

Laghos

Test: Triple Point Problem

Liquid-DSP

Threads: 176 - Buffer Length: 256 - Filter Length: 512

Liquid-DSP

Threads: 176 - Buffer Length: 256 - Filter Length: 32

Intel Open Image Denoise

Run: RTLightmap.hdr.4096x4096 - Device: CPU-Only

Liquid-DSP

Threads: 176 - Buffer Length: 256 - Filter Length: 57

Liquid-DSP

Threads: 128 - Buffer Length: 256 - Filter Length: 57

Liquid-DSP

Threads: 128 - Buffer Length: 256 - Filter Length: 32

Liquid-DSP

Threads: 32 - Buffer Length: 256 - Filter Length: 32

Liquid-DSP

Threads: 1 - Buffer Length: 256 - Filter Length: 32

NAMD

ATPase Simulation - 327,506 Atoms

oneDNN

Harness: Recurrent Neural Network Inference - Data Type: bf16bf16bf16 - Engine: CPU

NAS Parallel Benchmarks

Test / Class: IS.D

oneDNN

Harness: Recurrent Neural Network Inference - Data Type: f32 - Engine: CPU

libxsmm

M N K: 32

Intel Open Image Denoise

Run: RT.ldr_alb_nrm.3840x2160 - Device: CPU-Only

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: Stock - Precision: double-long - X Y Z: 512

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: Stock - Precision: double - X Y Z: 512

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: FFTW - Precision: double-long - X Y Z: 512

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: FFTW - Precision: double - X Y Z: 512

HeFFTe - Highly Efficient FFT for Exascale

Test: r2c - Backend: FFTW - Precision: float-long - X Y Z: 256

HeFFTe - Highly Efficient FFT for Exascale

Test: r2c - Backend: Stock - Precision: float - X Y Z: 256

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: FFTW - Precision: double - X Y Z: 128

HeFFTe - Highly Efficient FFT for Exascale

Test: r2c - Backend: Stock - Precision: float-long - X Y Z: 256

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: Stock - Precision: double - X Y Z: 128

HeFFTe - Highly Efficient FFT for Exascale

Test: r2c - Backend: FFTW - Precision: double - X Y Z: 256

HeFFTe - Highly Efficient FFT for Exascale

Test: r2c - Backend: Stock - Precision: double-long - X Y Z: 256

NAS Parallel Benchmarks

Test / Class: MG.C

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: FFTW - Precision: float-long - X Y Z: 256

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: Stock - Precision: float-long - X Y Z: 512

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: Stock - Precision: float - X Y Z: 512

HeFFTe - Highly Efficient FFT for Exascale

Test: r2c - Backend: FFTW - Precision: double-long - X Y Z: 256

HeFFTe - Highly Efficient FFT for Exascale

Test: r2c - Backend: Stock - Precision: double-long - X Y Z: 512

HeFFTe - Highly Efficient FFT for Exascale

Test: r2c - Backend: Stock - Precision: double - X Y Z: 512

HeFFTe - Highly Efficient FFT for Exascale

Test: r2c - Backend: FFTW - Precision: double-long - X Y Z: 512

HeFFTe - Highly Efficient FFT for Exascale

Test: r2c - Backend: FFTW - Precision: double - X Y Z: 512

HeFFTe - Highly Efficient FFT for Exascale

Test: r2c - Backend: Stock - Precision: double - X Y Z: 256

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: FFTW - Precision: float - X Y Z: 512

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: FFTW - Precision: float-long - X Y Z: 512

NAS Parallel Benchmarks

Test / Class: CG.C

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: Stock - Precision: float - X Y Z: 256

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: FFTW - Precision: float - X Y Z: 256

NAS Parallel Benchmarks

Test / Class: FT.C

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: FFTW - Precision: double-long - X Y Z: 256

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: FFTW - Precision: double-long - X Y Z: 128

HeFFTe - Highly Efficient FFT for Exascale

Test: r2c - Backend: FFTW - Precision: float - X Y Z: 256

Intel Open Image Denoise

Run: RT.hdr_alb_nrm.3840x2160 - Device: CPU-Only

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: Stock - Precision: float-long - X Y Z: 256

HeFFTe - Highly Efficient FFT for Exascale

Test: r2c - Backend: FFTW - Precision: float - X Y Z: 512

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: Stock - Precision: double - X Y Z: 256

Remhos

Test: Sample Remap Example

Pennant

Test: sedovbig

HeFFTe - Highly Efficient FFT for Exascale

Test: r2c - Backend: Stock - Precision: float - X Y Z: 512

HeFFTe - Highly Efficient FFT for Exascale

Test: r2c - Backend: Stock - Precision: float-long - X Y Z: 512

HeFFTe - Highly Efficient FFT for Exascale

Test: r2c - Backend: FFTW - Precision: float-long - X Y Z: 512

oneDNN

Harness: IP Shapes 1D - Data Type: f32 - Engine: CPU

Pennant

Test: leblancbig

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: Stock - Precision: double-long - X Y Z: 256

HeFFTe - Highly Efficient FFT for Exascale

Test: c2c - Backend: FFTW - Precision: double - X Y Z: 256

oneDNN

Harness: IP Shapes 3D - Data Type: f32 - Engine: CPU

oneDNN

Harness: Convolution Batch Shapes Auto - Data Type: f32 - Engine: CPU

oneDNN

Harness: Deconvolution Batch shapes_3d - Data Type: f32 - Engine: CPU

Phoronix Test Suite v10.8.4