Copy/kernel overlap

← All benchmarks · Chapter 6

![Figure 6-7 (book): copy/kernel overlap speedup, Tesla M2050 vs community hardware](/book/media/ch6/figure-6-7.svg) ![Figure 6-8 (book): copy/kernel overlap speedup, GeForce GTX 280 vs community hardware](/book/media/ch6/figure-6-8.svg)

concurrency.memcpy-kernel.concurrent (ms) -- concurrency/concurrencyMemcpyKernel.cu: concurrent time by cycles

GPU 0 384 768 1088 1472 1856 2240 2624 3008 3328 3712 4096 n
Ampere
GeForce RTX 3060 6.79 6.88 7.22 8.39 10.84 13.29 15.74 18.19 20.63 22.69 25.13 27.58 2

concurrency.memcpy-kernel.dtoh (ms) -- concurrency/concurrencyMemcpyKernel.cu: dtoh time by cycles

GPU 0 384 768 1088 1472 1856 2240 2624 3008 3328 3712 4096 n
Ampere
GeForce RTX 3060 5.1 5.1 5.1 5.1 5.1 5.1 5.1 5.1 5.1 5.1 5.1 5.1 2

concurrency.memcpy-kernel.htod (ms) -- concurrency/concurrencyMemcpyKernel.cu: htod time by cycles

GPU 0 384 768 1088 1472 1856 2240 2624 3008 3328 3712 4096 n
Ampere
GeForce RTX 3060 5.02 5.01 5.01 5.01 5.01 5.01 5.01 5 5.01 5.01 5.01 5.01 2

concurrency.memcpy-kernel.kernel (ms) -- concurrency/concurrencyMemcpyKernel.cu: kernel time by cycles

GPU 0 384 768 1088 1472 1856 2240 2624 3008 3328 3712 4096 n
Ampere
GeForce RTX 3060 0.88 2.69 5.16 7.21 9.42 11.41 13.5 15.77 18.05 19.95 22.23 24.51 2

concurrency.memcpy-kernel.speedup (x) -- concurrency/concurrencyMemcpyKernel.cu: sequential/concurrent by cycles

GPU 0 384 768 1088 1472 1856 2240 2624 3008 3328 3712 4096 n
Ampere
GeForce RTX 3060 1.62 1.86 2.12 2.06 1.8 1.62 1.5 1.42 1.37 1.33 1.29 1.25 2

concurrency.memcpy-kernel.total (ms) -- concurrency/concurrencyMemcpyKernel.cu: total time by cycles

GPU 0 384 768 1088 1472 1856 2240 2624 3008 3328 3712 4096 n
Ampere
GeForce RTX 3060 11 12.79 15.27 17.32 19.52 21.51 23.59 25.88 28.16 30.05 32.34 34.61 2

Submissions

  • rtx-3060 · nwilt-2026-07-12-2.json -- Nicholas Wilt · driver 580.95.05 · CUDA 12.9
  • rtx-3060 · nwilt-2026-08-27.json -- Nicholas Wilt · driver 580.95.05 · CUDA 13.0