正如这个问题的答案所示,当SM包含8个CUDA核心( Capability 1.3)时,一个由32个线程组成的单翘曲就需要4个时钟周期来执行整个翘曲的单个指令。
即1号至8号车道的经线同时运行在8个核心上,然后第9号车道至第16号车道运行,之后该车道第17号至第24号车道,最后第25号车道至第32号车道。
我理解得对吗?
所以我的问题是,在新设备上,每SM有32颗(计算能力2.0)或48 (2.1)或192 (3.0,开普勒) CUDA核心,但翘曲尺寸仍然是32。
发布于 2014-05-08 05:49:49
CUDA核心是SM中单精度浮点单元的数量。SM有其他执行单元,包括特殊功能单元(RSQRT、COS、SIN、.)、双精度单元、负载存储单元、纹理单元、分支单元等。
费米、开普勒-gk10x、开普勒-gk110 110和麦克斯韦尔白皮书包含关于SMs中执行单元的类型和数量的其他信息。
算术指令的指令吞吐量可以在算术指令吞吐量表的CUDA编程指南中找到。
作为一名开发人员,您希望了解SM发出指令的速率,这在吞吐量表中有记录。速率取决于warp调度程序的吞吐量以及执行单元的吞吐量(同样,不仅仅是CUDA核心)。
CC1.x特斯拉
CC2.x费米
CC3.*开普勒CC5.0 Maxwell
https://stackoverflow.com/questions/23531863
复制相似问题