我正在CUDA内核中优化共享内存,因此我需要确定哪些变量是存储在共享内存中的最佳候选变量(即最常被访问的变量)。我知道我可以分页浏览代码并计算每个变量被访问的次数,但内核相当复杂,所以我希望有一种方法可以自动化这一点。在一般的CPU代码中,或者在cuda-gdb中,我可以让GDB统计每个变量被访问的次数吗?或者,是否有其他分析/调试工具可能有用?
谢谢。
发布于 2013-10-27 16:36:57
据我所知,没有任何性能指标能够计算相关线程访问特定变量的次数。也许您应该查看反汇编的微代码(由带有--dump-sass选项的cuobjdump编写),以确定这种情况发生了多少次。
但是,考虑到在现代架构(例如,费米和开普勒)中,共享内存可以被视为“受控L1缓存”,因此如果没有从L1中清除变量,则可能没有必要使用共享内存。为了了解从L1缓存中清除全局内存变量的频率,如果不想手动计算访问次数,可以查看nvprof的一些性能指标。例如,您可以考虑global_cache_replay_overhead、gld_efficiency、gst_efficiency等。您可以在Metrics Reference上找到性能指标的完整列表。
最后,正如@talonmies所建议的,您可能希望考虑使用寄存器而不是共享内存来处理一些常用的变量,以获得更快的访问速度。
https://stackoverflow.com/questions/19613208
复制相似问题