학술논문

大点数FFT在"申威26010"上的并行优化 / Parallel optimization of large-point FFT on Sunway 26010
Document Type
Academic Journal
Source
浙江大学学报(工学版) / Journal of Zhejiang University(Engineering Science). 58(1):78-86
Subject
神威·太湖之光
申威26010
快速傅里叶变换
Cooley-Tukey算法
众核并行
Sunway Taihu Light
Sunway 26010
fast Fourier transform
Cooley-Tukey algorithm
many-core parallelism
Language
Chinese
ISSN
1008-973X
Abstract
根据"神威·太湖之光"超级计算机所用国产"申威26010"处理器的架构特点和编程规范,提出针对大点数FFT的众核并行优化方案.该方案源自经典的Cooley-Tukey FFT算法,通过将一维大点数数据迭代分解为二维小规模矩阵进行并行加速.为了解决矩阵"列FFT"的读写、转置和计算问题,提出"列均分-行连续"的读写策略,通过对数据进行合理的分配、重排、交换,结合SIMD向量化、旋转因子优化、双缓冲、寄存器通信、跨步传输等优化手段,充分利用了众核处理器的计算资源和传输带宽.实验结果显示,单核组64从核并行程序较主核运行FFTW库,可以达到最高65x、平均48x以上的加速比.