登录社区云,与社区用户共同成长
邀请您加入社区
本文介绍如何在资源受限的‘天外客翻译机’上,利用ARM NEON SIMD指令集对Transformer模型的关键运算进行向量化优化,显著提升推理速度与能效。通过矩阵乘法、激活函数和LayerNorm等模块的SIMD优化,实现端到端延迟从800ms降至320ms,续航延长1.5小时,支持更大规模模型部署。