1、

NLP 是 Natural Language Processing(自然语言处理) 的缩写,它是人工智能(AI) 与语言学交叉的核心学科,核心目标是让计算机 “理解” 和 “生成” 人类语言,打破人与机器之间的语言沟通壁垒。

简单来说,人类用自然语言(比如中文、英文、口语、书面语)交流,而计算机本质上只懂代码和数据。NLP 就像 “翻译官 + 理解者 + 创作者”,一边把人类语言转换成计算机能处理的形式,一边把计算机的处理结果转换成人类能看懂的自然语言

2、自注意力机制及与 NLP 的关系

(1)自注意力机制的定义

自注意力机制是一种序列建模技术,核心是让序列中的每个元素(如文本中的每个词),根据自身与序列内其他元素的 “关联程度”(权重),动态聚合信息。

  • 举例:处理句子 “猫追老鼠” 时,“追” 会更关注 “猫” 和 “老鼠”(权重高),而对其他无关词(若有)权重低。
  • 优势:能直接捕捉序列中任意元素的长距离依赖(如长句子中前后文的关联),且计算效率高于传统的循环神经网络(RNN)。
(2)与 NLP 的关系

自注意力机制是现代 NLP 技术的核心基础

  • 解决了传统 NLP 模型(如 RNN)难以高效捕捉长文本依赖的问题;
  • 是 Transformer 架构的核心组件,而 Transformer 是当前 NLP 大模型(如 GPT、BERT)的基础;
  • 支撑了 NLP 的关键任务(如机器翻译、文本生成、语义理解),大幅提升了模型的语言处理能力。

3、Transformer 架构的工作原理

Transformer 是基于自注意力机制的序列建模架构,核心由 ** 编码器(Encoder)解码器(Decoder)** 两部分组成(以原始机器翻译场景为例):

(1)输入处理:词嵌入 + 位置编码
  • 词嵌入:将每个词转换为固定维度的向量(表示词的语义信息);
  • 位置编码:为每个词添加位置信息(因为自注意力本身无序列顺序,需额外标记词的位置)。
(2)编码器(Encoder):提取输入序列的语义特征

多层 “多头自注意力 + 前馈神经网络” 模块堆叠而成:

  • 多头自注意力:同时从多个 “注意力角度” 捕捉词与词的关联(如 “语义关联”“语法关联”);
  • 前馈神经网络:对每个词的注意力聚合结果做进一步特征变换;
  • 每层均包含残差连接与层归一化(稳定训练过程)。
(3)解码器(Decoder):生成输出序列

多层 “掩码多头自注意力 + 编码器 - 解码器注意力 + 前馈神经网络” 模块堆叠而成:

  • 掩码多头自注意力:防止生成时 “看到未来的词”(如生成第 3 个词时,仅能利用前 2 个词的信息);
  • 编码器 - 解码器注意力:让解码器关注编码器输出的输入序列特征(如翻译时,解码器的词需对应输入句的语义);
  • 前馈神经网络:对注意力结果做特征变换,最终输出下一个词的概率。
(4)输出层

通过线性变换 + Softmax,将解码器的输出转换为目标词表的概率分布,选择概率最高的词作为当前生成结果。

Transformer 的优势:并行计算效率高、能捕捉长距离依赖,是当前 NLP 大模型的核心架构。

Logo

开源鸿蒙跨平台开发社区汇聚开发者与厂商,共建“一次开发,多端部署”的开源生态,致力于降低跨端开发门槛,推动万物智联创新。

更多推荐