LLM:Transformer 架构基石
大语言模型(Large Language Model, LLM)是 Agent 智能的核心来源。理解 LLM 的基础架构,是构建 Agent 系统的第一步。
Attention Is All You Need:Transformer 的诞生
2017 年 Google 发表的论文《Attention Is All You Need》彻底改变了 AI 的发展轨迹,也为后来的大语言模型奠定了理论基础。
Attention Is All You Need:Transformer架构与自注意力机制
首个完全基于自注意力的序列模型,抛弃RNN/CNN。WMT 2014英德28.4 BLEU、英法41.8 BLEU,单模型SOTA。
注意力机制的核心思想
注意力机制本质上是模拟人类的选择 性关注:
传统序列模型:顺序处理,难以捕捉长距离依赖
注意力机制:并行计算,直接建模任意两个位置的关联
核心公式:
Attention(Q, K, V) = softmax(QK^T / sqrt(d_k)) V
- Q (Query):当前位置的查询向量
- K (Key):所有位置的键向量
- V (Value):所有位置的值向量
- sqrt(d_k):缩放因子,防止点积过大导致梯度消失
Transformer 架构全貌
输入 → 嵌入层 → 位置编码 → [编码器] × N → [解码器] × N → 输出层 → 预测
编码器(Encoder):
- 多头自注意力 + 前馈网络
- 双向注意力,可看到全部上下文
- 适合理解任务:分类、实体识别
解码器(Decoder):
- 掩码多头自注意力 + 交叉注意力 + 前馈网络
- 单向注意力,只能看到已生成的 token
- 适合生成任务:文本生成、翻译
Decoder-Only 架构的胜利
在 Transformer 的三种架构变体中,Decoder-Only(仅解码器)成为了当下最为主流的大模型架构。

- 粉色:Encoder-Only
- 绿色:Encoder-Decoder(经典架构)
- 灰色:Decoder-Only(当前更主流)