transformer
概念词 📚 基础词库 · 存量热词Transformer 架构
🧠 transformer 是什么
Transformer 是 Google 团队在 2017 年论文《Attention Is All You Need》中提出的神经网络架构。其核心是自注意力(Self-Attention)机制:每个词在处理时都会关注序列中所有其他词,取代了 RNN 逐词串行的处理方式。
该架构支持高度并行训练,显著加快了超大模型训练速度,其可扩展性(Scaling)支撑了 GPT、BERT、Claude、DeepSeek 等模型的规模增长。原始架构包含编码器(Encoder)与解码器(Decoder),后续衍生出仅编码器(BERT)、仅解码器(GPT)等主流变体。
如今几乎所有主流大语言模型都是 Transformer 的变体(如 Llama 的 RMSNorm+RoPE、DeepSeek 的 MLA 注意力),它还被引入视觉(ViT)、语音、推荐等领域,是深度学习近十年最重要的架构创新。
🔥 为什么现在火
从 ChatGPT 到 DeepSeek,Transformer 架构贯穿整个大模型浪潮;每次架构改进(如 MLA、混合模型)讨论都围绕它展开。
📄 证据链(交叉验证)
- ▸arxiv《Attention Is All You Need》(Vaswani et al., 2017)
- ▸维基百科 Transformer (deep learning architecture) 词条
🔍 搜索形态
what is transformer in AI transformer architecture explained attention is all you need transformer vs RNN
transformer 常见问题 FAQ
Transformer 和 RNN 有什么区别?+
RNN 逐词串行处理、难以并行且长距离信息易丢失;Transformer 用自注意力一次看全序列,可并行训练,长距离建模更强。
自注意力机制是什么?+
对序列中每个元素,计算它与其他所有元素的关联权重(Query-Key-Value),按权重加权聚合信息,从而捕捉词与词的上下文关系。
与 transformer 相关的搜索
人们搜索 transformer 时,还会关心这些问题:
- transformer 是什么
- 什么是 transformer
- transformer 是什么意思
- transformer 原理
- transformer 有什么用
- transformer 应用场景
- transformer 为什么火
- transformer 2026