Transformer

Transformerとは

Transformer(トランスフォーマー)は、2017年の論文「Attention Is All You Need」で発表されたニューラルネットワークのアーキテクチャ(構造)です。[[生成AI・LLM]] の「GPT」の T は Transformer の頭文字で、現代の生成AIのほぼすべてがこの構造を土台にしています。

それまでの [[自然言語処理]] では文章を先頭から1語ずつ順番に処理していましたが、Transformer は文章全体を一度に見渡して処理できる点が革新的でした。

中核となるAttention機構

Transformer の心臓部は Attention(注意機構)です。文中の各単語が「他のどの単語と関係が深いか」を計算し、重要な語に注目して意味を捉えます。

たとえば「銀行の口座を開いた」と「川の土手に座った」では、英語の bank の意味が周囲の単語で決まります。Attention は周囲の単語との関連度を数値化することで、こうした文脈に応じた意味の違いを扱えるようにします。

従来手法(RNN)との比較

RNN(従来)Transformer
処理の仕方先頭から1語ずつ順番に文全体を一度に並列で
長い文の扱い離れた単語の関係を忘れやすいAttention で離れた単語同士も直接関連づけられる
学習速度並列化しにくく遅いGPU で並列化しやすく高速

「並列処理できる」ことが決定的でした。大量のデータで巨大なモデルを学習できるようになり、モデルを大きくするほど性能が上がるスケーリングの時代が始まりました。

初学者向けポイント

  • Transformer への入力は単語そのものではなく、[[トークンとトークナイザ]] で分割されたトークンの列です
  • 文章生成は「次のトークンを予測する」ことの繰り返しです。この仕組みを知ると [[ハルシネーション]] が起きる理由も理解しやすくなります
  • 言語だけでなく、画像・音声にも応用されています。[[マルチモーダルAI]] の多くも Transformer ベースです

関連技術とのつながり

  • [[生成AI・LLM]] — Transformer を大規模化したものが LLM
  • [[ニューラルネットワーク]] — Transformer はニューラルネットワークの一種
  • [[ディープラーニング]] — Transformer は深層学習の代表的アーキテクチャ
  • [[トークンとトークナイザ]] — Transformer が処理する入力の単位
  • [[自然言語処理]] — Transformer が最初に成果を上げた応用分野
Q: Transformerの中核となる仕組みはどれ?
- [x] Attention(注意機構)
- [ ] 誤差逆伝播法
- [ ] ファイアウォール
解説: 各単語が他のどの単語と関係が深いかを計算する Attention が Transformer の心臓部です。

Q: RNNと比べたTransformerの強みはどれ?
- [ ] 1語ずつ順番に処理するため正確
- [x] 文全体を並列に処理でき、学習を高速化できる
- [ ] 学習データが不要になる
解説: 並列処理できることで大規模な学習が可能になり、LLM の登場につながりました。

Q: GPTの「T」が表すものはどれ?
- [ ] Testing
- [ ] TCP
- [x] Transformer
解説: GPT は Generative Pre-trained Transformer の略で、Transformer アーキテクチャを土台にしています。