Transformer
Transformerとは
Transformer(トランスフォーマー)は、2017年の論文「Attention Is All You Need」で発表されたニューラルネットワークのアーキテクチャ(構造)です。[[生成AI・LLM]] の「GPT」の T は Transformer の頭文字で、現代の生成AIのほぼすべてがこの構造を土台にしています。
それまでの [[自然言語処理]] では文章を先頭から1語ずつ順番に処理していましたが、Transformer は文章全体を一度に見渡して処理できる点が革新的でした。
中核となるAttention機構
Transformer の心臓部は Attention(注意機構)です。文中の各単語が「他のどの単語と関係が深いか」を計算し、重要な語に注目して意味を捉えます。
たとえば「銀行の口座を開いた」と「川の土手に座った」では、英語の bank の意味が周囲の単語で決まります。Attention は周囲の単語との関連度を数値化することで、こうした文脈に応じた意味の違いを扱えるようにします。
従来手法(RNN)との比較
| RNN(従来) | Transformer | |
|---|---|---|
| 処理の仕方 | 先頭から1語ずつ順番に | 文全体を一度に並列で |
| 長い文の扱い | 離れた単語の関係を忘れやすい | Attention で離れた単語同士も直接関連づけられる |
| 学習速度 | 並列化しにくく遅い | GPU で並列化しやすく高速 |
「並列処理できる」ことが決定的でした。大量のデータで巨大なモデルを学習できるようになり、モデルを大きくするほど性能が上がるスケーリングの時代が始まりました。
初学者向けポイント
- Transformer への入力は単語そのものではなく、[[トークンとトークナイザ]] で分割されたトークンの列です
- 文章生成は「次のトークンを予測する」ことの繰り返しです。この仕組みを知ると [[ハルシネーション]] が起きる理由も理解しやすくなります
- 言語だけでなく、画像・音声にも応用されています。[[マルチモーダルAI]] の多くも Transformer ベースです
関連技術とのつながり
- [[生成AI・LLM]] — Transformer を大規模化したものが LLM
- [[ニューラルネットワーク]] — Transformer はニューラルネットワークの一種
- [[ディープラーニング]] — Transformer は深層学習の代表的アーキテクチャ
- [[トークンとトークナイザ]] — Transformer が処理する入力の単位
- [[自然言語処理]] — Transformer が最初に成果を上げた応用分野
Q: Transformerの中核となる仕組みはどれ?
- [x] Attention(注意機構)
- [ ] 誤差逆伝播法
- [ ] ファイアウォール
解説: 各単語が他のどの単語と関係が深いかを計算する Attention が Transformer の心臓部です。
Q: RNNと比べたTransformerの強みはどれ?
- [ ] 1語ずつ順番に処理するため正確
- [x] 文全体を並列に処理でき、学習を高速化できる
- [ ] 学習データが不要になる
解説: 並列処理できることで大規模な学習が可能になり、LLM の登場につながりました。
Q: GPTの「T」が表すものはどれ?
- [ ] Testing
- [ ] TCP
- [x] Transformer
解説: GPT は Generative Pre-trained Transformer の略で、Transformer アーキテクチャを土台にしています。