Encoder–decoder architecture — エンコーダー・デコーダー
エンコーダー・デコーダーモデル(英語: Encoder-Decoder Models)は、sequence-to-sequence(seq2seq)タスクを解決するために設計されたニューラルネットワークアーキテクチャのクラスです。このアーキテクチャは、2つの主要なコンポーネントで構成されています。
- エンコーダー(符号化器): 入力シーケンスを処理し、コンパクトな数値表現(コンテキストベクトルまたは隠れ状態のシーケンス)に圧縮します。
- デコーダー(復号化器): この表現を受け取り、それに基づいて出力シーケンスを生成します。
このアーキテクチャは、機械翻訳、テキスト要約、画像キャプション生成など、多くの自然言語処理(NLP)やコンピュータビジョンのタスクの基盤となっています。
コンセプト
エンコーダー・デコーダーアーキテクチャの基本的な考え方は、理解と生成というタスクを分離することにあります。エンコーダーは入力シーケンスを理解し、そこから必要なすべての意味情報を抽出する役割を担います。デコーダーは、エンコーダーから提供された情報を使用して新しいシーケンスを生成する役割を担います。
これにより、モデルは入力と出力で長さの異なるシーケンスを扱うことが可能になり、これは初期のアーキテクチャでは困難でした。
アーキテクチャの進化
RNN/LSTMベースの初期モデル
当初、エンコーダー・デコーダーアーキテクチャは、再帰型ニューラルネットワーク(RNN)またはその改良版であるLSTMを使用して実装されていました。
- エンコーダー: RNNエンコーダーは入力シーケンスをトークンごとに処理し、出力として単一のコンテキストベクトルを生成しました。これは、最後のトークンを処理した後の隠れ状態であり、シーケンス全体の情報を含むことが期待されていました。
- デコーダー: RNNデコーダーはこのコンテキストベクトルで初期化され、自己回帰的に出力シーケンスを生成しました。
このアプローチの主な欠点は「ボトルネック」問題でした。入力シーケンスのすべての情報が固定長の単一ベクトルに圧縮されなければならず、特に長いシーケンスでは情報の損失が発生しました。
アテンション機構の導入
ブレークスルーは、アテンション機構(attention mechanism)の導入(Bahdanau et al., 2014)によってもたらされました。
- 動作原理: 単一のコンテキストベクトルに依存する代わりに、デコーダーは生成の各ステップでエンコーダーのすべての隠れ状態に「注意を向け」ます。アテンションの重みを計算し、現在の出力トークンを生成するためにどの入力シーケンス部分が最も関連性が高いかを示します。
- 利点: これにより「ボトルネック」問題が解決され、モデルが長いシーケンスを効率的に扱えるようになり、特に機械翻訳の品質が大幅に向上しました。
Transformerアーキテクチャ
2017年の論文「Attention Is All You Need」で、再帰的な構造を完全に排除し、アテンション機構のみに依存するTransformerアーキテクチャが発表されました。
- Transformerエンコーダー: 各入力トークンの文脈化された表現を作成するために自己アテンション(self-attention)を使用する層のスタックで構成されます。
- Transformerデコーダー: 各々が2種類のアテンション機構を持つ層のスタックで構成されます。
- マスク付き自己アテンション: すでに生成された出力シーケンスの部分を処理するため。
- クロスアテンション(Cross-Attention): エンコーダーの出力表現に「注意を向ける」ため。
このアーキテクチャは、その高い性能と計算の並列化可能性により、seq2seqタスクの標準となりました。
応用
エンコーダー・デコーダーアーキテクチャは、幅広いタスクの標準となっています。
- 機械翻訳: ある言語の文を別の言語に変換する。
- テキストの自動要約: 長い文書の短い要約を作成する。
- 対話システム: ユーザーの発言に対する応答を生成する。
- 画像キャプション生成(Image Captioning): エンコーダー(多くは畳み込みニューラルネットワークベース)が画像を処理し、デコーダー(多くはRNNまたはTransformer)がそのテキスト記述を生成する。
- 音声認識: 音声信号をテキストの書き起こしに変換する。
主なモデル
- オリジナルのTransformer (Vaswani et al., 2017): このアーキテクチャを導入したモデル。
- BART (Bidirectional and Auto-Regressive Transformers): Facebookによるモデルで、「破損した」テキストを復元するタスクで事前学習される。エンコーダーは(BERTのように)双方向であり、デコーダーは(GPTのように)自己回帰型です。
- T5 (Text-to-Text Transfer Transformer): Googleによるモデルで、すべてのNLPタスクをテキストからテキストへの変換問題として統一する。T5は多くのベンチマークで優れた結果を示しました。
他のアーキテクチャとの比較
| アーキテクチャ | 主なタスク | コンポーネント | 代表的なモデル |
|---|---|---|---|
| エンコーダー・デコーダー | シーケンスからシーケンスへの変換 | エンコーダー + デコーダー | T5, BART, オリジナルTransformer |
| エンコーダーのみ | テキストの理解 | エンコーダーのみ | BERT, RoBERTa |
| デコーダーのみ | テキストの生成 | デコーダーのみ |
参考文献
- Bahdanau, D. et al. (2014). Neural Machine Translation by Jointly Learning to Align and Translate. arXiv:1409.0473.
- Sutskever, I. et al. (2014). Sequence to Sequence Learning with Neural Networks. arXiv:1409.3215.
- Luong, M.-T. et al. (2015). Effective Approaches to Attention-based Neural Machine Translation. arXiv:1508.04025.
- Wu, Y. et al. (2016). Google’s Neural Machine Translation System: Bridging the Gap between Human and Machine Translation. arXiv:1609.08144.
- Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
- Britz, D. et al. (2017). Massive Exploration of Neural Machine Translation Architectures. arXiv:1703.03906.
- Lewis, M. et al. (2020). BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation. arXiv:1910.13461.
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683.
- Dong, L. et al. (2019). Unified Language Model Pre-training for Natural Language Understanding and Generation. arXiv:1905.03197.
- Zhang, J. et al. (2020). PEGASUS: Pre-training with Extracted Gap-Sentences for Abstractive Summarization. arXiv:1912.08777.