Back to topics

Language Models

Transformer

Attention-based sequence architecture

Discussedintermediate

About

The architecture behind modern language models. Self-attention, residual stacks, and why transformers scaled when earlier sequence models stalled.

Prerequisites

Resources