Language Models
Transformer
Attention-based sequence architecture
About
The architecture behind modern language models. Self-attention, residual stacks, and why transformers scaled when earlier sequence models stalled.
Language Models
Attention-based sequence architecture
The architecture behind modern language models. Self-attention, residual stacks, and why transformers scaled when earlier sequence models stalled.