Skip to the content.

Week 07 — Sequence Modeling and Transformers

← Generative Models · Week 7 of 11 · Next: World Models →

Complete lecture deck

Complete deck: 39 slides rendered locally. Select any slide to open the full-resolution image.
Lecture 7: Sequence Modeling and Transformers - slide 1 of 39
Slide 1 of 39
Lecture 7: Sequence Modeling and Transformers - slide 2 of 39
Slide 2 of 39
Lecture 7: Sequence Modeling and Transformers - slide 3 of 39
Slide 3 of 39
Lecture 7: Sequence Modeling and Transformers - slide 4 of 39
Slide 4 of 39
Lecture 7: Sequence Modeling and Transformers - slide 5 of 39
Slide 5 of 39
Lecture 7: Sequence Modeling and Transformers - slide 6 of 39
Slide 6 of 39
Lecture 7: Sequence Modeling and Transformers - slide 7 of 39
Slide 7 of 39
Lecture 7: Sequence Modeling and Transformers - slide 8 of 39
Slide 8 of 39
Lecture 7: Sequence Modeling and Transformers - slide 9 of 39
Slide 9 of 39
Lecture 7: Sequence Modeling and Transformers - slide 10 of 39
Slide 10 of 39
Lecture 7: Sequence Modeling and Transformers - slide 11 of 39
Slide 11 of 39
Lecture 7: Sequence Modeling and Transformers - slide 12 of 39
Slide 12 of 39
Lecture 7: Sequence Modeling and Transformers - slide 13 of 39
Slide 13 of 39
Lecture 7: Sequence Modeling and Transformers - slide 14 of 39
Slide 14 of 39
Lecture 7: Sequence Modeling and Transformers - slide 15 of 39
Slide 15 of 39
Lecture 7: Sequence Modeling and Transformers - slide 16 of 39
Slide 16 of 39
Lecture 7: Sequence Modeling and Transformers - slide 17 of 39
Slide 17 of 39
Lecture 7: Sequence Modeling and Transformers - slide 18 of 39
Slide 18 of 39
Lecture 7: Sequence Modeling and Transformers - slide 19 of 39
Slide 19 of 39
Lecture 7: Sequence Modeling and Transformers - slide 20 of 39
Slide 20 of 39
Lecture 7: Sequence Modeling and Transformers - slide 21 of 39
Slide 21 of 39
Lecture 7: Sequence Modeling and Transformers - slide 22 of 39
Slide 22 of 39
Lecture 7: Sequence Modeling and Transformers - slide 23 of 39
Slide 23 of 39
Lecture 7: Sequence Modeling and Transformers - slide 24 of 39
Slide 24 of 39
Lecture 7: Sequence Modeling and Transformers - slide 25 of 39
Slide 25 of 39
Lecture 7: Sequence Modeling and Transformers - slide 26 of 39
Slide 26 of 39
Lecture 7: Sequence Modeling and Transformers - slide 27 of 39
Slide 27 of 39
Lecture 7: Sequence Modeling and Transformers - slide 28 of 39
Slide 28 of 39
Lecture 7: Sequence Modeling and Transformers - slide 29 of 39
Slide 29 of 39
Lecture 7: Sequence Modeling and Transformers - slide 30 of 39
Slide 30 of 39
Lecture 7: Sequence Modeling and Transformers - slide 31 of 39
Slide 31 of 39
Lecture 7: Sequence Modeling and Transformers - slide 32 of 39
Slide 32 of 39
Lecture 7: Sequence Modeling and Transformers - slide 33 of 39
Slide 33 of 39
Lecture 7: Sequence Modeling and Transformers - slide 34 of 39
Slide 34 of 39
Lecture 7: Sequence Modeling and Transformers - slide 35 of 39
Slide 35 of 39
Lecture 7: Sequence Modeling and Transformers - slide 36 of 39
Slide 36 of 39
Lecture 7: Sequence Modeling and Transformers - slide 37 of 39
Slide 37 of 39
Lecture 7: Sequence Modeling and Transformers - slide 38 of 39
Slide 38 of 39
Lecture 7: Sequence Modeling and Transformers - slide 39 of 39
Slide 39 of 39

Outcomes

Causal robot transformer token flow

Sequence design choices

Choice Question to answer
Token order Which modalities and time steps can attend to which others?
Position encoding How is time/order represented?
Action representation Continuous vector, bins, codebook, or chunk?
Context length What history is useful within the latency/memory budget?
Objective Next action, masked token, return-conditioned action, or trajectory?

Core notes

Sequence models replace a hand-designed fixed state with a learned function of history. A transformer embeds tokens, mixes information through self-attention, and predicts under a causal mask so future tokens cannot leak into the current decision. Robot tokens may represent images, proprioception, language, rewards, returns, or discretized/continuous actions.

Decision Transformer casts offline RL as conditional sequence modeling: predict actions from past context and a desired return. This avoids an explicit Bellman objective, but performance depends on dataset coverage and whether the conditioning signal identifies achievable behavior. It does not automatically solve out-of-distribution action selection.

Action chunking predicts several future controls per query. It can model temporally coherent motions and shorten the effective horizon, which is valuable for high-frequency manipulation. The tradeoff is responsiveness. Temporal ensembling or receding-horizon execution can combine overlapping chunks.

Architecture choices must preserve causality and modality identity. Record token order, attention mask, context length, image encoder, action representation, normalization, and inference rate. A silent mask error can produce excellent offline metrics and an unusable deployed policy.

Attention and causal masking

Scaled dot-product attention computes

Attention(Q,K,V) = softmax((QKᵀ / √d) + M)V

For causal control, mask M makes future tokens impossible to attend to. Inputs that are already known at decision time—such as the full language instruction—can be made visible according to the chosen architecture, but future actions and observations must remain hidden.

Decision Transformer view

A trajectory can be serialized as return-to-go, state, action triples. Training predicts the dataset action autoregressively. At deployment, the requested return is updated as rewards arrive. This is supervised sequence modeling over offline data; it does not perform online policy improvement unless new data and training are added.

Deployment checklist

Paper discussion

Contrast return-conditioned control in Decision Transformer with action chunking in ALOHA.

Build milestone

Train a small causal transformer to predict action sequences from state history. Compare single-step actions with short chunks at equal parameter count. Measure success, latency, and recovery after a mid-episode perturbation.

Visualize the attention mask itself and add a unit test that changing a future token cannot change an earlier prediction.


← Generative Models · Next: World Models →