Skip to the content.

Week 06 — Generative Models for Control

← Reinforcement Learning II · Week 6 of 11 · Next: Sequence Modeling →

Complete lecture deck

Complete deck: 39 slides rendered locally. Select any slide to open the full-resolution image.
Lecture 6: Generative Models - slide 1 of 39
Slide 1 of 39
Lecture 6: Generative Models - slide 2 of 39
Slide 2 of 39
Lecture 6: Generative Models - slide 3 of 39
Slide 3 of 39
Lecture 6: Generative Models - slide 4 of 39
Slide 4 of 39
Lecture 6: Generative Models - slide 5 of 39
Slide 5 of 39
Lecture 6: Generative Models - slide 6 of 39
Slide 6 of 39
Lecture 6: Generative Models - slide 7 of 39
Slide 7 of 39
Lecture 6: Generative Models - slide 8 of 39
Slide 8 of 39
Lecture 6: Generative Models - slide 9 of 39
Slide 9 of 39
Lecture 6: Generative Models - slide 10 of 39
Slide 10 of 39
Lecture 6: Generative Models - slide 11 of 39
Slide 11 of 39
Lecture 6: Generative Models - slide 12 of 39
Slide 12 of 39
Lecture 6: Generative Models - slide 13 of 39
Slide 13 of 39
Lecture 6: Generative Models - slide 14 of 39
Slide 14 of 39
Lecture 6: Generative Models - slide 15 of 39
Slide 15 of 39
Lecture 6: Generative Models - slide 16 of 39
Slide 16 of 39
Lecture 6: Generative Models - slide 17 of 39
Slide 17 of 39
Lecture 6: Generative Models - slide 18 of 39
Slide 18 of 39
Lecture 6: Generative Models - slide 19 of 39
Slide 19 of 39
Lecture 6: Generative Models - slide 20 of 39
Slide 20 of 39
Lecture 6: Generative Models - slide 21 of 39
Slide 21 of 39
Lecture 6: Generative Models - slide 22 of 39
Slide 22 of 39
Lecture 6: Generative Models - slide 23 of 39
Slide 23 of 39
Lecture 6: Generative Models - slide 24 of 39
Slide 24 of 39
Lecture 6: Generative Models - slide 25 of 39
Slide 25 of 39
Lecture 6: Generative Models - slide 26 of 39
Slide 26 of 39
Lecture 6: Generative Models - slide 27 of 39
Slide 27 of 39
Lecture 6: Generative Models - slide 28 of 39
Slide 28 of 39
Lecture 6: Generative Models - slide 29 of 39
Slide 29 of 39
Lecture 6: Generative Models - slide 30 of 39
Slide 30 of 39
Lecture 6: Generative Models - slide 31 of 39
Slide 31 of 39
Lecture 6: Generative Models - slide 32 of 39
Slide 32 of 39
Lecture 6: Generative Models - slide 33 of 39
Slide 33 of 39
Lecture 6: Generative Models - slide 34 of 39
Slide 34 of 39
Lecture 6: Generative Models - slide 35 of 39
Slide 35 of 39
Lecture 6: Generative Models - slide 36 of 39
Slide 36 of 39
Lecture 6: Generative Models - slide 37 of 39
Slide 37 of 39
Lecture 6: Generative Models - slide 38 of 39
Slide 38 of 39
Lecture 6: Generative Models - slide 39 of 39
Slide 39 of 39

Outcomes

Diffusion policy denoising process

Policy families

Policy head Represents modes? Inference
Gaussian regression Weakly One forward pass
Mixture density Yes, with fixed components Sample or choose a component
Energy-based Yes Optimize/sample low-energy actions
Diffusion Yes Iterative conditional denoising

Core notes

A deterministic regressor assumes one preferred action for each input. Robotics often violates that assumption: an object can be grasped from several sides, an obstacle can be passed on either side, and demonstrations can contain distinct styles. Averaging modes can create an action no expert would take.

Generative policies model a distribution over actions or trajectories. Energy-based policies learn a compatibility score and select low-energy actions through optimization or sampling. Diffusion policies learn to denoise a corrupted action sequence conditioned on observations, turning iterative denoising into conditional trajectory generation. Both can represent multiple valid solutions, but inference is more expensive than one forward pass.

Generating an action chunk provides temporal coherence and reduces the number of policy queries. Receding-horizon execution restores feedback: predict a chunk, execute only its first portion, observe again, and replan. Important design choices include action horizon, observation history, normalization, noise schedule, sampler steps, and the fraction of each chunk executed.

Evaluate more than imitation loss. Measure task success, inference latency, smoothness, constraint violations, robustness to observation changes, and diversity only when diversity is actually useful.

Conditional denoising objective

Training samples a clean action sequence a⁰, noise ε, and a diffusion step k. After corrupting the actions into aᵏ, the network predicts the noise while conditioning on observation history o:

L(θ) = E[‖ε - εθ(aᵏ, k, o)‖²]

At inference, begin with noise and apply the learned reverse steps. The final sequence is an action proposal, not a guarantee of feasibility. Receding-horizon execution lets fresh observations correct it.

Design decisions

Failure modes

Paper discussion

Compare planning-as-denoising in Diffuser with action selection in Implicit Behavioral Cloning.

Build milestone

Construct a toy two-mode action dataset. Compare mean regression with a mixture, energy-based, or diffusion model. Visualize whether generated actions cover both valid modes and whether closed-loop execution remains stable.

Sweep execution horizon and sampler steps. Report both success and median inference latency on the target hardware.


← Reinforcement Learning II · Next: Sequence Modeling →