Teacher and student use parallel passes with identical sliding windows, noisy latents, and frozen DiT weights; only far memory differs.
Far memory
Sliding window
Frozen DiT
Velocity
Teacher
Whole historical chunks
+
Student
MosaiChunk
+
MSE
Encoder
DiT
Gradients through the frozen DiT