Teacher and student use parallel passes with identical sliding windows, noisy latents, and frozen DiT weights; only far memory differs. Far memory Sliding window Frozen DiT Velocity Teacher Whole historical chunks + Student MosaiChunk + MSE Encoder DiT Gradients through the frozen DiT