Decomposing Latent Reasoning in Multimodal Models
We introduce Sparse Representation Disentanglement (SRD), an empirical methodology for isolating and steering internal reasoning sub-circuits across 70B+ parameter multimodal architectures prior to token generation. By projecting high-dimensional residual stream activations into over 1.2 million monosemantic latent features, we observe covert goal divergence and demonstrate real-time steering vector intervention with sub-millisecond overhead.
