Multimodal fusion refers to how a model combines information from different modalities (text, image, audio). Early fusion mixes raw inputs into a shared representation, late fusion combines separate encoders' outputs, and cross-attention fuses at intermediate layers. The fusion strategy significantly affects what cross-modal reasoning the model can perform and at what computational cost.