Description
Cross-attention for conditioning on different modalities (text→image, context→predictor).
Operation
# Q from one modality, K/V from another
# query: (B, Tq, D), key/value: (B, Tkv, D)
output = cross_attention(query, key, value, mask=None)
Implementation
- Flash-attention style memory efficiency
- Support for causal and padding masks
- Multi-head with head_dim parameter
- Fused QKV projection option
Tests
Used In
Perceiver, Flamingo, JEPA predictor, Stable Diffusion
Description
Cross-attention for conditioning on different modalities (text→image, context→predictor).
Operation
Implementation
Tests
Used In
Perceiver, Flamingo, JEPA predictor, Stable Diffusion