Description
Convert images to patch token sequences for Vision Transformers, JEPA, MAE.
Operation
# Input: (B, C, H, W) image
# Output: (B, num_patches, embed_dim)
patches = patch_embed(image, patch_size=16, embed_dim=768)
Implementation
- Fused kernel: reshape + linear projection
- Support variable patch sizes (14, 16, 32)
- Optional: include CLS token prepend
Tests
Used In
ViT, JEPA, MAE, BEiT, DINOv2
Description
Convert images to patch token sequences for Vision Transformers, JEPA, MAE.
Operation
Implementation
Tests
Used In
ViT, JEPA, MAE, BEiT, DINOv2