2026/8/10 8:58:19 视觉特征提取器-训练范式02-自监督-联合嵌入预测02:V-JEPA【ViT 视频切块、3D Mask、双编码器与 Predictor 原理详解】
V-JEPA训练流程解析 http://arxiv.org/abs/2404.08471 We use a Vision Transformer (ViT) (Dosovitskiy et al., 202o; Arnab et al., 2021) as our video backbone. To process a videowith a transformer network, we split the video clip into a 3D grid of L spatio-temp…