计算图文相似度矩阵
由于 image_embeds 和 text_embeds 已经做过 L2 归一化,因此两者点积就是余弦相似度。
实现 CLIP 对比学习损失函数。
CLIP(ContrastiveLanguage–ImagePretraining)通过对比学习,将图像和文本嵌入到同一向量空间。对于一个 batch 中的 N 个图文对,CLIP 损失要求匹配的图文对相似度最高。
Scan the QR code below with WeChat to sign in
First-time scan will create your account automatically
请使用微信扫描下方二维码完成注册