RayRoPE:用于多视图注意力的投影光线位置编码

我们研究了多视图变换器的位置编码,该变换器处理来自一组姿势输入图像的标记,并寻求一种独特地编码补丁的机制,允许具有多频率相似性的 SE(3) 不变注意力,并且可以适应底层场景的几何形状。我们发现先前的(绝对或相对)多视图注意力编码方案不能满足上述要求,并提出 RayRoPE 来解决这一差距。 RayRoPE 表示基于相关光线的补丁位置,但利用沿光线的预测点而不是…

来源:Apple机器学习研究

我们研究了多视图变换器的位置编码,该变换器处理来自一组姿势输入图像的标记,并寻求一种独特地编码补丁的机制,允许具有多频率相似性的 SE(3) 不变注意力,并且可以适应底层场景的几何形状。我们发现先前的(绝对或相对)多视图注意力编码方案不能满足上述要求,并提出 RayRoPE 来解决这一差距。 RayRoPE 基于相关光线表示补丁位置,但利用沿光线的预测点而不是几何感知编码的方向。为了实现 SE(3) 不变性,RayRoPE 计算查询帧投影坐标以计算多频率相似性。最后,由于沿着射线的“预测”3D 点可能不精确,RayRoPE 提出了一种在不确定性下分析计算预期位置编码的机制。我们在新颖视图合成和立体深度估计任务上验证了 RayRoPE,并表明它比替代位置编码方案持续改进(例如,CO3D 中的 LPIPS 相对改进了 15%)。我们还表明,RayRoPE 可以无缝合并 RGB-D 输入,从而比无法对该信息进行位置编码的替代方案获得更大的收益。

  • † 卡内基梅隆大学