Class Central is learner-supported. When you buy through links on our site, we may earn an affiliate commission.

University of Central Florida

Rethinking and Improving Relative Position Encoding for Vision Transformer - Lecture 23

University of Central Florida via YouTube

Overview

Google, IBM & Meta Certificates – 40% Off
One Coursera Plus subscription covers most Professional Certificates on Coursera.
Unlock All Certificates
This lecture examines methods for improving relative position encoding in Vision Transformers. It covers 2D relative position calculation, contextual and directed bias, piecewise indexing, implementation details, experiments, and complexity analysis.

Syllabus

Intro
Background and previous work
Self-attention
Absolute Position Encoding and Relative Position Encoding (RPE)
RPE in Transformer-XL
Bias and Contextual Mode
A Piecewise Index Function
2D Relative Position Calculation
Experiments
Implementation details
Directed vs. Undirected Bias vs. Contextual
Shared v.s. Unshared
Piecewise v.s. Clip
Number of buckets
Component-wise analysis
Complexity Analysis
Visualization
Conclusion

Taught by

UCF CRCV

Reviews

Start your review of Rethinking and Improving Relative Position Encoding for Vision Transformer - Lecture 23

Never Stop Learning.

Get personalized course recommendations, track subjects and courses with reminders, and more.

Someone learning on their laptop while sitting on the floor.