تخطّي إلى المحتوى
Kudos AI

An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

Alexey Dosovitskiy et al. · 2020 · arXiv:2010.11929

الرؤية الحاسوبيةالتعلّم العميقالذكاء الاصطناعي التوليديعرض المصدر ↗

ملخّص

يطبّق محوّلاً معيارياً على الصور مباشرةً بتقطيع كل صورة إلى رقع ثابتة الحجم ومعاملة متتالية الرقع كوحدات، بلا أي التفاف.

لماذا تهمّ

أظهر أن المحوّل ليس خاصاً باللغة: فمع بيانات كافية، تضاهي معمارية تسلسل عامة الشبكاتِ الالتفافية في تصنيف الصور أو تتفوّق عليها. ويستشهد به راشكا لبيان أن معماريات المحوّل لا تقتصر على المدخلات النصية.