최대 1 분 소요

한 줄 요약 — 이미지를 16×16 패치 시퀀스로 만들어 표준 Transformer에 넣으면, 대규모 사전학습 조건에서 CNN보다 좋은 성능을 낸다.

논문: arXiv:2010.11929

1. 문제 정의

2. 방법

3. 실험

4. 정리