An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (ViT)
한 줄 요약 — 이미지를 16×16 패치 시퀀스로 만들어 표준 Transformer에 넣으면, 대규모 사전학습 조건에서 CNN보다 좋은 성능을 낸다.
논문: arXiv:2010.11929
한 줄 요약 — 이미지를 16×16 패치 시퀀스로 만들어 표준 Transformer에 넣으면, 대규모 사전학습 조건에서 CNN보다 좋은 성능을 낸다.
논문: arXiv:2010.11929