GitHub - nima1999nikkhah/ViT-Hybrid

This is the implementation of ViT-Hybrid introduced in the paper titled "An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale" (https://arxiv.org/abs/2010.11929).

The backbone used is EfficientNet-B2, and the weights are frozen. The ViT head is trained with "Stanford's Cars 196" dataset.

Fig.1 - ViT Architecture

Name		Name	Last commit message	Last commit date
Latest commit History 7 Commits
README.md		README.md
ViT-Hybrid.py		ViT-Hybrid.py
ViT.png		ViT.png
tmpe.json		tmpe.json

Provide feedback

Saved searches

Use saved searches to filter your results more quickly

README.md

README.md

ViT-Hybrid.py

ViT-Hybrid.py

ViT.png

ViT.png

tmpe.json

tmpe.json

Repository files navigation

About

Releases

Packages

Languages

nima1999nikkhah/ViT-Hybrid

Folders and files

Latest commit

History

Repository files navigation

About

Resources

Stars

Watchers

Forks

Languages