vit_large_patch16_224.orig_in21k开源图像分类模型

首页

Vit Large Patch16 224.orig In21k

由 timm 开发

基于Vision Transformer（ViT）的图像分类模型，由Google Research在JAX框架下使用ImageNet-21k预训练，后移植到PyTorch。适用于特征提取和微调场景。

图像分类

Transformers

开源协议:Apache-2.0 #ImageNet-21k预训练 #ViT骨干网络 #无分类头设计

下载量 584

发布时间 : 11/17/2023

模型简介

这是一个大型Vision Transformer模型，专门用于图像分类和特征提取。模型在ImageNet-21k数据集上进行了预训练，不包含分类头，适合作为骨干网络用于下游任务的微调。

模型特点

大规模预训练

在ImageNet-21k大规模数据集上预训练，具有强大的特征提取能力

纯Transformer架构

完全基于Transformer架构，不使用卷积操作，适合处理全局图像信息

灵活的特征提取

可以输出不同层次的特征表示，包括池化特征和非池化序列特征

高效计算

相对较大的模型规模下仍保持合理的计算量（59.7 GMACs）

模型能力

图像特征提取

图像分类

迁移学习

计算机视觉任务

使用案例

计算机视觉

图像分类

作为骨干网络用于图像分类任务，可通过微调适应特定分类需求

特征提取

提取图像的高级特征表示，用于下游任务如目标检测、图像分割等

迁移学习

利用预训练权重作为起点，在小规模数据集上进行微调

🚀 vit_large_patch16_224.orig_in21k模型卡片

这是一个视觉变换器（ViT）图像分类模型。由论文作者在JAX中基于ImageNet - 21k数据集进行预训练，再由Ross Wightman将其移植到PyTorch。该模型没有分类头，仅适用于特征提取和微调。

🚀 快速开始

本模型可用于图像分类和提取图像嵌入特征，具体使用方法见下方使用示例。

✨ 主要特性

模型类型：图像分类/特征骨干网络
模型统计信息：
- 参数数量（百万）：303.3
- 吉兆次乘法累加运算（GMACs）：59.7
- 激活值数量（百万）：43.8
- 图像尺寸：224 x 224
相关论文：
- An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
数据集：ImageNet - 21k
原始代码库：https://github.com/google-research/vision_transformer

📦 安装指南

文档未提及安装步骤，可参考timm库的官方安装说明进行安装。

💻 使用示例

基础用法

图像分类

from urllib.request import urlopen
from PIL import Image
import timm

img = Image.open(urlopen(
    'https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/beignets-task-guide.png'
))

model = timm.create_model('vit_large_patch16_224.orig_in21k', pretrained=True)
model = model.eval()

# get model specific transforms (normalization, resize)
data_config = timm.data.resolve_model_data_config(model)
transforms = timm.data.create_transform(**data_config, is_training=False)

output = model(transforms(img).unsqueeze(0))  # unsqueeze single image into batch of 1

top5_probabilities, top5_class_indices = torch.topk(output.softmax(dim=1) * 100, k=5)

图像嵌入

from urllib.request import urlopen
from PIL import Image
import timm

img = Image.open(urlopen(
    'https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/beignets-task-guide.png'
))

model = timm.create_model(
    'vit_large_patch16_224.orig_in21k',
    pretrained=True,
    num_classes=0,  # remove classifier nn.Linear
)
model = model.eval()

# get model specific transforms (normalization, resize)
data_config = timm.data.resolve_model_data_config(model)
transforms = timm.data.create_transform(**data_config, is_training=False)

output = model(transforms(img).unsqueeze(0))  # output is (batch_size, num_features) shaped tensor

# or equivalently (without needing to set num_classes=0)

output = model.forward_features(transforms(img).unsqueeze(0))
# output is unpooled, a (1, 197, 1024) shaped tensor

output = model.forward_head(output, pre_logits=True)
# output is a (1, num_features) shaped tensor

📚 详细文档

可在timm的模型结果页面中查看该模型的数据集和运行时指标。

📄 许可证

本模型采用Apache - 2.0许可证。

📚 引用

@article{dosovitskiy2020vit,
  title={An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale},
  author={Dosovitskiy, Alexey and Beyer, Lucas and Kolesnikov, Alexander and Weissenborn, Dirk and Zhai, Xiaohua and Unterthiner, Thomas and  Dehghani, Mostafa and Minderer, Matthias and Heigold, Georg and Gelly, Sylvain and Uszkoreit, Jakob and Houlsby, Neil},
  journal={ICLR},
  year={2021}
}

@misc{rw2019timm,
  author = {Ross Wightman},
  title = {PyTorch Image Models},
  year = {2019},
  publisher = {GitHub},
  journal = {GitHub repository},
  doi = {10.5281/zenodo.4414861},
  howpublished = {\url{https://github.com/huggingface/pytorch-image-models}}
}