MobileNet V2オープンソースコンピュータビジョンモデル - モバイルデバイス向けに最適化され、画像分類に優れた性能を発揮

ホーム

Mobilenet V2 0.75 160

googleによって開発

MobileNet V2はモバイルデバイス向けに最適化された軽量なコンピュータビジョンモデルで、画像分類タスクで優れた性能を発揮します。

画像分類

Transformers

オープンソースライセンス:その他 #軽量モデル #モバイル最適化 #画像分類

ダウンロード数 480

リリース時間 : 11/10/2022

モデル概要

MobileNet V2は、画像分類タスクに適した小型で低遅延、低消費電力のモデルです。このモデルは、遅延、モデルサイズ、精度の間で良好なバランスを実現しています。

モデル特徴

軽量設計

モバイルデバイス向けに最適化されており、小型、低遅延、低消費電力の特徴を持つ

効率的な性能

遅延、モデルサイズ、精度の間で良好なバランスを実現

柔軟な設定

異なる深度乗数と入力解像度の設定をサポート

モデル能力

画像分類

物体認識

使用事例

コンピュータビジョン

モバイル画像分類

モバイルデバイス上で効率的な画像分類を実現

1000のImageNetカテゴリを正確に分類可能

組み込みビジョンアプリケーション

リソース制約のある組み込みデバイス上のビジョンタスクに適している

🚀 MobileNet V2

MobileNet V2は、解像度160x160のImageNet - 1kで事前学習されたモデルです。画像分類タスクに適しています。

🚀 クイックスタート

MobileNet V2モデルは、解像度160x160のImageNet - 1kで事前学習されています。このモデルは、Mark Sandler、Andrew Howard、Menglong Zhu、Andrey Zhmoginov、Liang - Chieh ChenによるMobileNetV2: Inverted Residuals and Linear Bottlenecksで紹介され、このリポジトリで最初に公開されました。

なお、MobileNet V2をリリースしたチームはこのモデルのモデルカードを作成していないため、このモデルカードはHugging Faceチームによって作成されています。

✨ 主な機能

モデルの説明

元のREADMEによると：

MobileNetは、さまざまなユースケースのリソース制約を満たすためにパラメータ化された小型で低遅延、低電力のモデルです。他の人気のある大規模モデル（Inceptionなど）と同様に、分類、検出、埋め込み、セグメンテーションなどのタスクに使用できます。MobileNetはモバイルデバイスで効率的に実行できます [...] MobileNetは、遅延、サイズ、精度のトレードオフを行い、文献上の人気モデルと有利に比較されます。

チェックポイントは mobilenet_v2_depth_size という名前で付けられています。例えば mobilenet_v2_0.75_160 で、0.75 は深度乗数、160 はモデルが学習された入力画像の解像度です。

📚 ドキュメント

想定される用途と制限

この生モデルは画像分類に使用できます。関心のあるタスクで微調整されたバージョンを探すには、モデルハブを参照してください。

使い方

以下は、このモデルを使用してCOCO 2017データセットの画像を1,000のImageNetクラスのいずれかに分類する方法です。

from transformers import AutoImageProcessor, AutoModelForImageClassification
from PIL import Image
import requests

url = "http://images.cocodataset.org/val2017/000000039769.jpg"
image = Image.open(requests.get(url, stream=True).raw)

preprocessor = AutoImageProcessor.from_pretrained("google/mobilenet_v2_0.75_160")
model = AutoModelForImageClassification.from_pretrained("google/mobilenet_v2_0.75_160")

inputs = preprocessor(images=image, return_tensors="pt")

outputs = model(**inputs)
logits = outputs.logits

# model predicts one of the 1000 ImageNet classes
predicted_class_idx = logits.argmax(-1).item()
print("Predicted class:", model.config.id2label[predicted_class_idx])

注意: このモデルは実際には1001クラスを予測します。ImageNetの1000クラスに加えて、追加の「背景」クラス（インデックス0）があります。

現在、特徴抽出器とモデルの両方がPyTorchをサポートしています。

BibTeXエントリと引用情報

@inproceedings{mobilenetv22018,
  title={MobileNetV2: Inverted Residuals and Linear Bottlenecks},
  author={Mark Sandler and Andrew Howard and Menglong Zhu and Andrey Zhmoginov and Liang-Chieh Chen},
  booktitle={CVPR},
  year={2018}
}