# ビデオ分類

Vivit B 16x2 Kinetics400
MIT
ViViTはビジョントランスフォーマー(ViT)をビデオ処理向けに拡張したもので、特にビデオ分類タスクに適しています。
動画処理 Transformers
V
google
56.94k
32
Vivit B 16x2
MIT
ViViTはビジョントランスフォーマー(ViT)をビデオ処理向けに拡張したもので、主にビデオ分類などの下流タスクに使用されます。
動画処理 Transformers
V
google
989
11
Timesformer Hr Finetuned K400
TimeSformerは、空間-時間アテンションメカニズムに基づくビデオ理解モデルで、Kinetics-400データセットで事前学習とファインチューニングが行われています。
動画処理 Transformers
T
facebook
178
2
Xclip Base Patch16 Ucf 8 Shot
MIT
X-CLIPはCLIPのミニマルな拡張で、一般的なビデオ言語理解のために設計されており、(ビデオ、テキスト)ペアでコントラスティブに訓練され、ゼロショット、少数ショット、または完全教師ありのビデオ分類やビデオ-テキスト検索などのタスクに適しています。
動画処理 Transformers 英語
X
microsoft
16
0
Xclip Base Patch16 Hmdb 16 Shot
MIT
X-CLIPはCLIPの拡張バージョンで、汎用的なビデオと言語の理解に使用され、ビデオ分類とビデオ-テキスト検索タスクをサポートします。
動画処理 Transformers 英語
X
microsoft
49
0
Xclip Base Patch16 Hmdb 2 Shot
MIT
X-CLIPはCLIPの拡張バージョンで、汎用的なビデオと言語の理解のために設計されており、ビデオとテキストのペアでコントラスティブ学習により訓練され、ゼロショット、少数ショット、および完全教師ありのビデオ分類タスクをサポートします。
テキスト生成ビデオ Transformers 英語
X
microsoft
19
0
AIbase
未来を切り開く、あなたのAIソリューション知識ベース
© 2025AIbase