# AudioSetファインチューニング

Vit Base Patch16 1024 128.audiomae As2m Ft As20k
視覚トランスフォーマー(ViT)ベースのオーディオ処理モデル、自己教師ありマスクオートエンコーダ(MAE)手法でAudioSet-2Mで事前学習し、AudioSet-20kでファインチューニング
音声分類
V
gaunernst
335
2
Ast Finetuned Audioset 14 14 0.443
Bsd-3-clause
AudioSetデータセットでファインチューニングされたオーディオスペクトログラムトランスフォーマーで、音声をスペクトログラムに変換後、ビジョントランスフォーマーアーキテクチャで処理し、音声分類タスクで優れた性能を発揮します。
音声分類 Transformers
A
MIT
194.20k
5
Ast Finetuned Audioset 16 16 0.442
Bsd-3-clause
AudioSetデータセットでファインチューニングされたオーディオスペクトログラムトランスフォーマーで、視覚トランスフォーマーアーキテクチャを使用してオーディオスペクトログラムを処理し、オーディオ分類タスクで優れた性能を発揮します。
音声分類 Transformers
A
MIT
35
1
Ast Finetuned Audioset 12 12 0.447
Bsd-3-clause
AudioSetデータセットでファインチューニングされたオーディオスペクトログラムトランスフォーマー(AST)。ViTアーキテクチャを使用してオーディオスペクトログラムを処理し、複数のオーディオ分類ベンチマークで優れた性能を発揮します。
音声分類 Transformers
A
MIT
25
0
Ast Finetuned Audioset 10 10 0.448 V2
Bsd-3-clause
AudioSetデータセットでファインチューニングされたオーディオスペクトログラムトランスフォーマーで、オーディオをスペクトログラムに変換後、ビジョントランスフォーマーで処理し、オーディオ分類タスクで優れた性能を発揮します。
音声分類 Transformers
A
MIT
2,072
0
Ast Finetuned Audioset 10 10 0.448
Bsd-3-clause
AudioSetデータセットでファインチューニングされたオーディオスペクトログラムトランスフォーマー(AST)。ビジョントランスフォーマー構造を使用してオーディオスペクトログラムを処理し、オーディオ分類タスクで優れた性能を発揮します。
音声分類 Transformers
A
MIT
326
0
Ast Finetuned Audioset 10 10 0.4593
Bsd-3-clause
オーディオスペクトログラムトランスフォーマー(AST)はAudioSetでファインチューニングされたモデルで、オーディオをスペクトログラムに変換後、ビジョントランスフォーマーを適用してオーディオ分類を行います。
音声分類 Transformers
A
MIT
308.88k
311
AIbase
未来を切り開く、あなたのAIソリューション知識ベース
© 2025AIbase