AudioXオープンソースオーディオモデル - 無料で任意の内容を高品質な音楽や汎用オーディオに変換

ホーム

Audiox

HKUSTAudioによって開発

AudioXは任意のコンテンツから音声や音楽を生成できる統一拡散トランスフォーマーモデルです。高品質な汎用音声と音楽作品を生成し、柔軟な自然言語制御を提供し、複数のモダリティ入力をシームレスに処理できます。

テキスト生成オーディオ #マルチモーダル音声生成 #拡散トランスフォーマー #映像音楽生成

ダウンロード数 2,189

リリース時間 : 4/2/2025

モデル概要

AudioXはテキスト、動画、画像、音楽、音声など様々な入力を高品質な音声や音楽作品に変換できるマルチモーダル音声生成モデルです。

モデル特徴

マルチモーダル入力サポート

テキスト、動画、画像、音楽、音声など様々な入力モダリティを処理可能

高品質音声生成

プロフェッショナルレベルの汎用音声と音楽作品を生成

自然言語制御

テキストプロンプトによる音声生成内容とスタイルの柔軟な制御

統一アーキテクチャ

拡散トランスフォーマーアーキテクチャで異なる音声生成タスクを統一的に処理

モデル能力

テキストから音声生成

映像音楽生成

画像から音声変換

音声スタイル変換

音楽創作

使用事例

マルチメディア創作

映像音楽生成

動画に自動的にマッチするBGMを生成

映像内容に調和したプロフェッショナルレベルのBGMを生成

サウンドデザイン

テキスト記述に基づき特定シーンの効果音を生成

リアルな環境音や特殊効果音を創造

音楽創作

音楽生成

テキストプロンプトに基づき完全な音楽作品を創作

特定のスタイルと情感を持つ音楽を生成

音楽アレンジ

既存音楽を異なるスタイルに変換

原曲の構造を保ちつつ音楽スタイルを変更

🚀 AudioX

🎧 AudioXは、Anything-to-Audioおよび音楽生成に対応した統一的なDiffusion Transformerモデルです。高品質な一般的な音声や音楽を生成でき、柔軟な自然言語制御が可能で、テキスト、ビデオ、画像、音楽、音声などの様々なモダリティをシームレスに処理します。

🚀 クイックスタート

リポジトリのクローン

GIT_LFS_SKIP_SMUDGE=1 git clone https://huggingface.co/HKUSTAudio/AudioX
cd AudioX

conda create -n AudioX python=3.8.20
conda activate AudioX
pip install git+https://github.com/ZeyueT/AudioX.git
conda install -c conda-forge ffmpeg libsndfile

使用方法

import torch
import torchaudio
from einops import rearrange
from stable_audio_tools import get_pretrained_model
from stable_audio_tools.inference.generation import generate_diffusion_cond
from stable_audio_tools.data.utils import read_video, merge_video_audio
from stable_audio_tools.data.utils import load_and_process_audio
import os

device = "cuda" if torch.cuda.is_available() else "cpu"

# モデルのダウンロード
model, model_config = get_pretrained_model("HKUSTAudio/AudioX")
sample_rate = model_config["sample_rate"]
sample_size = model_config["sample_size"]
target_fps = model_config["video_fps"]
seconds_start = 0
seconds_total = 10

model = model.to(device)

# ビデオから音楽を生成する場合
video_path = "video.mp4"
text_prompt = "Generate music for the video" 
audio_path = None

video_tensor = read_video(video_path, seek_time=0, duration=seconds_total, target_fps=target_fps)
audio_tensor = load_and_process_audio(audio_path, sample_rate, seconds_start, seconds_total)

conditioning = [{
    "video_prompt": [video_tensor.unsqueeze(0)],        
    "text_prompt": text_prompt,
    "audio_prompt": audio_tensor.unsqueeze(0),
    "seconds_start": seconds_start,
    "seconds_total": seconds_total
}]
    
# ステレオ音声の生成
output = generate_diffusion_cond(
    model,
    steps=250,
    cfg_scale=7,
    conditioning=conditioning,
    sample_size=sample_size,
    sigma_min=0.3,
    sigma_max=500,
    sampler_type="dpmpp-3m-sde",
    device=device
)

# 音声バッチを単一のシーケンスに並べ替える
output = rearrange(output, "b d n -> d (b n)")

# ピーク正規化、クリッピング、int16に変換してファイルに保存
output = output.to(torch.float32).div(torch.max(torch.abs(output))).clamp(-1, 1).mul(32767).to(torch.int16).cpu()
torchaudio.save("output.wav", output, sample_rate)

if video_path is not None and os.path.exists(video_path):
    merge_video_audio(video_path, "output.wav", "output.mp4", 0, seconds_total)

✨ 主な機能

AudioXは、Anything-to-Audioおよび音楽生成に対応した統一的なDiffusion Transformerモデルです。以下のような機能を備えています。

高品質な一般的な音声や音楽を生成することができます。
柔軟な自然言語制御が可能で、様々なモダリティをシームレスに処理します。
テキスト、ビデオ、画像、音楽、音声などの様々な入力に対応しています。

📚 ドキュメント

リンク

論文: AudioXの研究内容を詳しく調べることができます。
プロジェクト: 公式のプロジェクトページにアクセスし、詳細情報や更新内容を確認できます。
コード: AudioXの実装コードが公開されています。

📄 ライセンス

CC-BY-NCに従ってください。

引用

もし私たちの研究が役に立った場合、以下のように引用していただけると幸いです。

@article{tian2025audiox,
  title={AudioX: Diffusion Transformer for Anything-to-Audio Generation},
  author={Tian, Zeyue and Jin, Yizhu and Liu, Zhaoyang and Yuan, Ruibin and Tan, Xu and Chen, Qifeng and Xue, Wei and Guo, Yike},
  journal={arXiv preprint arXiv:2503.10522},
  year={2025}
}