AudioX開源音頻模型 - 免費實現任意內容轉高質量音樂與通用音頻

首頁

Audiox

由HKUSTAudio開發

AudioX是一個統一的擴散變壓器模型，可實現任意內容到音頻及音樂的生成。它能生成高質量通用音頻與音樂作品，提供靈活的自然語言控制，並能無縫處理多種模態輸入。

文本生成音頻 #多模態音頻生成 #擴散變壓器 #視頻配樂生成

下載量 2,189

發布時間 : 4/2/2025

模型概述

AudioX是一個多模態音頻生成模型，能夠將文本、視頻、圖像、音樂和音頻等多種輸入轉換為高質量音頻或音樂作品。

模型特點

多模態輸入支持

能夠處理文本、視頻、圖像、音樂和音頻等多種輸入模態

高質量音頻生成

生成專業級質量的通用音頻和音樂作品

自然語言控制

通過文本提示靈活控制音頻生成內容和風格

統一架構

使用擴散變壓器架構統一處理不同音頻生成任務

模型能力

文本到音頻生成

視頻配樂生成

圖像到音頻轉換

音頻風格轉換

音樂創作

使用案例

多媒體創作

視頻配樂生成

為視頻自動生成匹配的背景音樂

生成與視頻內容協調的專業級配樂

音效設計

根據文本描述生成特定場景的音效

創造逼真的環境音效和特殊音效

音樂創作

音樂生成

根據文本提示創作完整音樂作品

生成具有特定風格和情感的音樂

音樂改編

將現有音樂轉換為不同風格

保持原曲結構的同時改變音樂風格

🚀 AudioX

AudioX是一個統一的擴散Transformer模型，用於任意內容到音頻以及音樂生成。它能夠生成高質量的通用音頻和音樂，提供靈活的自然語言控制，並能無縫處理包括文本、視頻、圖像、音樂和音頻在內的各種模態。

🚀 快速開始

克隆倉庫

GIT_LFS_SKIP_SMUDGE=1 git clone https://huggingface.co/HKUSTAudio/AudioX
cd AudioX

conda create -n AudioX python=3.8.20
conda activate AudioX
pip install git+https://github.com/ZeyueT/AudioX.git
conda install -c conda-forge ffmpeg libsndfile

✨ 主要特性

統一的擴散Transformer模型，可實現任意內容到音頻以及音樂的生成。
能夠生成高質量的通用音頻和音樂。
提供靈活的自然語言控制。
可無縫處理文本、視頻、圖像、音樂和音頻等多種模態。

📦 安裝指南

克隆倉庫後，按照以下步驟進行環境配置：

創建並激活conda環境：

conda create -n AudioX python=3.8.20
conda activate AudioX

安裝項目依賴：

pip install git+https://github.com/ZeyueT/AudioX.git
conda install -c conda-forge ffmpeg libsndfile

💻 使用示例

基礎用法

import torch
import torchaudio
from einops import rearrange
from stable_audio_tools import get_pretrained_model
from stable_audio_tools.inference.generation import generate_diffusion_cond
from stable_audio_tools.data.utils import read_video, merge_video_audio
from stable_audio_tools.data.utils import load_and_process_audio
import os

device = "cuda" if torch.cuda.is_available() else "cpu"

# Download model
model, model_config = get_pretrained_model("HKUSTAudio/AudioX")
sample_rate = model_config["sample_rate"]
sample_size = model_config["sample_size"]
target_fps = model_config["video_fps"]
seconds_start = 0
seconds_total = 10

model = model.to(device)

# for video-to-music generation
video_path = "video.mp4"
text_prompt = "Generate music for the video" 
audio_path = None

video_tensor = read_video(video_path, seek_time=0, duration=seconds_total, target_fps=target_fps)
audio_tensor = load_and_process_audio(audio_path, sample_rate, seconds_start, seconds_total)

conditioning = [{
    "video_prompt": [video_tensor.unsqueeze(0)],        
    "text_prompt": text_prompt,
    "audio_prompt": audio_tensor.unsqueeze(0),
    "seconds_start": seconds_start,
    "seconds_total": seconds_total
}]
    
# Generate stereo audio
output = generate_diffusion_cond(
    model,
    steps=250,
    cfg_scale=7,
    conditioning=conditioning,
    sample_size=sample_size,
    sigma_min=0.3,
    sigma_max=500,
    sampler_type="dpmpp-3m-sde",
    device=device
)

# Rearrange audio batch to a single sequence
output = rearrange(output, "b d n -> d (b n)")

# Peak normalize, clip, convert to int16, and save to file
output = output.to(torch.float32).div(torch.max(torch.abs(output))).clamp(-1, 1).mul(32767).to(torch.int16).cpu()
torchaudio.save("output.wav", output, sample_rate)

if video_path is not None and os.path.exists(video_path):
    merge_video_audio(video_path, "output.wav", "output.mp4", 0, seconds_total)

📚 詳細文檔

📄 許可證

請遵循 CC-BY-NC 許可證。

🔖 引用

如果您覺得我們的工作有用，請考慮引用：

@article{tian2025audiox,
  title={AudioX: Diffusion Transformer for Anything-to-Audio Generation},
  author={Tian, Zeyue and Jin, Yizhu and Liu, Zhaoyang and Yuan, Ruibin and Tan, Xu and Chen, Qifeng and Xue, Wei and Guo, Yike},
  journal={arXiv preprint arXiv:2503.10522},
  year={2025}
}