AudioX开源音频模型 - 免费实现任意内容转高质量音乐与通用音频

首页

Audiox

由 HKUSTAudio 开发

AudioX是一个统一的扩散变压器模型，可实现任意内容到音频及音乐的生成。它能生成高质量通用音频与音乐作品，提供灵活的自然语言控制，并能无缝处理多种模态输入。

文本生成音频 #多模态音频生成 #扩散变压器 #视频配乐生成

下载量 2,189

发布时间 : 4/2/2025

模型简介

AudioX是一个多模态音频生成模型，能够将文本、视频、图像、音乐和音频等多种输入转换为高质量音频或音乐作品。

模型特点

多模态输入支持

能够处理文本、视频、图像、音乐和音频等多种输入模态

高质量音频生成

生成专业级质量的通用音频和音乐作品

自然语言控制

通过文本提示灵活控制音频生成内容和风格

统一架构

使用扩散变压器架构统一处理不同音频生成任务

模型能力

文本到音频生成

视频配乐生成

图像到音频转换

音频风格转换

音乐创作

使用案例

多媒体创作

视频配乐生成

为视频自动生成匹配的背景音乐

生成与视频内容协调的专业级配乐

音效设计

根据文本描述生成特定场景的音效

创造逼真的环境音效和特殊音效

音乐创作

音乐生成

根据文本提示创作完整音乐作品

生成具有特定风格和情感的音乐

音乐改编

将现有音乐转换为不同风格

保持原曲结构的同时改变音乐风格

🚀 AudioX

AudioX是一个统一的扩散Transformer模型，用于任意内容到音频以及音乐生成。它能够生成高质量的通用音频和音乐，提供灵活的自然语言控制，并能无缝处理包括文本、视频、图像、音乐和音频在内的各种模态。

🚀 快速开始

克隆仓库

GIT_LFS_SKIP_SMUDGE=1 git clone https://huggingface.co/HKUSTAudio/AudioX
cd AudioX

conda create -n AudioX python=3.8.20
conda activate AudioX
pip install git+https://github.com/ZeyueT/AudioX.git
conda install -c conda-forge ffmpeg libsndfile

✨ 主要特性

统一的扩散Transformer模型，可实现任意内容到音频以及音乐的生成。
能够生成高质量的通用音频和音乐。
提供灵活的自然语言控制。
可无缝处理文本、视频、图像、音乐和音频等多种模态。

📦 安装指南

克隆仓库后，按照以下步骤进行环境配置：

创建并激活conda环境：

conda create -n AudioX python=3.8.20
conda activate AudioX

安装项目依赖：

pip install git+https://github.com/ZeyueT/AudioX.git
conda install -c conda-forge ffmpeg libsndfile

💻 使用示例

基础用法

import torch
import torchaudio
from einops import rearrange
from stable_audio_tools import get_pretrained_model
from stable_audio_tools.inference.generation import generate_diffusion_cond
from stable_audio_tools.data.utils import read_video, merge_video_audio
from stable_audio_tools.data.utils import load_and_process_audio
import os

device = "cuda" if torch.cuda.is_available() else "cpu"

# Download model
model, model_config = get_pretrained_model("HKUSTAudio/AudioX")
sample_rate = model_config["sample_rate"]
sample_size = model_config["sample_size"]
target_fps = model_config["video_fps"]
seconds_start = 0
seconds_total = 10

model = model.to(device)

# for video-to-music generation
video_path = "video.mp4"
text_prompt = "Generate music for the video" 
audio_path = None

video_tensor = read_video(video_path, seek_time=0, duration=seconds_total, target_fps=target_fps)
audio_tensor = load_and_process_audio(audio_path, sample_rate, seconds_start, seconds_total)

conditioning = [{
    "video_prompt": [video_tensor.unsqueeze(0)],        
    "text_prompt": text_prompt,
    "audio_prompt": audio_tensor.unsqueeze(0),
    "seconds_start": seconds_start,
    "seconds_total": seconds_total
}]
    
# Generate stereo audio
output = generate_diffusion_cond(
    model,
    steps=250,
    cfg_scale=7,
    conditioning=conditioning,
    sample_size=sample_size,
    sigma_min=0.3,
    sigma_max=500,
    sampler_type="dpmpp-3m-sde",
    device=device
)

# Rearrange audio batch to a single sequence
output = rearrange(output, "b d n -> d (b n)")

# Peak normalize, clip, convert to int16, and save to file
output = output.to(torch.float32).div(torch.max(torch.abs(output))).clamp(-1, 1).mul(32767).to(torch.int16).cpu()
torchaudio.save("output.wav", output, sample_rate)

if video_path is not None and os.path.exists(video_path):
    merge_video_audio(video_path, "output.wav", "output.mp4", 0, seconds_total)

📚 详细文档

📄 许可证

请遵循 CC-BY-NC 许可证。

🔖 引用

如果您觉得我们的工作有用，请考虑引用：

@article{tian2025audiox,
  title={AudioX: Diffusion Transformer for Anything-to-Audio Generation},
  author={Tian, Zeyue and Jin, Yizhu and Liu, Zhaoyang and Yuan, Ruibin and Tan, Xu and Chen, Qifeng and Xue, Wei and Guo, Yike},
  journal={arXiv preprint arXiv:2503.10522},
  year={2025}
}