Wav2vecbert2 Filledpause_分類| AIbase模型庫

首頁

Wav2vecbert2 Filledpause

由classla開發

用於對音頻中20毫秒的幀進行分類，判斷是否存在填充停頓（如'eee'、'errm'等）的模型

音頻分類

Safetensors

其他開源協議:Apache-2.0 #多語言填充停頓檢測 #20ms幀級分類 #音頻事件評估

下載量 4,290

發布時間 : 8/28/2024

模型概述

本模型基於facebook/w2v-bert-2.0基礎模型訓練，專門用於檢測語音中的填充停頓現象。

模型特點

多語言支持

支持斯洛文尼亞語、克羅地亞語、塞爾維亞語、捷克語和波蘭語五種語言的填充停頓檢測

高精度檢測

在ROG語料庫上達到0.968的F1值，表現出色

智能後處理

通過剔除首尾短片段等後處理方式，顯著提升在ParlaSpeech語料庫上的表現

模型能力

音頻幀分類

填充停頓檢測

多語言語音分析

使用案例

語音處理

語音轉寫預處理

在語音轉寫前識別並標記填充停頓，提高轉寫準確性

減少轉寫結果中的非語義內容

語音質量分析

分析演講或對話中的填充停頓頻率，評估口語流暢度

提供量化指標用於演講訓練或語言學習

🚀 填充停頓的幀分類模型

本模型可基於填充停頓（如 “eee”、“errm” 等）的存在情況，對音頻中每個 20 毫秒的幀進行分類。

🚀 快速開始

此模型用於填充停頓的幀分類，通過對音頻幀的分析判斷是否存在填充停頓。

✨ 主要特性

支持斯洛文尼亞語（sl）、克羅地亞語（hr）、塞爾維亞語（sr）、捷克語（cs）和波蘭語（pl）。
基於 facebook/w2v-bert-2.0 基礎模型。
適用於音頻分類任務。
使用 F1、召回率和精確率作為評估指標。

屬性	詳情
模型類型	填充停頓的幀分類模型
訓練數據	基於人類標註的斯洛文尼亞語語音語料庫 ROG - Artur

📦 安裝指南

文檔中未提及安裝相關內容，故跳過此章節。

💻 使用示例

基礎用法

from transformers import AutoFeatureExtractor, Wav2Vec2BertForAudioFrameClassification
from datasets import Dataset, Audio
import torch
import numpy as np
from pathlib import Path

device = torch.device("cuda")
model_name = "classla/wav2vecbert2-filledPause"
feature_extractor = AutoFeatureExtractor.from_pretrained(model_name)
model = Wav2Vec2BertForAudioFrameClassification.from_pretrained(model_name).to(device)

ds = Dataset.from_dict(
    {
        "audio": [
            "/cache/peterr/mezzanine_resources/filled_pauses/data/dev/Iriss-J-Gvecg-P500001-avd_2082.293_2112.194.wav"
        ],
    }
).cast_column("audio", Audio(sampling_rate=16_000, mono=True))


def frames_to_intervals(
    frames: list[int],
    drop_short=True,
    drop_initial=True,
    drop_final=True,
    short_cutoff_s=0.08,
) -> list[tuple[float]]:
    """Transforms a list of ones or zeros, corresponding to annotations on frame
    levels, to a list of intervals ([start second, end second]).

    Allows for additional filtering on duration (false positives are often
    short) and start times (false positives starting at 0.0 are often an
    artifact of poor segmentation).

    :param list[int] frames: Input frame labels
    :param bool drop_short: Drop everything shorter than short_cutoff_s,
        defaults to True
    :param bool drop_initial: Drop predictions starting at 0.0, defaults to True
    :param bool drop_final: Drop predictions ending at audio end, defaults to True
    :param float short_cutoff_s: Duration in seconds of shortest allowable
        prediction, defaults to 0.08

    :return list[tuple[float]]: List of intervals [start_s, end_s]
    """
    from itertools import pairwise
    import pandas as pd

    results = []
    ndf = pd.DataFrame(
        data={
            "time_s": [0.020 * i for i in range(len(frames))],
            "frames": frames,
        }
    )
    ndf = ndf.dropna()
    indices_of_change = ndf.frames.diff()[ndf.frames.diff() != 0].index.values
    for si, ei in pairwise(indices_of_change):
        if ndf.loc[si : ei - 1, "frames"].mode()[0] == 0:
            pass
        else:
            results.append(
                (
                    round(ndf.loc[si, "time_s"], 3),
                    round(ndf.loc[ei, "time_s"], 3),
                )
            )
    if drop_short and (len(results) > 0):
        results = [i for i in results if (i[1] - i[0] >= short_cutoff_s)]
    if drop_initial and (len(results) > 0):
        results = [i for i in results if i[0] != 0.0]
    if drop_final and (len(results) > 0):
        results = [i for i in results if i[1] != 0.02 * len(frames)]
    return results


def evaluator(chunks):
    sampling_rate = chunks["audio"][0]["sampling_rate"]
    with torch.no_grad():
        inputs = feature_extractor(
            [i["array"] for i in chunks["audio"]],
            return_tensors="pt",
            sampling_rate=sampling_rate,
        ).to(device)
        logits = model(**inputs).logits
    y_pred = np.array(logits.cpu()).argmax(axis=-1)
    intervals = [frames_to_intervals(i) for i in y_pred]
    return {"y_pred": y_pred.tolist(), "intervals": intervals}


ds = ds.map(evaluator, batched=True)
print(ds["y_pred"][0])
# Prints a list of 20ms frames: [0,0,0,0,1,1,1,1,1,1,1,1,1,1,1,0....]
# with 0 indicating no filled pause detected in that frame

print(ds["intervals"][0])
# Prints the identified intervals as a list of [start_s, ends_s]:
# [[0.08, 0.28 ], ...]

📚 詳細文檔

訓練數據

模型在人類標註的斯洛文尼亞語語音語料庫 ROG - Artur 上進行訓練。訓練集的錄音被分割成長度最多為 30 秒的片段。

評估

儘管模型的輸出是一系列表示 20 毫秒幀的 0 或 1，但評估是在事件級別進行的；連續輸出為 1 的片段會被合併為一個事件。當真實事件和預測事件部分重疊時，將其計為真陽性。我們報告了正類的精確率、召回率和 F1 分數。

ROG 語料庫評估

後處理	召回率	精確率	F1 分數
無	0.981	0.955	0.968

ParlaSpeech 語料庫評估

對於 ParlaSpeech 集合中的每種語言，人工標註員對 400 個實例進行了採樣和標註。

由於 ParlaSpeech 語料庫太大，無法像 ROG 語料庫那樣進行手動分割，因此在推理時觀察到了一些失敗模式。研究發現，後處理可以改善結果。觀察到誤報是由不恰當的音頻分割引起的，因此禁用在音頻開始處開始或在音頻結束處結束的預測可能會有幫助。另一種失敗模式是預測出非常短的事件，因此可以安全地忽略非常短的預測。

添加後處理後，模型達到了以下指標：

語言	後處理方式	召回率	精確率	F1 分數
捷克語（CZ）	去除短的起始和結束預測	0.889	0.859	0.874
克羅地亞語（HR）	去除短的起始和結束預測	0.94	0.887	0.913
波蘭語（PL）	去除短的起始和結束預測	0.903	0.947	0.924
塞爾維亞語（RS）	去除短的起始和結束預測	0.966	0.915	0.94