RUPunct_small开源模型 - 免费处理简单文本，CPU上高速运行必备

首页

Rupunct Small

由 RUPunct 开发

RUPunct_small 是 RUPunct 系列中最小的模型，适合处理简单文本以及在 CPU 上需要高速运行的场景。

序列标注

Transformers

其他开源协议:MIT #俄语标点恢复 #轻量级模型 #CPU高效运行

下载量 63

发布时间 : 5/1/2024

模型简介

RUPunct_small 是一个俄语文本标点符号恢复模型，主要用于自动为俄语文本添加标点符号和大小写转换。

模型特点

轻量级

模型体积小，适合在 CPU 上高速运行

俄语标点恢复

专门针对俄语文本设计，能准确恢复多种标点符号

大小写转换

能够正确处理文本的大小写转换

模型能力

俄语文本标点恢复

文本大小写转换

简单文本处理

使用案例

文本处理

俄语文本自动标点

为无标点的俄语文本自动添加正确的标点符号

提高文本可读性，便于后续处理

文本规范化

将无格式俄语文本转换为规范格式

统一文本格式，便于存储和分析

🚀 RUPunct_small

RUPunct_small是RUPunct系列中最小的模型。它非常适合处理简单文本，以及需要在CPU上实现高速运行的场景。

🚀 快速开始

RUPunct_small是一个轻量级的标点恢复模型，专为在CPU上实现快速推理而设计。以下是使用该模型进行推理的代码示例：

from transformers import pipeline
from transformers import AutoTokenizer

pt = "RUPunct/RUPunct_small"

tk = AutoTokenizer.from_pretrained(pt, strip_accents=False, add_prefix_space=True)
classifier = pipeline("ner", model=pt, tokenizer=tk, aggregation_strategy="first")


def process_token(token, label):
    if label == "LOWER_O":
        return token
    if label == "LOWER_PERIOD":
        return token + "."
    if label == "LOWER_COMMA":
        return token + ","
    if label == "LOWER_QUESTION":
        return token + "?"
    if label == "LOWER_TIRE":
        return token + "—"
    if label == "LOWER_DVOETOCHIE":
        return token + ":"
    if label == "LOWER_VOSKL":
        return token + "!"
    if label == "LOWER_PERIODCOMMA":
        return token + ";"
    if label == "LOWER_DEFIS":
        return token + "-"
    if label == "LOWER_MNOGOTOCHIE":
        return token + "..."
    if label == "LOWER_QUESTIONVOSKL":
        return token + "?!"
    if label == "UPPER_O":
        return token.capitalize()
    if label == "UPPER_PERIOD":
        return token.capitalize() + "."
    if label == "UPPER_COMMA":
        return token.capitalize() + ","
    if label == "UPPER_QUESTION":
        return token.capitalize() + "?"
    if label == "UPPER_TIRE":
        return token.capitalize() + " —"
    if label == "UPPER_DVOETOCHIE":
        return token.capitalize() + ":"
    if label == "UPPER_VOSKL":
        return token.capitalize() + "!"
    if label == "UPPER_PERIODCOMMA":
        return token.capitalize() + ";"
    if label == "UPPER_DEFIS":
        return token.capitalize() + "-"
    if label == "UPPER_MNOGOTOCHIE":
        return token.capitalize() + "..."
    if label == "UPPER_QUESTIONVOSKL":
        return token.capitalize() + "?!"
    if label == "UPPER_TOTAL_O":
        return token.upper()
    if label == "UPPER_TOTAL_PERIOD":
        return token.upper() + "."
    if label == "UPPER_TOTAL_COMMA":
        return token.upper() + ","
    if label == "UPPER_TOTAL_QUESTION":
        return token.upper() + "?"
    if label == "UPPER_TOTAL_TIRE":
        return token.upper() + " —"
    if label == "UPPER_TOTAL_DVOETOCHIE":
        return token.upper() + ":"
    if label == "UPPER_TOTAL_VOSKL":
        return token.upper() + "!"
    if label == "UPPER_TOTAL_PERIODCOMMA":
        return token.upper() + ";"
    if label == "UPPER_TOTAL_DEFIS":
        return token.upper() + "-"
    if label == "UPPER_TOTAL_MNOGOTOCHIE":
        return token.upper() + "..."
    if label == "UPPER_TOTAL_QUESTIONVOSKL":
        return token.upper() + "?!"

while 1:
    input_text = input(":> ")
    preds = classifier(input_text)
    output = ""
    for item in preds:
        output += " " + process_token(item['word'].strip(), item['entity_group'])
    print(">>>", output)