ffxiv-ja-ko-translator开源翻译模型 - 免费实现《最终幻想14》日语到韩语翻译

首页

Ffxiv Ja Ko Translator

由 sappho192 开发

一个专门用于将《最终幻想14》游戏中的日语文本翻译成韩语的翻译模型

机器翻译

Transformers

支持多种语言开源协议:MIT #游戏专用翻译 #日韩双语转换 #BERT-GPT架构

下载量 40

发布时间 : 4/3/2023

模型简介

该模型基于Transformer架构，专门针对《最终幻想14》游戏中的日语到韩语翻译任务进行了优化，能够准确翻译游戏中的专有名词和常用短语。

模型特点

游戏专用翻译

专门针对《最终幻想14》游戏内容优化，能准确翻译游戏中的专有名词和术语

基于Transformer架构

使用BERT-japanese作为编码器，KoGPT2作为解码器，实现高质量的翻译效果

多平台支持

提供PyTorch和ONNX两种格式的模型，支持不同部署环境

模型能力

日语到韩语文本翻译

游戏术语准确翻译

短句和段落翻译

使用案例

游戏本地化

游戏内文本翻译

将《最终幻想14》游戏中的日语界面、任务文本等翻译成韩语

准确翻译如'ギルガメッシュ討伐戦'为'길가메쉬 토벌전'等游戏专有名词

玩家交流辅助

帮助日语玩家与韩语玩家之间的交流

可翻译常见游戏交流用语如'一緒に行きましょうか？'为'같이 가실래요?'

🚀 最终幻想XIV日语到韩语翻译器

本项目是一个用于最终幻想XIV的日语到韩语的翻译器，借助Transformer架构实现高效准确的翻译，为玩家提供更好的游戏体验。

🚀 快速开始

本项目的详细信息可在 Github仓库中查看。

演示

💻 使用示例

基础用法

推理（PyTorch）

from transformers import(
    EncoderDecoderModel,
    PreTrainedTokenizerFast,
    BertJapaneseTokenizer,
)

import torch

encoder_model_name = "cl-tohoku/bert-base-japanese-v2"
decoder_model_name = "skt/kogpt2-base-v2"

src_tokenizer = BertJapaneseTokenizer.from_pretrained(encoder_model_name)
trg_tokenizer = PreTrainedTokenizerFast.from_pretrained(decoder_model_name)

# You should change following `./best_model` to the path of model **directory**
model = EncoderDecoderModel.from_pretrained("./best_model")

text = "ギルガメッシュ討伐戦"
# text = "ギルガメッシュ討伐戦に行ってきます。一緒に行きましょうか？"

def translate(text_src):
    embeddings = src_tokenizer(text_src, return_attention_mask=False, return_token_type_ids=False, return_tensors='pt')
    embeddings = {k: v for k, v in embeddings.items()}
    output = model.generate(**embeddings, max_length=500)[0, 1:-1]
    text_trg = trg_tokenizer.decode(output.cpu())
    return text_trg

print(translate(text))

高级用法

推理（Optimum.OnnxRuntime）

注意，当前的Optimum.OnnxRuntime仍然需要PyTorch作为后端。[问题] 你可以使用 [ONNX] 或 [量化ONNX] 模型。

from transformers import BertJapaneseTokenizer,PreTrainedTokenizerFast
from optimum.onnxruntime import ORTModelForSeq2SeqLM
from onnxruntime import SessionOptions
import torch

encoder_model_name = "cl-tohoku/bert-base-japanese-v2"
decoder_model_name = "skt/kogpt2-base-v2"

src_tokenizer = BertJapaneseTokenizer.from_pretrained(encoder_model_name)
trg_tokenizer = PreTrainedTokenizerFast.from_pretrained(decoder_model_name)

sess_options = SessionOptions()
sess_options.log_severity_level = 3 # mute warnings including CleanUnusedInitializersAndNodeArgs
# change subfolder to "onnxq" if you want to use the quantized model
model = ORTModelForSeq2SeqLM.from_pretrained("sappho192/ffxiv-ja-ko-translator",
        sess_options=sess_options, subfolder="onnx") 

texts = [
    "逃げろ!",  # Should be "도망쳐!"
    "初めまして.",  # "반가워요"
    "よろしくお願いします.",  # "잘 부탁드립니다."
    "ギルガメッシュ討伐戦",  # "길가메쉬 토벌전"
    "ギルガメッシュ討伐戦に行ってきます。一緒に行きましょうか？",  # "길가메쉬 토벌전에 갑니다. 같이 가실래요?"
    "夜になりました",  # "밤이 되었습니다"
    "ご飯を食べましょう."  # "음, 이제 식사도 해볼까요"
 ]


def translate(text_src):
    embeddings = src_tokenizer(text_src, return_attention_mask=False, return_token_type_ids=False, return_tensors='pt')
    print(f'Src tokens: {embeddings.data["input_ids"]}')
    embeddings = {k: v for k, v in embeddings.items()}

    output = model.generate(**embeddings, max_length=500)[0, 1:-1]
    print(f'Trg tokens: {output}')
    text_trg = trg_tokenizer.decode(output.cpu())
    return text_trg


for text in texts:
    print(translate(text))
    print()