ffxiv-ja-ko-translator開源翻譯模型 - 免費實現《最終幻想14》日語到韓語翻譯

首頁

Ffxiv Ja Ko Translator

由sappho192開發

一個專門用於將《最終幻想14》遊戲中的日語文本翻譯成韓語的翻譯模型

機器翻譯

Transformers

支持多種語言開源協議:MIT #遊戲專用翻譯 #日韓雙語轉換 #BERT-GPT架構

下載量 40

發布時間 : 4/3/2023

模型概述

該模型基於Transformer架構，專門針對《最終幻想14》遊戲中的日語到韓語翻譯任務進行了優化，能夠準確翻譯遊戲中的專有名詞和常用短語。

模型特點

遊戲專用翻譯

專門針對《最終幻想14》遊戲內容優化，能準確翻譯遊戲中的專有名詞和術語

基於Transformer架構

使用BERT-japanese作為編碼器，KoGPT2作為解碼器，實現高質量的翻譯效果

多平臺支持

提供PyTorch和ONNX兩種格式的模型，支持不同部署環境

模型能力

日語到韓語文本翻譯

遊戲術語準確翻譯

短句和段落翻譯

使用案例

遊戲本地化

遊戲內文本翻譯

將《最終幻想14》遊戲中的日語界面、任務文本等翻譯成韓語

準確翻譯如'ギルガメッシュ討伐戦'為'길가메쉬 토벌전'等遊戲專有名詞

玩家交流輔助

幫助日語玩家與韓語玩家之間的交流

可翻譯常見遊戲交流用語如'一緒に行きましょうか？'為'같이 가실래요?'

🚀 最終幻想XIV日語到韓語翻譯器

本項目是一個用於最終幻想XIV的日語到韓語的翻譯器，藉助Transformer架構實現高效準確的翻譯，為玩家提供更好的遊戲體驗。

🚀 快速開始

本項目的詳細信息可在 Github倉庫中查看。

演示

💻 使用示例

基礎用法

推理（PyTorch）

from transformers import(
    EncoderDecoderModel,
    PreTrainedTokenizerFast,
    BertJapaneseTokenizer,
)

import torch

encoder_model_name = "cl-tohoku/bert-base-japanese-v2"
decoder_model_name = "skt/kogpt2-base-v2"

src_tokenizer = BertJapaneseTokenizer.from_pretrained(encoder_model_name)
trg_tokenizer = PreTrainedTokenizerFast.from_pretrained(decoder_model_name)

# You should change following `./best_model` to the path of model **directory**
model = EncoderDecoderModel.from_pretrained("./best_model")

text = "ギルガメッシュ討伐戦"
# text = "ギルガメッシュ討伐戦に行ってきます。一緒に行きましょうか？"

def translate(text_src):
    embeddings = src_tokenizer(text_src, return_attention_mask=False, return_token_type_ids=False, return_tensors='pt')
    embeddings = {k: v for k, v in embeddings.items()}
    output = model.generate(**embeddings, max_length=500)[0, 1:-1]
    text_trg = trg_tokenizer.decode(output.cpu())
    return text_trg

print(translate(text))

高級用法

推理（Optimum.OnnxRuntime）

注意，當前的Optimum.OnnxRuntime仍然需要PyTorch作為後端。[問題] 你可以使用 [ONNX] 或 [量化ONNX] 模型。

from transformers import BertJapaneseTokenizer,PreTrainedTokenizerFast
from optimum.onnxruntime import ORTModelForSeq2SeqLM
from onnxruntime import SessionOptions
import torch

encoder_model_name = "cl-tohoku/bert-base-japanese-v2"
decoder_model_name = "skt/kogpt2-base-v2"

src_tokenizer = BertJapaneseTokenizer.from_pretrained(encoder_model_name)
trg_tokenizer = PreTrainedTokenizerFast.from_pretrained(decoder_model_name)

sess_options = SessionOptions()
sess_options.log_severity_level = 3 # mute warnings including CleanUnusedInitializersAndNodeArgs
# change subfolder to "onnxq" if you want to use the quantized model
model = ORTModelForSeq2SeqLM.from_pretrained("sappho192/ffxiv-ja-ko-translator",
        sess_options=sess_options, subfolder="onnx") 

texts = [
    "逃げろ!",  # Should be "도망쳐!"
    "初めまして.",  # "반가워요"
    "よろしくお願いします.",  # "잘 부탁드립니다."
    "ギルガメッシュ討伐戦",  # "길가메쉬 토벌전"
    "ギルガメッシュ討伐戦に行ってきます。一緒に行きましょうか？",  # "길가메쉬 토벌전에 갑니다. 같이 가실래요?"
    "夜になりました",  # "밤이 되었습니다"
    "ご飯を食べましょう."  # "음, 이제 식사도 해볼까요"
 ]


def translate(text_src):
    embeddings = src_tokenizer(text_src, return_attention_mask=False, return_token_type_ids=False, return_tensors='pt')
    print(f'Src tokens: {embeddings.data["input_ids"]}')
    embeddings = {k: v for k, v in embeddings.items()}

    output = model.generate(**embeddings, max_length=500)[0, 1:-1]
    print(f'Trg tokens: {output}')
    text_trg = trg_tokenizer.decode(output.cpu())
    return text_trg


for text in texts:
    print(translate(text))
    print()