ffxiv-ja-ko-translatorオープンソース翻訳モデル - 無料で『ファイナルファンタジーXIV』の日本語から韓国語への翻訳を実現

ホーム

Ffxiv Ja Ko Translator

sappho192によって開発

『ファイナルファンタジー14』ゲーム内の日本語テキストを韓国語に翻訳するための専用翻訳モデル

機械翻訳

Transformers

複数言語対応オープンソースライセンス:MIT #ゲーム専用翻訳 #日韓バイリンガル変換 #BERT-GPTアーキテクチャ

ダウンロード数 40

リリース時間 : 4/3/2023

モデル概要

このモデルはTransformerアーキテクチャに基づいており、『ファイナルファンタジー14』ゲーム内の日本語から韓国語への翻訳タスクに特化して最適化されています。ゲーム内の固有名詞や頻出フレーズを正確に翻訳できます。

モデル特徴

ゲーム専用翻訳

『ファイナルファンタジー14』のゲーム内容に特化して最適化されており、ゲーム内の固有名詞や専門用語を正確に翻訳できます

Transformerアーキテクチャベース

BERT-japaneseをエンコーダー、KoGPT2をデコーダーとして使用し、高品質な翻訳効果を実現

マルチプラットフォーム対応

PyTorchとONNXの2形式のモデルを提供し、様々な展開環境をサポート

モデル能力

日本語から韓国語へのテキスト翻訳

ゲーム用語の正確な翻訳

短文と段落の翻訳

使用事例

ゲームローカライゼーション

ゲーム内テキスト翻訳

『ファイナルファンタジー14』ゲーム内の日本語インターフェース、クエストテキストなどを韓国語に翻訳

'ギルガメッシュ討伐戦'を'길가메쉬 토벌전'などゲーム固有の用語を正確に翻訳

プレイヤー間コミュニケーション支援

日本語プレイヤーと韓国語プレイヤー間のコミュニケーションを支援

'一緒に行きましょうか？'を'같이 가실래요?'など一般的なゲーム交流用語を翻訳可能

🚀 ファイナルファンタジーXIV 日本語→韓国語翻訳ツール

このプロジェクトは、ファイナルファンタジーXIVの日本語テキストを韓国語に翻訳するためのツールです。特定のデータセットを使用して訓練され、高精度な翻訳を提供します。

🚀 クイックスタート

このプロジェクトの詳細はGithubリポジトリに記載されています。

📺 デモ

デモを試すにはここをクリック ONNXモデルを使用したWindowsアプリのデモを確認

💻 使用例

基本的な使用法

推論 (PyTorch)

from transformers import(
    EncoderDecoderModel,
    PreTrainedTokenizerFast,
    BertJapaneseTokenizer,
)

import torch

encoder_model_name = "cl-tohoku/bert-base-japanese-v2"
decoder_model_name = "skt/kogpt2-base-v2"

src_tokenizer = BertJapaneseTokenizer.from_pretrained(encoder_model_name)
trg_tokenizer = PreTrainedTokenizerFast.from_pretrained(decoder_model_name)

# You should change following `./best_model` to the path of model **directory**
model = EncoderDecoderModel.from_pretrained("./best_model")

text = "ギルガメッシュ討伐戦"
# text = "ギルガメッシュ討伐戦に行ってきます。一緒に行きましょうか？"

def translate(text_src):
    embeddings = src_tokenizer(text_src, return_attention_mask=False, return_token_type_ids=False, return_tensors='pt')
    embeddings = {k: v for k, v in embeddings.items()}
    output = model.generate(**embeddings, max_length=500)[0, 1:-1]
    text_trg = trg_tokenizer.decode(output.cpu())
    return text_trg

print(translate(text))

推論 (Optimum.OnnxRuntime)

現在のOptimum.OnnxRuntimeは、バックエンドにPyTorchが必要です。[Issue] [ONNX] または [量子化ONNX] モデルのどちらかを使用できます。

from transformers import BertJapaneseTokenizer,PreTrainedTokenizerFast
from optimum.onnxruntime import ORTModelForSeq2SeqLM
from onnxruntime import SessionOptions
import torch

encoder_model_name = "cl-tohoku/bert-base-japanese-v2"
decoder_model_name = "skt/kogpt2-base-v2"

src_tokenizer = BertJapaneseTokenizer.from_pretrained(encoder_model_name)
trg_tokenizer = PreTrainedTokenizerFast.from_pretrained(decoder_model_name)

sess_options = SessionOptions()
sess_options.log_severity_level = 3 # mute warnings including CleanUnusedInitializersAndNodeArgs
# change subfolder to "onnxq" if you want to use the quantized model
model = ORTModelForSeq2SeqLM.from_pretrained("sappho192/ffxiv-ja-ko-translator",
        sess_options=sess_options, subfolder="onnx") 

texts = [
    "逃げろ!",  # Should be "도망쳐!"
    "初めまして.",  # "반가워요"
    "よろしくお願いします.",  # "잘 부탁드립니다."
    "ギルガメッシュ討伐戦",  # "길가메쉬 토벌전"
    "ギルガメッシュ討伐戦に行ってきます。一緒に行きましょうか？",  # "길가메쉬 토벌전에 갑니다. 같이 가실래요?"
    "夜になりました",  # "밤이 되었습니다"
    "ご飯を食べましょう."  # "음, 이제 식사도 해볼까요"
 ]


def translate(text_src):
    embeddings = src_tokenizer(text_src, return_attention_mask=False, return_token_type_ids=False, return_tensors='pt')
    print(f'Src tokens: {embeddings.data["input_ids"]}')
    embeddings = {k: v for k, v in embeddings.items()}

    output = model.generate(**embeddings, max_length=500)[0, 1:-1]
    print(f'Trg tokens: {output}')
    text_trg = trg_tokenizer.decode(output.cpu())
    return text_trg


for text in texts:
    print(translate(text))
    print()

高度な使用法

トレーニング

トレーニングに関する詳細は training.ipynb を確認してください。

📄 ライセンス

このプロジェクトはMITライセンスの下で公開されています。

📋 詳細情報

属性	详情
モデルタイプ	翻訳モデル
訓練データ	Helsinki-NLP/tatoeba_mt、sappho192/Tatoeba-Challenge-jpn-kor
対応言語	日本語、韓国語
パイプラインタグ	翻訳
タグ	python、transformer、pytorch
推論	無効