モデル選定

INT8量子化推論

# INT8量子化推論

Gte Multilingual Reranker Base Onnx Op14 Opt Gpu Int8

これはAlibaba-NLP/gte-multilingual-reranker-baseの量子化ONNXバージョンで、INT8量子化を採用し、GPU向けに最適化されており、テキスト分類タスクに適しています。

テキスト埋め込みその他

Qwen2.5 VL 3B Instruct Quantized.w8a8

Qwen/Qwen2.5-VL-3B-Instructの量子化バージョンで、視覚-テキスト入力とテキスト出力をサポートし、重みをINT8、活性化をINT8に量子化しています。

画像生成テキスト

Transformers 英語

Deepseek R1 Distill Qwen 32B Quantized.w8a8

DeepSeek-R1-Distill-Qwen-32Bの量子化バージョン。INT8の重み量子化と活性化量子化により、メモリ要件を削減し、計算効率を向上させます。

大規模言語モデル

おすすめAIモデル

Llama 3 Typhoon V1.5x 8b Instruct

タイ語専用に設計された80億パラメータの命令モデルで、GPT-3.5-turboに匹敵する性能を持ち、アプリケーションシナリオ、検索拡張生成、制限付き生成、推論タスクを最適化

大規模言語モデル

Transformers 複数言語対応

Cadet-TinyはSODAデータセットでトレーニングされた超小型対話モデルで、エッジデバイス推論向けに設計されており、体積はCosmo-3Bモデルの約2％です。

対話システム

Transformers 英語

Roberta Base Chinese Extractive Qa

RoBERTaアーキテクチャに基づく中国語抽出型QAモデルで、与えられたテキストから回答を抽出するタスクに適しています。

質問応答システム中国語

AIbase

未来を切り開く、あなたのAIソリューション知識ベース

English 简体中文繁體中文にほんご

© 2025AIbase