Meta-Llama-3.1-8B-Instruct-AWQ-INT4オープンソースモデル - 多言語対話をサポートし、無料でデプロイ可能

ホーム

Meta Llama 3.1 8B Instruct AWQ INT4

hugging-quantsによって開発

Llama 3.1 8B InstructのINT4量子化バージョンで、AutoAWQツールを使用して量子化されており、多言語対話シナリオに適しています。

大規模言語モデル

Transformers

複数言語対応#多言語対話 #INT4量子化 #低VRAM推論

ダウンロード数 348.23k

リリース時間 : 7/19/2024

モデル概要

これは命令調整された多言語大規模言語モデルで、対話シナリオ向けに最適化されており、8つの言語をサポートします。量子化バージョンはハードウェア要件を低減しつつ、良好な性能を維持します。

モデル特徴

多言語サポート

8つの言語のテキスト生成と対話をサポート

効率的な量子化

AWQ技術を使用してINT4量子化を実現し、VRAM要件を低減

対話最適化

特にマルチターン対話シナリオ向けに命令調整

モデル能力

多言語テキスト生成

対話システム

命令追従

知識質問応答

使用事例

スマートアシスタント

多言語カスタマーサービスボット

複数言語をサポートする自動カスタマーサービスシステムの構築

スムーズな多言語カスタマーサービスを提供可能

教育

言語学習アシスタント

学習者が異なる言語で会話を練習するのを支援

自然な多言語インタラクション体験を提供

🚀 Meta Llama 3.1 8B Instruct AWQ-INT4 モデル

このリポジトリは、Meta AIによってリリースされたBF16半精度の公式バージョンである元のモデルmeta-llama/Meta-Llama-3.1-8B-Instructのコミュニティ主導の量子化バージョンです。Meta Llama 3.1は、複数言語に対応した大規模言語モデルで、多言語対話ユースケースに最適化されており、多くのオープンソースおよびクローズドチャットモデルを上回る性能を発揮します。

🚀 クイックスタート

このセクションでは、Meta Llama 3.1 8B Instruct AWQ-INT4モデルの基本的な使い方を紹介します。

✨ 主な機能

多言語対応：英語、ドイツ語、フランス語、イタリア語、ポルトガル語、ヒンディー語、スペイン語、タイ語など、複数の言語に対応しています。
量子化：AutoAWQを使用してFP16からINT4に量子化されており、VRAMの使用量を削減します。
多様な使用方法：transformers、autoawq、text-generation-inference、vLLMなどの異なるソリューションで使用できます。

📦 インストール

🤗 Transformersを使用する場合

pip install -q --upgrade transformers autoawq accelerate

AutoAWQを使用する場合

pip install -q --upgrade transformers autoawq accelerate

🤗 Text Generation Inference (TGI)を使用する場合

pip install -q --upgrade huggingface_hub
huggingface-cli login

vLLMを使用する場合

Dockerをインストールする必要があります（インストール手順を参照）。

💻 使用例

🤗 Transformers

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer, AwqConfig

model_id = "hugging-quants/Meta-Llama-3.1-8B-Instruct-AWQ-INT4"

quantization_config = AwqConfig(
    bits=4,
    fuse_max_seq_len=512, # Note: Update this as per your use-case
    do_fuse=True,
)

tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
  model_id,
  torch_dtype=torch.float16,
  low_cpu_mem_usage=True,
  device_map="auto",
  quantization_config=quantization_config
)

prompt = [
  {"role": "system", "content": "You are a helpful assistant, that responds as a pirate."},
  {"role": "user", "content": "What's Deep Learning?"},
]
inputs = tokenizer.apply_chat_template(
  prompt,
  tokenize=True,
  add_generation_prompt=True,
  return_tensors="pt",
  return_dict=True,
).to("cuda")

outputs = model.generate(**inputs, do_sample=True, max_new_tokens=256)
print(tokenizer.batch_decode(outputs[:, inputs['input_ids'].shape[1]:], skip_special_tokens=True)[0])

AutoAWQ

import torch
from awq import AutoAWQForCausalLM
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "hugging-quants/Meta-Llama-3.1-8B-Instruct-AWQ-INT4"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoAWQForCausalLM.from_pretrained(
  model_id,
  torch_dtype=torch.float16,
  low_cpu_mem_usage=True,
  device_map="auto",
)

prompt = [
  {"role": "system", "content": "You are a helpful assistant, that responds as a pirate."},
  {"role": "user", "content": "What's Deep Learning?"},
]
inputs = tokenizer.apply_chat_template(
  prompt,
  tokenize=True,
  add_generation_prompt=True,
  return_tensors="pt",
  return_dict=True,
).to("cuda")

outputs = model.generate(**inputs, do_sample=True, max_new_tokens=256)
print(tokenizer.batch_decode(outputs[:, inputs['input_ids'].shape[1]:], skip_special_tokens=True)[0])

🤗 Text Generation Inference (TGI)

docker run --gpus all --shm-size 1g -ti -p 8080:80 \
  -v hf_cache:/data \
  -e MODEL_ID=hugging-quants/Meta-Llama-3.1-8B-Instruct-AWQ-INT4 \
  -e QUANTIZE=awq \
  -e HF_TOKEN=$(cat ~/.cache/huggingface/token) \
  -e MAX_INPUT_LENGTH=4000 \
  -e MAX_TOTAL_TOKENS=4096 \
  ghcr.io/huggingface/text-generation-inference:2.2.0

curl 0.0.0.0:8080/v1/chat/completions \
  -X POST \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "tgi",
    "messages": [
      {
        "role": "system",
        "content": "You are a helpful assistant."
      },
      {
        "role": "user",
        "content": "What is Deep Learning?"
      }
    ],
    "max_tokens": 128
  }'

import os
from huggingface_hub import InferenceClient

client = InferenceClient(base_url="http://0.0.0.0:8080", api_key=os.getenv("HF_TOKEN", "-"))

chat_completion = client.chat.completions.create(
  model="hugging-quants/Meta-Llama-3.1-8B-Instruct-AWQ-INT4",
  messages=[
    {"role": "system", "content": "You are a helpful assistant."},
    {"role": "user", "content": "What is Deep Learning?"},
  ],
  max_tokens=128,
)

import os
from openai import OpenAI

client = OpenAI(base_url="http://0.0.0.0:8080/v1", api_key=os.getenv("OPENAI_API_KEY", "-"))

chat_completion = client.chat.completions.create(
  model="tgi",
  messages=[
    {"role": "system", "content": "You are a helpful assistant."},
    {"role": "user", "content": "What is Deep Learning?"},
  ],
  max_tokens=128,
)

vLLM

docker run --runtime nvidia --gpus all --ipc=host -p 8000:8000 \
  -v hf_cache:/root/.cache/huggingface \
  vllm/vllm-openai:latest \
  --model hugging-quants/Meta-Llama-3.1-8B-Instruct-AWQ-INT4 \
  --max-model-len 4096

curl 0.0.0.0:8000/v1/chat/completions \
  -X POST \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "hugging-quants/Meta-Llama-3.1-8B-Instruct-AWQ-INT4",
    "messages": [
      {
        "role": "system",
        "content": "You are a helpful assistant."
      },
      {
        "role": "user",
        "content": "What is Deep Learning?"
      }
    ],
    "max_tokens": 128
  }'

import os
from openai import OpenAI

client = OpenAI(base_url="http://0.0.0.0:8000/v1", api_key=os.getenv("VLLM_API_KEY", "-"))

chat_completion = client.chat.completions.create(
  model="hugging-quants/Meta-Llama-3.1-8B-Instruct-AWQ-INT4",
  messages=[
    {"role": "system", "content": "You are a helpful assistant."},
    {"role": "user", "content": "What is Deep Learning?"},
  ],
  max_tokens=128,
)

🔧 技術詳細

量子化の再現

pip install -q --upgrade transformers autoawq accelerate

from awq import AutoAWQForCausalLM
from transformers import AutoTokenizer

model_path = "meta-llama/Meta-Llama-3.1-8B-Instruct"
quant_path = "hugging-quants/Meta-Llama-3.1-8B-Instruct-AWQ-INT4"
quant_config = {
  "zero_point": True,
  "q_group_size": 128,
  "w_bit": 4,
  "version": "GEMM",
}

# Load model
model = AutoAWQForCausalLM.from_pretrained(
  model_path, low_cpu_mem_usage=True, use_cache=False,
)
tokenizer = AutoTokenizer.from_pretrained(model_path)

# Quantize
model.quantize(tokenizer, quant_config=quant_config)

# Save quantized model
model.save_quantized(quant_path)
tokenizer.save_pretrained(quant_path)

print(f'Model is quantized and saved at "{quant_path}"')