qwen1.5-moe-tiny-random開源文本生成模型 - 免費用於各類文本創作任務

首頁

Qwen1.5 Moe Tiny Random

由yujiepan開發

這是一個基於Qwen1.5-MoE架構的隨機初始化小型模型，採用float16精度，適用於文本生成任務。

大型語言模型

Transformers

#小規模MoE架構 #float16精度 #滑動窗口注意力

下載量 30

發布時間 : 3/30/2024

模型概述

該模型是基於Qwen/Qwen1.5-MoE-A2.7B-Chat配置但規模更小的隨機初始化版本，主要用於文本生成任務。

模型特點

小型化設計

基於Qwen1.5-MoE架構但規模更小，適合資源有限的環境。

float16精度

採用float16精度，平衡計算效率和模型性能。

滑動窗口支持

配置了滑動窗口(max_window_layers=1)以優化長文本處理。

模型能力

文本生成

對話系統

使用案例

對話系統

簡單對話

可用於構建簡單的對話機器人

文本生成

短文本生成

生成簡短的文本內容

🚀 變換器（transformers）庫項目

本項目基於變換器（transformers）庫，利用特定配置隨機初始化了一個文本生成模型。該模型參考了 Qwen/Qwen1.5-MoE-A2.7B-Chat 的配置，但規模更小。

🚀 快速開始

本模型是隨機初始化的，使用了 Qwen/Qwen1.5-MoE-A2.7B-Chat 的配置，但模型規模更小。請注意，該模型採用的是 float16 數據類型。

💻 使用示例

基礎用法

import transformers
import torch
import os
from huggingface_hub import create_repo, upload_folder

source_model_id = 'Qwen/Qwen1.5-MoE-A2.7B-Chat'
save_path = '/tmp/yujiepan/qwen1.5-moe-tiny-random'
repo_id = 'yujiepan/qwen1.5-moe-tiny-random'

config = transformers.AutoConfig.from_pretrained(
    source_model_id, trust_remote_code=True)
config.hidden_size = 4
config.intermediate_size = 2
config.num_attention_heads = 4
config.num_hidden_layers = 2
config.num_key_value_heads = 2
config.moe_intermediate_size = 2
config.shared_expert_intermediate_size = 2
config.max_window_layers = 1
config.use_sliding_window = True
config.torch_dtype = torch.float16

model = transformers.AutoModelForCausalLM.from_config(
    config, trust_remote_code=True, torch_dtype=torch.float16)
model = model.half()

tokenizer = transformers.AutoTokenizer.from_pretrained(
    source_model_id, trust_remote_code=True)

result = transformers.pipelines.pipeline(
    'text-generation',
    model=model, tokenizer=tokenizer,
    device=0,
    max_new_tokens=16,
)('Hello World!')
print(result)

model.save_pretrained(save_path)
tokenizer.save_pretrained(save_path)

os.system(f'ls -alh {save_path}')
create_repo(repo_id, exist_ok=True)
upload_folder(repo_id=repo_id, folder_path=save_path)