IP-Adapter-FaceID開源圖像生成模型 - 憑人臉ID嵌入生成多樣風格圖像

首頁

IP Adapter FaceID

由h94開發

IP-Adapter-FaceID 是一個基於人臉識別的文本到圖像生成模型，能夠根據人臉ID嵌入生成各種風格的圖像。

圖像生成英語#人臉ID生成 #多風格適配 #肖像風格化

下載量 294.72k

發布時間 : 12/20/2023

模型概述

該模型使用來自人臉識別模型的人臉ID嵌入代替CLIP圖像嵌入，並結合LoRA提高ID一致性，能夠根據人臉僅通過文本提示生成多樣化的圖像。

模型特點

人臉ID嵌入

使用人臉識別模型提取的人臉ID嵌入，提高生成圖像中人臉的相似度

LoRA增強

結合LoRA技術進一步提高ID一致性

多版本支持

提供FaceID、FaceID-Plus、FaceID-PlusV2、FaceID-SDXL等多個版本，滿足不同需求

肖像生成

FaceID-Portrait版本支持無需LoRA和ControlNet的肖像生成

模型能力

文本到圖像生成

人臉特徵保持

多風格圖像生成

高分辨率圖像生成

使用案例

創意設計

個性化肖像生成

根據用戶提供的照片生成不同風格的肖像畫

生成具有高度相似性且風格多樣的肖像圖像

娛樂應用

角色扮演圖像生成

將用戶照片轉換為不同角色或風格的圖像

保持面部特徵的同時實現風格轉換

🚀 IP-Adapter-FaceID 模型卡片

IP-Adapter-FaceID 是一個基於文本到圖像生成的模型，它使用人臉識別模型的面部 ID 嵌入代替 CLIP 圖像嵌入，並結合 LoRA 技術提高身份一致性。該模型可以根據面部特徵和文本提示生成各種風格的圖像。

項目主頁 | 論文 (ArXiv) | 代碼

🚀 快速開始

模型簡介

IP-Adapter-FaceID 實驗版本使用人臉識別模型的面部 ID 嵌入代替 CLIP 圖像嵌入，並使用 LoRA 提高身份一致性。它可以僅根據文本提示，基於一張人臉生成各種風格的圖像。

結果示例

版本更新

2023/12/27 更新：IP-Adapter-FaceID-Plus，結合了面部 ID 嵌入（用於識別面部身份）和 CLIP 圖像嵌入（用於識別面部結構）。

![結果示例](./faceid-plus.jpg)

2023/12/28 更新：IP-Adapter-FaceID-PlusV2，結合了面部 ID 嵌入（用於識別面部身份）和可控的 CLIP 圖像嵌入（用於識別面部結構），可以調整面部結構的權重以獲得不同的生成效果。

![結果示例](./faceid_plusv2.jpg)

2024/01/04 更新：IP-Adapter-FaceID-SDXL，IP-Adapter-FaceID 的 SDXL 實驗版本。

![結果示例](./sdxl_faceid.jpg)

2024/01/17 更新：IP-Adapter-FaceID-PlusV2-SDXL，IP-Adapter-FaceID-PlusV2 的 SDXL 實驗版本。
2024/01/19 更新：IP-Adapter-FaceID-Portrait，與 IP-Adapter-FaceID 類似，但專門用於肖像生成（無 LoRA！無 ControlNet！）。它可以接受多張面部圖像以增強相似度（默認 5 張）。

![結果示例](./faceid_portrait_sd15.jpg)

💻 使用示例

基礎用法

IP-Adapter-FaceID

首先，使用 insightface 提取面部 ID 嵌入：

import cv2
from insightface.app import FaceAnalysis
import torch

app = FaceAnalysis(name="buffalo_l", providers=['CUDAExecutionProvider', 'CPUExecutionProvider'])
app.prepare(ctx_id=0, det_size=(640, 640))

image = cv2.imread("person.jpg")
faces = app.get(image)

faceid_embeds = torch.from_numpy(faces[0].normed_embedding).unsqueeze(0)

然後，根據面部嵌入生成圖像：

import torch
from diffusers import StableDiffusionPipeline, DDIMScheduler, AutoencoderKL
from PIL import Image

from ip_adapter.ip_adapter_faceid import IPAdapterFaceID

base_model_path = "SG161222/Realistic_Vision_V4.0_noVAE"
vae_model_path = "stabilityai/sd-vae-ft-mse"
ip_ckpt = "ip-adapter-faceid_sd15.bin"
device = "cuda"

noise_scheduler = DDIMScheduler(
    num_train_timesteps=1000,
    beta_start=0.00085,
    beta_end=0.012,
    beta_schedule="scaled_linear",
    clip_sample=False,
    set_alpha_to_one=False,
    steps_offset=1,
)
vae = AutoencoderKL.from_pretrained(vae_model_path).to(dtype=torch.float16)
pipe = StableDiffusionPipeline.from_pretrained(
    base_model_path,
    torch_dtype=torch.float16,
    scheduler=noise_scheduler,
    vae=vae,
    feature_extractor=None,
    safety_checker=None
)

# 加載 ip-adapter
ip_model = IPAdapterFaceID(pipe, ip_ckpt, device)

# 生成圖像
prompt = "photo of a woman in red dress in a garden"
negative_prompt = "monochrome, lowres, bad anatomy, worst quality, low quality, blurry"

images = ip_model.generate(
    prompt=prompt, negative_prompt=negative_prompt, faceid_embeds=faceid_embeds, num_samples=4, width=512, height=768, num_inference_steps=30, seed=2023
)

你也可以使用普通的 IP-Adapter 和 LoRA 加載模型：

import torch
from diffusers import StableDiffusionPipeline, DDIMScheduler, AutoencoderKL
from PIL import Image

from ip_adapter.ip_adapter_faceid_separate import IPAdapterFaceID

base_model_path = "SG161222/Realistic_Vision_V4.0_noVAE"
vae_model_path = "stabilityai/sd-vae-ft-mse"
ip_ckpt = "ip-adapter-faceid_sd15.bin"
lora_ckpt = "ip-adapter-faceid_sd15_lora.safetensors"
device = "cuda"

noise_scheduler = DDIMScheduler(
    num_train_timesteps=1000,
    beta_start=0.00085,
    beta_end=0.012,
    beta_schedule="scaled_linear",
    clip_sample=False,
    set_alpha_to_one=False,
    steps_offset=1,
)
vae = AutoencoderKL.from_pretrained(vae_model_path).to(dtype=torch.float16)
pipe = StableDiffusionPipeline.from_pretrained(
    base_model_path,
    torch_dtype=torch.float16,
    scheduler=noise_scheduler,
    vae=vae,
    feature_extractor=None,
    safety_checker=None
)

# 加載 lora 並融合
pipe.load_lora_weights(lora_ckpt)
pipe.fuse_lora()

# 加載 ip-adapter
ip_model = IPAdapterFaceID(pipe, ip_ckpt, device)

# 生成圖像
prompt = "photo of a woman in red dress in a garden"
negative_prompt = "monochrome, lowres, bad anatomy, worst quality, low quality, blurry"

images = ip_model.generate(
    prompt=prompt, negative_prompt=negative_prompt, faceid_embeds=faceid_embeds, num_samples=4, width=512, height=768, num_inference_steps=30, seed=2023
)

IP-Adapter-FaceID-SDXL

首先，使用 insightface 提取面部 ID 嵌入：

import cv2
from insightface.app import FaceAnalysis
import torch

app = FaceAnalysis(name="buffalo_l", providers=['CUDAExecutionProvider', 'CPUExecutionProvider'])
app.prepare(ctx_id=0, det_size=(640, 640))

image = cv2.imread("person.jpg")
faces = app.get(image)

faceid_embeds = torch.from_numpy(faces[0].normed_embedding).unsqueeze(0)

然後，根據面部嵌入生成圖像：

import torch
from diffusers import StableDiffusionXLPipeline, DDIMScheduler
from PIL import Image

from ip_adapter.ip_adapter_faceid import IPAdapterFaceIDXL

base_model_path = "SG161222/RealVisXL_V3.0"
ip_ckpt = "ip-adapter-faceid_sdxl.bin"
device = "cuda"

noise_scheduler = DDIMScheduler(
    num_train_timesteps=1000,
    beta_start=0.00085,
    beta_end=0.012,
    beta_schedule="scaled_linear",
    clip_sample=False,
    set_alpha_to_one=False,
    steps_offset=1,
)
pipe = StableDiffusionXLPipeline.from_pretrained(
    base_model_path,
    torch_dtype=torch.float16,
    scheduler=noise_scheduler,
    add_watermarker=False,
)

# 加載 ip-adapter
ip_model = IPAdapterFaceIDXL(pipe, ip_ckpt, device)

# 生成圖像
prompt = "A closeup shot of a beautiful Asian teenage girl in a white dress wearing small silver earrings in the garden, under the soft morning light"
negative_prompt = "monochrome, lowres, bad anatomy, worst quality, low quality, blurry"

images = ip_model.generate(
    prompt=prompt, negative_prompt=negative_prompt, faceid_embeds=faceid_embeds, num_samples=2,
    width=1024, height=1024,
    num_inference_steps=30, guidance_scale=7.5, seed=2023
)

IP-Adapter-FaceID-Plus

首先，使用 insightface 提取面部 ID 嵌入和麵部圖像：

import cv2
from insightface.app import FaceAnalysis
from insightface.utils import face_align
import torch

app = FaceAnalysis(name="buffalo_l", providers=['CUDAExecutionProvider', 'CPUExecutionProvider'])
app.prepare(ctx_id=0, det_size=(640, 640))

image = cv2.imread("person.jpg")
faces = app.get(image)

faceid_embeds = torch.from_numpy(faces[0].normed_embedding).unsqueeze(0)
face_image = face_align.norm_crop(image, landmark=faces[0].kps, image_size=224) # 你也可以分割面部

然後，根據面部嵌入生成圖像：

import torch
from diffusers import StableDiffusionPipeline, DDIMScheduler, AutoencoderKL
from PIL import Image

from ip_adapter.ip_adapter_faceid import IPAdapterFaceIDPlus

v2 = False
base_model_path = "SG161222/Realistic_Vision_V4.0_noVAE"
vae_model_path = "stabilityai/sd-vae-ft-mse"
image_encoder_path = "laion/CLIP-ViT-H-14-laion2B-s32B-b79K"
ip_ckpt = "ip-adapter-faceid-plus_sd15.bin" if not v2 else "ip-adapter-faceid-plusv2_sd15.bin"
device = "cuda"

noise_scheduler = DDIMScheduler(
    num_train_timesteps=1000,
    beta_start=0.00085,
    beta_end=0.012,
    beta_schedule="scaled_linear",
    clip_sample=False,
    set_alpha_to_one=False,
    steps_offset=1,
)
vae = AutoencoderKL.from_pretrained(vae_model_path).to(dtype=torch.float16)
pipe = StableDiffusionPipeline.from_pretrained(
    base_model_path,
    torch_dtype=torch.float16,
    scheduler=noise_scheduler,
    vae=vae,
    feature_extractor=None,
    safety_checker=None
)

# 加載 ip-adapter
ip_model = IPAdapterFaceIDPlus(pipe, image_encoder_path, ip_ckpt, device)

# 生成圖像
prompt = "photo of a woman in red dress in a garden"
negative_prompt = "monochrome, lowres, bad anatomy, worst quality, low quality, blurry"

images = ip_model.generate(
     prompt=prompt, negative_prompt=negative_prompt, face_image=face_image, faceid_embeds=faceid_embeds, shortcut=v2, s_scale=1.0,
     num_samples=4, width=512, height=768, num_inference_steps=30, seed=2023
)

IP-Adapter-FaceID-Portrait

import cv2
from insightface.app import FaceAnalysis
import torch

app = FaceAnalysis(name="buffalo_l", providers=['CUDAExecutionProvider', 'CPUExecutionProvider'])
app.prepare(ctx_id=0, det_size=(640, 640))

images = ["1.jpg", "2.jpg", "3.jpg", "4.jpg", "5.jpg"]

faceid_embeds = []
for image in images:
    image = cv2.imread("person.jpg")
    faces = app.get(image)
    faceid_embeds.append(torch.from_numpy(faces[0].normed_embedding).unsqueeze(0).unsqueeze(0))
faceid_embeds = torch.cat(faceid_embeds, dim=1)

import torch
from diffusers import StableDiffusionPipeline, DDIMScheduler, AutoencoderKL
from PIL import Image

from ip_adapter.ip_adapter_faceid_separate import IPAdapterFaceID

base_model_path = "SG161222/Realistic_Vision_V4.0_noVAE"
vae_model_path = "stabilityai/sd-vae-ft-mse"
ip_ckpt = "ip-adapter-faceid-portrait_sd15.bin"
device = "cuda"

noise_scheduler = DDIMScheduler(
    num_train_timesteps=1000,
    beta_start=0.00085,
    beta_end=0.012,
    beta_schedule="scaled_linear",
    clip_sample=False,
    set_alpha_to_one=False,
    steps_offset=1,
)
vae = AutoencoderKL.from_pretrained(vae_model_path).to(dtype=torch.float16)
pipe = StableDiffusionPipeline.from_pretrained(
    base_model_path,
    torch_dtype=torch.float16,
    scheduler=noise_scheduler,
    vae=vae,
    feature_extractor=None,
    safety_checker=None
)

# 加載 ip-adapter
ip_model = IPAdapterFaceID(pipe, ip_ckpt, device, num_tokens=16, n_cond=5)

# 生成圖像
prompt = "photo of a woman in red dress in a garden"
negative_prompt = "monochrome, lowres, bad anatomy, worst quality, low quality, blurry"

images = ip_model.generate(
    prompt=prompt, negative_prompt=negative_prompt, faceid_embeds=faceid_embeds, num_samples=4, width=512, height=512, num_inference_steps=30, seed=2023
)