IP-Adapter-FaceID开源图像生成模型 - 凭人脸ID嵌入生成多样风格图像

首页

IP Adapter FaceID

由 h94 开发

IP-Adapter-FaceID 是一个基于人脸识别的文本到图像生成模型，能够根据人脸ID嵌入生成各种风格的图像。

图像生成英语#人脸ID生成 #多风格适配 #肖像风格化

下载量 294.72k

发布时间 : 12/20/2023

模型简介

该模型使用来自人脸识别模型的人脸ID嵌入代替CLIP图像嵌入，并结合LoRA提高ID一致性，能够根据人脸仅通过文本提示生成多样化的图像。

模型特点

人脸ID嵌入

使用人脸识别模型提取的人脸ID嵌入，提高生成图像中人脸的相似度

LoRA增强

结合LoRA技术进一步提高ID一致性

多版本支持

提供FaceID、FaceID-Plus、FaceID-PlusV2、FaceID-SDXL等多个版本，满足不同需求

肖像生成

FaceID-Portrait版本支持无需LoRA和ControlNet的肖像生成

模型能力

文本到图像生成

人脸特征保持

多风格图像生成

高分辨率图像生成

使用案例

创意设计

个性化肖像生成

根据用户提供的照片生成不同风格的肖像画

生成具有高度相似性且风格多样的肖像图像

娱乐应用

角色扮演图像生成

将用户照片转换为不同角色或风格的图像

保持面部特征的同时实现风格转换

🚀 IP-Adapter-FaceID 模型卡片

IP-Adapter-FaceID 是一个基于文本到图像生成的模型，它使用人脸识别模型的面部 ID 嵌入代替 CLIP 图像嵌入，并结合 LoRA 技术提高身份一致性。该模型可以根据面部特征和文本提示生成各种风格的图像。

项目主页 | 论文 (ArXiv) | 代码

🚀 快速开始

模型简介

IP-Adapter-FaceID 实验版本使用人脸识别模型的面部 ID 嵌入代替 CLIP 图像嵌入，并使用 LoRA 提高身份一致性。它可以仅根据文本提示，基于一张人脸生成各种风格的图像。

结果示例

版本更新

2023/12/27 更新：IP-Adapter-FaceID-Plus，结合了面部 ID 嵌入（用于识别面部身份）和 CLIP 图像嵌入（用于识别面部结构）。

![结果示例](./faceid-plus.jpg)

2023/12/28 更新：IP-Adapter-FaceID-PlusV2，结合了面部 ID 嵌入（用于识别面部身份）和可控的 CLIP 图像嵌入（用于识别面部结构），可以调整面部结构的权重以获得不同的生成效果。

![结果示例](./faceid_plusv2.jpg)

2024/01/04 更新：IP-Adapter-FaceID-SDXL，IP-Adapter-FaceID 的 SDXL 实验版本。

![结果示例](./sdxl_faceid.jpg)

2024/01/17 更新：IP-Adapter-FaceID-PlusV2-SDXL，IP-Adapter-FaceID-PlusV2 的 SDXL 实验版本。
2024/01/19 更新：IP-Adapter-FaceID-Portrait，与 IP-Adapter-FaceID 类似，但专门用于肖像生成（无 LoRA！无 ControlNet！）。它可以接受多张面部图像以增强相似度（默认 5 张）。

![结果示例](./faceid_portrait_sd15.jpg)

💻 使用示例

基础用法

IP-Adapter-FaceID

首先，使用 insightface 提取面部 ID 嵌入：

import cv2
from insightface.app import FaceAnalysis
import torch

app = FaceAnalysis(name="buffalo_l", providers=['CUDAExecutionProvider', 'CPUExecutionProvider'])
app.prepare(ctx_id=0, det_size=(640, 640))

image = cv2.imread("person.jpg")
faces = app.get(image)

faceid_embeds = torch.from_numpy(faces[0].normed_embedding).unsqueeze(0)

然后，根据面部嵌入生成图像：

import torch
from diffusers import StableDiffusionPipeline, DDIMScheduler, AutoencoderKL
from PIL import Image

from ip_adapter.ip_adapter_faceid import IPAdapterFaceID

base_model_path = "SG161222/Realistic_Vision_V4.0_noVAE"
vae_model_path = "stabilityai/sd-vae-ft-mse"
ip_ckpt = "ip-adapter-faceid_sd15.bin"
device = "cuda"

noise_scheduler = DDIMScheduler(
    num_train_timesteps=1000,
    beta_start=0.00085,
    beta_end=0.012,
    beta_schedule="scaled_linear",
    clip_sample=False,
    set_alpha_to_one=False,
    steps_offset=1,
)
vae = AutoencoderKL.from_pretrained(vae_model_path).to(dtype=torch.float16)
pipe = StableDiffusionPipeline.from_pretrained(
    base_model_path,
    torch_dtype=torch.float16,
    scheduler=noise_scheduler,
    vae=vae,
    feature_extractor=None,
    safety_checker=None
)

# 加载 ip-adapter
ip_model = IPAdapterFaceID(pipe, ip_ckpt, device)

# 生成图像
prompt = "photo of a woman in red dress in a garden"
negative_prompt = "monochrome, lowres, bad anatomy, worst quality, low quality, blurry"

images = ip_model.generate(
    prompt=prompt, negative_prompt=negative_prompt, faceid_embeds=faceid_embeds, num_samples=4, width=512, height=768, num_inference_steps=30, seed=2023
)

你也可以使用普通的 IP-Adapter 和 LoRA 加载模型：

import torch
from diffusers import StableDiffusionPipeline, DDIMScheduler, AutoencoderKL
from PIL import Image

from ip_adapter.ip_adapter_faceid_separate import IPAdapterFaceID

base_model_path = "SG161222/Realistic_Vision_V4.0_noVAE"
vae_model_path = "stabilityai/sd-vae-ft-mse"
ip_ckpt = "ip-adapter-faceid_sd15.bin"
lora_ckpt = "ip-adapter-faceid_sd15_lora.safetensors"
device = "cuda"

noise_scheduler = DDIMScheduler(
    num_train_timesteps=1000,
    beta_start=0.00085,
    beta_end=0.012,
    beta_schedule="scaled_linear",
    clip_sample=False,
    set_alpha_to_one=False,
    steps_offset=1,
)
vae = AutoencoderKL.from_pretrained(vae_model_path).to(dtype=torch.float16)
pipe = StableDiffusionPipeline.from_pretrained(
    base_model_path,
    torch_dtype=torch.float16,
    scheduler=noise_scheduler,
    vae=vae,
    feature_extractor=None,
    safety_checker=None
)

# 加载 lora 并融合
pipe.load_lora_weights(lora_ckpt)
pipe.fuse_lora()

# 加载 ip-adapter
ip_model = IPAdapterFaceID(pipe, ip_ckpt, device)

# 生成图像
prompt = "photo of a woman in red dress in a garden"
negative_prompt = "monochrome, lowres, bad anatomy, worst quality, low quality, blurry"

images = ip_model.generate(
    prompt=prompt, negative_prompt=negative_prompt, faceid_embeds=faceid_embeds, num_samples=4, width=512, height=768, num_inference_steps=30, seed=2023
)

IP-Adapter-FaceID-SDXL

首先，使用 insightface 提取面部 ID 嵌入：

import cv2
from insightface.app import FaceAnalysis
import torch

app = FaceAnalysis(name="buffalo_l", providers=['CUDAExecutionProvider', 'CPUExecutionProvider'])
app.prepare(ctx_id=0, det_size=(640, 640))

image = cv2.imread("person.jpg")
faces = app.get(image)

faceid_embeds = torch.from_numpy(faces[0].normed_embedding).unsqueeze(0)

然后，根据面部嵌入生成图像：

import torch
from diffusers import StableDiffusionXLPipeline, DDIMScheduler
from PIL import Image

from ip_adapter.ip_adapter_faceid import IPAdapterFaceIDXL

base_model_path = "SG161222/RealVisXL_V3.0"
ip_ckpt = "ip-adapter-faceid_sdxl.bin"
device = "cuda"

noise_scheduler = DDIMScheduler(
    num_train_timesteps=1000,
    beta_start=0.00085,
    beta_end=0.012,
    beta_schedule="scaled_linear",
    clip_sample=False,
    set_alpha_to_one=False,
    steps_offset=1,
)
pipe = StableDiffusionXLPipeline.from_pretrained(
    base_model_path,
    torch_dtype=torch.float16,
    scheduler=noise_scheduler,
    add_watermarker=False,
)

# 加载 ip-adapter
ip_model = IPAdapterFaceIDXL(pipe, ip_ckpt, device)

# 生成图像
prompt = "A closeup shot of a beautiful Asian teenage girl in a white dress wearing small silver earrings in the garden, under the soft morning light"
negative_prompt = "monochrome, lowres, bad anatomy, worst quality, low quality, blurry"

images = ip_model.generate(
    prompt=prompt, negative_prompt=negative_prompt, faceid_embeds=faceid_embeds, num_samples=2,
    width=1024, height=1024,
    num_inference_steps=30, guidance_scale=7.5, seed=2023
)

IP-Adapter-FaceID-Plus

首先，使用 insightface 提取面部 ID 嵌入和面部图像：

import cv2
from insightface.app import FaceAnalysis
from insightface.utils import face_align
import torch

app = FaceAnalysis(name="buffalo_l", providers=['CUDAExecutionProvider', 'CPUExecutionProvider'])
app.prepare(ctx_id=0, det_size=(640, 640))

image = cv2.imread("person.jpg")
faces = app.get(image)

faceid_embeds = torch.from_numpy(faces[0].normed_embedding).unsqueeze(0)
face_image = face_align.norm_crop(image, landmark=faces[0].kps, image_size=224) # 你也可以分割面部

然后，根据面部嵌入生成图像：

import torch
from diffusers import StableDiffusionPipeline, DDIMScheduler, AutoencoderKL
from PIL import Image

from ip_adapter.ip_adapter_faceid import IPAdapterFaceIDPlus

v2 = False
base_model_path = "SG161222/Realistic_Vision_V4.0_noVAE"
vae_model_path = "stabilityai/sd-vae-ft-mse"
image_encoder_path = "laion/CLIP-ViT-H-14-laion2B-s32B-b79K"
ip_ckpt = "ip-adapter-faceid-plus_sd15.bin" if not v2 else "ip-adapter-faceid-plusv2_sd15.bin"
device = "cuda"

noise_scheduler = DDIMScheduler(
    num_train_timesteps=1000,
    beta_start=0.00085,
    beta_end=0.012,
    beta_schedule="scaled_linear",
    clip_sample=False,
    set_alpha_to_one=False,
    steps_offset=1,
)
vae = AutoencoderKL.from_pretrained(vae_model_path).to(dtype=torch.float16)
pipe = StableDiffusionPipeline.from_pretrained(
    base_model_path,
    torch_dtype=torch.float16,
    scheduler=noise_scheduler,
    vae=vae,
    feature_extractor=None,
    safety_checker=None
)

# 加载 ip-adapter
ip_model = IPAdapterFaceIDPlus(pipe, image_encoder_path, ip_ckpt, device)

# 生成图像
prompt = "photo of a woman in red dress in a garden"
negative_prompt = "monochrome, lowres, bad anatomy, worst quality, low quality, blurry"

images = ip_model.generate(
     prompt=prompt, negative_prompt=negative_prompt, face_image=face_image, faceid_embeds=faceid_embeds, shortcut=v2, s_scale=1.0,
     num_samples=4, width=512, height=768, num_inference_steps=30, seed=2023
)

IP-Adapter-FaceID-Portrait

import cv2
from insightface.app import FaceAnalysis
import torch

app = FaceAnalysis(name="buffalo_l", providers=['CUDAExecutionProvider', 'CPUExecutionProvider'])
app.prepare(ctx_id=0, det_size=(640, 640))

images = ["1.jpg", "2.jpg", "3.jpg", "4.jpg", "5.jpg"]

faceid_embeds = []
for image in images:
    image = cv2.imread("person.jpg")
    faces = app.get(image)
    faceid_embeds.append(torch.from_numpy(faces[0].normed_embedding).unsqueeze(0).unsqueeze(0))
faceid_embeds = torch.cat(faceid_embeds, dim=1)

import torch
from diffusers import StableDiffusionPipeline, DDIMScheduler, AutoencoderKL
from PIL import Image

from ip_adapter.ip_adapter_faceid_separate import IPAdapterFaceID

base_model_path = "SG161222/Realistic_Vision_V4.0_noVAE"
vae_model_path = "stabilityai/sd-vae-ft-mse"
ip_ckpt = "ip-adapter-faceid-portrait_sd15.bin"
device = "cuda"

noise_scheduler = DDIMScheduler(
    num_train_timesteps=1000,
    beta_start=0.00085,
    beta_end=0.012,
    beta_schedule="scaled_linear",
    clip_sample=False,
    set_alpha_to_one=False,
    steps_offset=1,
)
vae = AutoencoderKL.from_pretrained(vae_model_path).to(dtype=torch.float16)
pipe = StableDiffusionPipeline.from_pretrained(
    base_model_path,
    torch_dtype=torch.float16,
    scheduler=noise_scheduler,
    vae=vae,
    feature_extractor=None,
    safety_checker=None
)

# 加载 ip-adapter
ip_model = IPAdapterFaceID(pipe, ip_ckpt, device, num_tokens=16, n_cond=5)

# 生成图像
prompt = "photo of a woman in red dress in a garden"
negative_prompt = "monochrome, lowres, bad anatomy, worst quality, low quality, blurry"

images = ip_model.generate(
    prompt=prompt, negative_prompt=negative_prompt, faceid_embeds=faceid_embeds, num_samples=4, width=512, height=512, num_inference_steps=30, seed=2023
)