comfyui人脸识别、迁移及精度检测?

保证创作在可控范围内,降低创作随机性

如何来做?

以此工作流为例,进行关键节点及参数详解。

checkpoint选择:sd_xl_base_1.0.safetensors

正向提示词不描述面部细节(如肤色、眼睛形状、脸型等),让工作流加载参考图相貌输入:Female, 27 years old,. Hairstyle: 50cm, voluminous,  Body structure: well-proportioned, normal standing posture. Clothing: smooth silk nightwear. Focal length: equivalent to 50mm, shallow depth of field (foreground sharp, background slightly blurred), close-up of the face. Lighting: even natural light. Realistic style, cool colour palette. Light and shadow: cinematic lighting. Background: clean background. Overall image: clear, clean, high-quality, visually coherent. A portrait of a human. Background set in a futuristic environment, blending subtle emotions and symbolic aesthetics. Highly expressive, atmospheric, visually immersive.

反向提示词只限制多手多脚、低画质、风格限定等内容:

extra limbs, fused fingers, extra fingers, wrong anatomy,
distorted proportions, broken posture, unnatural body shape,
melted hands, oversized hands, low detail body, messy silhouette,
text, watermark, signature
low quality, low sharpness, muddy colors, grainy texture,
bad lighting, oversaturated highlights, washed-out tones,
chaotic background, visual noise,
unwanted artstyle: 3d cartoon, low-detail anime, children drawing。
jpeg artifacts, blurry textures
avoid dark horror themes, avoid grotesque or surreal distortion,
avoid comedic exaggeration, avoid extreme emotions,
no symbolic facial concepts, no negative emotional tone,
remove unwanted narrative interference

注意:若提示词中涉及过多五官、面部特征描述会影响人脸迁移结果。这个工作流的人脸特征是靠 IPAdapter 的 “参考脸特征向量” 来锁定的,而非靠文本描述 —— 文本的核心作用是控制 “脸部之外的元素(服装、场景、风格)”。如果文本里加入过多人脸 / 五官内容,相当于给模型 “额外加了一套人脸指令”,会打乱 IPAdapter 的 “单一特征约束” 逻辑。

节点ipadapter unified loader faceid:一定要选择CUDA(启动显卡加速计算,否则默认CPU计算,精度速度差距非常大)

节点face analysis models:使用CUDA加速insightface模型进行计算

节点face embed distance:使用face analysis models加载的insightface模型计算参考图与生成图人脸相似度

注意:以上三个节点默认使用CPU计算,若你发现人脸精度差、工作流运行速度慢,那意味着你没有成功启动GPU加速insightface。此故障排查具体方法详见本作者文章《comfyui下使用GPU加速insightface工作流常见故障排查》comfyui下使用GPU加速insightface工作流常见故障排查-CSDN博客

节点ipadapter faceid:正常连接model、ipadapter、image等内容。注意参数设置,以下是该节点中各个参数详细介绍说明,建议自己多做实验总结规律并根据实际需求设置参数

 weight:
含义:IPAdapter 人脸特征的整体约束权重(控制 “参考脸特征” 对生成图的影响程度)。
作用:
值越高:生成图的脸部越贴近参考脸(五官、脸型、发色等细节越一致),但可能限制文本提示(如服装、风格)的表现力;
值越低:脸部特征容易漂移(和参考脸不像),但文本提示(提示词prompt)的自由度更高。
常用范围:1.0~1.5(平衡人脸匹配与创作自由度)。

weight_faceidv2:
含义:针对FaceIDv2(IPAdapter 的人脸专用子模型)的单独权重(FaceIDv2 是更精准的人脸特征提取模块)。
作用:
单独强化 “人脸核心特征(如五官比例、面部轮廓)” 的约束,比weight更聚焦于 “脸部长相本身”;
值越高:参考脸的五官细节还原度越高(比如参考脸的眼型、唇形会更精准)。
常用范围:1.2~1.8(FaceIDv2 对人脸细节的控制力强,需配合weight调整)。

注意:weight它管的是 IPAdapter 整体对生成图的影响有多大,控制 IPAdapter 所承载的所有特征(包含人脸特征 + 参考图的风格特征) 对生成图的约束强度。而weight_faceidv2只管 “人脸本身的精细特征(五官、脸型、面部轮廓)” 的约束强度,不管参考图的风格、背景等其他特征。

weight_type(建议多实验,总结该参数规律):

含义:IPAdapter 权重的衰减方式(控制 “人脸约束强度” 在生成过程中的变化规律)。
当前值linear的作用:
生成过程中,weight会随采样步数线性变化(比如从第一步到最后一步,权重从设定值平缓衰减),让人脸约束更自然(避免 “强行贴脸” 的僵硬感)。
其他可选值:constant(全程保持固定权重)、cosine(余弦衰减)等,linear是最常用的 “平衡型” 选项。

combine_embeds(建议多实验,总结该参数规律):
含义:“人脸特征嵌入” 与 “文本特征嵌入” 的组合方式(控制 “参考脸特征” 和 “文本提示(服装 / 风格)” 的融合逻辑)。
当前值concat的作用:
将 “人脸特征向量” 和 “文本特征向量”直接拼接(保留两者的完整信息),既保证人脸细节,又能让文本提示的风格 / 服饰更清晰。
其他可选值:add(特征向量叠加,融合度更高但可能丢失部分细节),concat是人脸场景的首选。

start_at和end_at

表示ipadapter在整个过程中生效的起止步数、结束步数。例如本工作流中K采样器总步数30步,start_at是0,end_at是1,表示ipadapter参与整个步数(30步)。若总步数30,start_at是0,end_at是0.5,表示表示ipadapter参与第1步--第15步。

embeds_scaling(建议多实验,总结该参数规律):
含义:特征嵌入的缩放方式(适配模型的特征处理逻辑,CLIP/SD 系列模型对特征向量的缩放规则不同)。
优先选V only:聚焦人脸细节,不干扰服装 / 风格的文本控制;
若想同时约束风格,选K+V
若参考图和提示词文本差异大,选带K+V w/ c penalty的选项。

若参考图细节过多时(比如人脸有复杂妆容、饰品),选K+mean(v) w/ c penalty,均值压缩能避免 “特征过载导致生成混乱”,同时保证人脸核心特征不丢失,适合精细化的人脸 + 复杂风格的创作。

以下两个值为Face Embeds Distance节点的输出结果:

生成图左下角VALUE: 0.712。这是当前生成人脸的 “特征向量量化值”,它代表单张人脸特征向量的 “强度 / 集中度”,本身不直接反映相似度,而是配合DIST一起,帮你确认特征向量的有效性。

生成图左下角DIST: 0.172。这是两张人脸特征向量之间的 “距离值”,值越小表示两张人脸越像。

建议各位搭建此工作流,更改各个参数进行实验,更好理解各个参数。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐