坦白说,Midjourney 做单张角色图并不难,难的是让同一个角色在不同表情、动作、服装、场景里仍然像同一个人。
很多人第一次做 IP 形象设计时,会遇到一个很典型的问题:第一张图很惊艳,第二张开始脸型变了,第三张发型跑偏,第四张干脆像另一个角色。你明明写了同样的提示词,甚至用了同一个 seed,结果还是不稳定。
这不是你不会写提示词,而是你把 Midjourney 当成了静态绘图工具。实际上,生成一致性角色 IP,需要把它当成一套“视觉系统”来设计:角色设定、参考图、提示词结构、参数控制、筛选标准和资产管理,一个都不能少。
我更愿意从工程角度看这件事。角色一致性不是玄学,它是变量控制。
为什么 Midjourney 角色一致性总是失败?
在实际项目中,角色跑偏通常不是某一个提示词写错,而是多个变量同时失控。
常见问题有这几个:
- 角色核心特征太模糊,比如“可爱女孩”“赛博猫咪”“东方少年”,这些词都太宽泛
- 视觉锚点不足,模型不知道哪些特征必须保持
- 风格词和角色词混在一起,导致风格变化时角色也被重绘
- 过度依赖 seed,以为固定 seed 就能固定人物
- 每次生成都重新描述角色,没有形成稳定的提示词模板
- 没有建立角色库,优秀结果无法被复用
这里有个坑要注意:seed 只能提高同一提示词下的可重复性,不能保证跨场景、跨动作、跨服装的角色一致性。
如果你想做真正可用的 IP 角色,比如品牌吉祥物、绘本主角、短视频虚拟人物、游戏 NPC、表情包角色,就必须建立一套稳定的“角色身份识别系统”。
先做角色 DNA,而不是急着出图
我通常不会一上来就让 Midjourney 生成最终图。最佳实践是先写角色 DNA,也就是把角色拆成可复用、可检查、可继承的字段。
一个角色至少要定义这些层级:
| 层级 | 作用 | 示例 |
|---|---|---|
| 身份定位 | 决定角色气质 | 城市咖啡品牌的松鼠店长 |
| 外形锚点 | 保证一眼认出 | 圆脸、栗色毛发、白色围裙、左耳小缺口 |
| 色彩系统 | 保持品牌识别 | 咖啡棕、奶油白、薄荷绿点缀 |
| 服装道具 | 增强记忆点 | 小围裙、金属名牌、手冲壶 |
| 表情性格 | 决定传播感 | 温和、机灵、略带社恐但很专业 |
| 禁用元素 | 防止模型乱加 | 不要帽子、不要眼镜、不要拟人化过度 |
注意,角色 DNA 不是文学设定,它必须能转化成视觉描述。
比如“有亲和力”太抽象,不如写成“soft rounded face, gentle smile, relaxed shoulders”。“高级感”也不够具体,不如写成“minimal color palette, clean silhouette, subtle fabric texture”。
一个可复用的提示词架构
我做一致性角色时,提示词不会写成一整段散文,而是拆成模块。这样后期替换场景、动作、表情时,不会破坏角色主体。
[角色主体] + [不可变视觉锚点] + [当前动作/表情] + [服装/道具变化] + [场景] + [风格] + [镜头/构图] + [质量控制] + [排除项] + [参数]可以参考这个模板:
A consistent original IP character, a small squirrel coffee shop manager, round face, chestnut brown fur, tiny notch on left ear, cream white apron with mint green name tag, warm gentle smile, holding a hand drip coffee kettle, standing behind a wooden counter, cozy modern coffee shop interior, clean character design, soft 3D illustration style, front view, full body, simple background, high detail, consistent character features --ar 1:1 --v 6 --style raw如果要换成奔跑动作,不要整段重写,只替换动作模块:
A consistent original IP character, a small squirrel coffee shop manager, round face, chestnut brown fur, tiny notch on left ear, cream white apron with mint green name tag, running with a takeaway coffee cup, cheerful expression, street corner outside a coffee shop, clean character design, soft 3D illustration style, full body, dynamic pose, high detail, consistent character features --ar 1:1 --v 6 --style raw关键在于:角色锚点必须稳定,动作和场景才可以变化。
cref、sref、seed 到底该怎么用?
很多人搜索 Midjourney 生成一致性角色 IP形象设计,真正想问的是:到底该用哪个参数?
我简单拆开讲。
character reference:控制“像不像同一个角色”
--cref 适合用来引用角色图,让后续生成更接近已有角色。你可以把通过筛选的角色正面图作为主参考,再生成侧面、背面、表情和场景图。
常见写法是:
small squirrel coffee shop manager, running pose, cheerful expression, full body, clean 3D mascot design --cref 角色参考图URL --cw 80 --ar 1:1 --v 6--cw 可以理解为角色参考权重。数值越高,越强调角色外观;数值较低时,模型更容易根据新提示词发挥。没有绝对答案,我一般会从 60、80、100 三档测试。
style reference:控制“画风是否统一”
--sref 更偏向风格参考,比如材质、光影、色调、插画语言。它不应该替代角色参考。
如果你已经有一张很满意的品牌视觉图,可以这样组合:
small squirrel coffee shop manager, waving hand, friendly expression, product mascot pose --cref 角色参考图URL --cw 80 --sref 风格参考图URL --ar 1:1 --v 6我的建议是:角色一致性交给 --cref,风格统一交给 --sref,不要把所有压力都压在提示词上。
seed:适合微调,不适合当角色身份证
--seed 在同构图、同提示词下很有用,适合做小范围迭代。但如果你改变了动作、视角和场景,它的控制力会明显下降。
所以 seed 更像“复现工具”,不是“角色管理工具”。
角色三视图和表情包,应该分开生成
很多新手会一次性要求:正面、侧面、背面、开心、生气、奔跑、喝咖啡、拿招牌,全放在一张图里。
这样做的问题是,Midjourney 很容易把多个动作和多个角色混在一起,出现手脚错位、服装不一致、脸部比例变化。
更稳的流程是:
flowchart TD
A[角色DNA定义] --> B[生成正面标准图]
B --> C[筛选主参考图]
C --> D[生成三视图]
C --> E[生成表情组]
C --> F[生成动作组]
C --> G[生成场景海报]
D --> H[建立角色资产库]
E --> H
F --> H
G --> H我通常先做“正面标准图”,再用这张图作为 --cref。等三视图稳定后,再进入表情和动作。
角色资产库里至少应该保存:
- 主参考图:最稳定、最像角色本体的一张
- 正侧背三视图:用于后续建模或延展
- 表情九宫格:开心、惊讶、委屈、生气、思考等
- 动作库:站立、奔跑、挥手、坐下、拿道具
- 场景图:门店、海报、社交媒体封面
- 提示词版本:每张图对应的 prompt 和参数
不要小看最后一项。没有 prompt 记录,角色库很快会变成一堆无法复现的漂亮图片。
用版本管理思维维护提示词
我做技术出身,所以非常反感把提示词随手丢在聊天记录里。提示词也是资产,尤其是 IP 角色项目。
可以用一个简单的结构维护:
character_id: squirrel_cafe_manager_v01
core_traits:
species: small squirrel
face: round face
fur: chestnut brown fur
unique_mark: tiny notch on left ear
outfit: cream white apron with mint green name tag
personality: warm, gentle, slightly shy
negative_traits:
- no hat
- no glasses
- no realistic animal anatomy
style:
rendering: soft 3D illustration
palette: coffee brown, cream white, mint green
lighting: soft studio lighting
mj_params:
version: 6
aspect_ratio: 1:1
style: raw然后每次生成新图,只替换任务字段:
task:
pose: waving hand
expression: cheerful smile
scene: cozy coffee shop counter
output: full body character poster这套方法看起来有点“工程化”,但它能显著减少返工。更重要的是,团队协作时每个人都知道哪些字段能改,哪些字段不能动。
评估一致性,不要只凭感觉
角色 IP 设计最容易陷入“好看就行”的误区。好看当然重要,但一致性要有检查标准。
我会从五个维度看:
- 轮廓识别:缩小到缩略图后,还能不能认出角色?
- 面部比例:眼睛、嘴巴、脸型是否稳定?
- 标志元素:耳朵缺口、围裙、名牌等是否保留?
- 色彩一致:主色和辅助色有没有漂移?
- 风格统一:材质、线条、光影是否像同一个系列?
这里要注意,完全一致并不一定是最优解。IP 角色需要“稳定中的变化”。如果每张图都像复制粘贴,反而没有生命力。我的标准是:核心锚点不变,情绪和动作可以变化。
常见问题:为什么我用了参考图还是不像?
你可能会问:我已经用了 --cref,为什么还是不稳定?
通常有几种原因。
一种是参考图本身不够标准。比如角色被遮挡、角度太偏、背景太复杂,模型提取不到清晰特征。主参考图最好是正面或 3/4 角度,主体完整,背景简单。
另一种是提示词和参考图冲突。参考图是短发角色,提示词却写了 long flowing hair;参考图是扁平插画,提示词又写 ultra realistic。模型会在冲突中折中,结果自然不稳定。
还有一种是你一次改变了太多变量。比如同时换服装、换年龄、换场景、换画风、换镜头。建议一次只改一个主要变量,观察变化后再继续。
我推荐的实战流程
如果你要从零做一个 Midjourney 一致性角色 IP,可以按这个顺序来:
- 写角色 DNA,明确不可变特征
- 生成 20 到 40 张候选正面图,筛选 1 到 3 张主参考
- 用主参考图做
--cref,测试不同--cw权重 - 固定风格后加入
--sref,统一画面语言 - 生成三视图,不满意就回到主参考图阶段
- 再做表情组和动作组,不要一开始就做复杂场景
- 建立角色资产库,保存图片、prompt、参数和版本号
- 用一致性检查表筛选,宁可少留,也不要把跑偏图混进库里
说实话,Midjourney 不会替你完成 IP 系统设计。它擅长生成视觉可能性,但角色判断、品牌取舍和资产管理仍然要靠人。
结语:一致性不是参数技巧,而是设计系统
Midjourney 生成一致性角色 IP形象设计,真正的核心不是某个神奇提示词,而是你有没有把角色当成长期资产来管理。
提示词负责表达,参考图负责继承,参数负责约束,资产库负责复用。四件事配合起来,角色才会从“偶然好看的一张图”变成“可以持续生产内容的 IP 形象”。
如果你现在还在反复抽卡,不妨先停下来,回到角色 DNA。把不可变特征写清楚,把参考图筛干净,再让 Midjourney 扩展。效率会完全不一样。
