Skip to content

本文来自艾笑AI《【IP 配图 Skill 必看】全网独一份的架构详解》,原文发布于 2026 年 7 月 21 日。

【IP 配图 Skill 必看】全网独一份的架构详解 ​

真正的定制化 IP 配图,不是换一张角色图。而是把一整套配图工作流,改成适合自己的结构。

最近关于 IP 配图,好多人来问我。

我发现市场上很多自媒体都在用"xiaohe"配图。它确实好用:画面简单、角色鲜明,还能把抽象概念变成一个具体场景。

但大部分人停留在直接使用现成 Skill 的阶段。少部分人会再往前一步,把角色替换成自己的头像、卡通形象或者数字人 IP。

如果你只是调用别人的 Skill,会发现大家最后做出来的东西都差不多:同样的线条、同样的小人、同样的机器和管线。文章明明不一样,配图却像从同一套模板里批量印出来,完全没有自己的个性。

更关键的是,即便替换了 ip 角色,好多人并没有继续往下想:角色替换以后,整套配图系统还可以怎么改?比如,我不喜欢线条风格,能不能换成毛毡、拼贴、版画或者成熟的编辑卡通?同一个 IP 能不能有不同表情?能不能坐、推、拉、拆、连接、检查,而不是永远站在画面旁边指东西?生成完以后,标题、表情、版式还能不能继续加工?比如我今天这篇文章批图选择就不是昨天的简约线稿模式,而是一种卡通插画风,这样对于某些图片展示更醒目一些。

同样的内容结构,换成拼贴画风以后,人物、动作和信息关系都没有改变,变化的只是画面的渲染表面。

这背后是一个很常见的 Skill 误区。

很多人把 Skill 理解成一个拿来就用的现成工具,只要会调用、能产出结果就够了。但 Skill 本质上是一套重要的工作流:它决定怎样理解输入、怎样拆解任务、怎样管理素材、怎样调用能力,以及最后怎样验收结果。只要它要长期服务你的内容,就必须被改造成定制化的工作流,而不是永远停留在别人的默认设置里。

前面我写过一篇关于整体生图架构的文章,今天不展开整个图片工厂,只拆解公众号文章配图里的两种模式:普通配图模式和 IP 配图模式,重点讲清楚 IP 模式是怎样被引入的。

接下来,我会用艾笑老师的 IP 配图模式来做示范:先把普通配图的流程讲清楚,再看加入 IP 以后,角色形象、风格、动作和表情分别应该怎样管理,最终怎样组成一个真正定制化的 IP 配图 Skill。

01 先别急着放人物:普通配图本身就有一套完整结构 ​

在做艾笑老师 IP 配图之前,我的公众号里也使用过普通的非 IP 配图。

效果其实并不差。

有些图用流程解释一件事,有些图做前后对比,有些图把复杂系统画成分层结构,还有一些图就是把一段内容压缩成一张"划重点"总结图。它们没有固定人物,读者照样能理解文章,也能在滑动过程中获得停顿和记忆点。

普通非 IP 配图也一样:流程、对比、分层和路线这些结构并不依赖某一种画风,换成纸张拼贴后仍然成立。

因为一张普通配图要解决的核心问题,从来不是"放谁进去",而是:

这一段文字里,最值得被看见的关系是什么?

一套普通配图的流程,大致可以拆成五步。

第一步,从文章里选择认知锚点。

不是每隔 500 字机械地插一张图,而是寻找读者最容易卡住、最需要转折、最值得总结的位置。可能是一个误区,也可能是一组因果关系、一条流程或者一个关键结论。

第二步,把抽象观点翻译成关系结构。

文章说的是先后顺序,就用流程;说的是两种做法的差异,就用对比;说的是系统由哪些部分组成,就用分层;说的是从起点走到结果,就用路线;说的是多个因素共同影响结果,就用环形或网络结构。

第三步,把关系结构变成看得见的物件和空间。

"筛选"可以变成漏斗,"连接"可以变成桥,"决策"可以变成砝码或转盘,"反馈"可以变成回路。物件不是越怪越好,而是要让读者一眼理解它和正文之间的关系。

第四步,选择画面风格和版式。

同一个内容结构,可以画成手绘信息图,也可以做成大字板书、拼贴、纸张质感或安静的段落解释图。16:9、1:1 和 9:16 也不是把同一张图裁三遍,而是分别安排主体、文字和留白。

第五步,生成、检查,再插入文章。

检查它是不是一图一意,文字是否清楚,关系有没有画反,风格是否统一,插入的位置是否真的承接了上下文。

把这五步压缩成一句话,就是:

text
文章内容
  → 认知锚点
  → 关系结构
  → 视觉隐喻与构图
  → 风格和画幅
  → 生成、验收、插入

这条流程在 Skill 里不是一句模糊的"帮我配几张图",而是被单独写成工作流内核:

text
# 工作流内核
文章 → 找认知锚点
锚点 → 选关系结构 → 设计视觉隐喻
每张图 → 独立生成 → 单独验收
进入 IP 模式 → 再增加角色动作与镜头轮换

其中选择认知锚点、关系结构、视觉隐喻、独立生成和逐张 QA,是普通配图与 IP 配图共用的主干;角色动作与镜头轮换,则是进入 IP 模式后增加的部分。

这就是普通非 IP 配图的主干。

它已经能很好地完成"解释内容"这件事,所以 IP 配图并不是来替代它,更不是说没有人物的图就低一级。

02 IP 配图不是另一种配图,而是在普通配图上多出两层 ​

很多人一提 IP 配图,脑子里的公式是:

text
普通配图 + 一个固定人物 = IP 配图

这正是问题的起点。

一个人物被贴在角落里,并不会自动产生 IP 感。它可能只是 logo、装饰或者主持人立牌。读者看见了这个人,却记不住她在画面里做了什么,也感受不到她与内容有什么关系。

真正的公式应该是:

text
普通配图的内容结构
+ 角色身份系统
+ 角色表演系统
= 可持续的 IP 配图

普通配图负责回答:这段内容应该画成什么关系?

角色身份系统负责回答:进入画面的人到底是谁?

角色表演系统负责回答:她为什么出现在这里,她正在做什么,她用什么态度完成这个动作?

这两层缺一不可。

只有身份,没有表演,人物就是贴纸。

只有动作,没有稳定身份,每一张又会变成不同的人。

在 Skill 的输入合同里,这三部分也是分开定义的:内容层负责原来的配图内容,身份层和表演层则是 IP 模式增加的结构。

text
# 输入合同
内容层 = 标题 + 摘要 + 要点
身份层 = 外貌 + 人格 + 连续性锚点
表演层 = 动作 + 表情 + 视线 + 人物尺度

IP 配图 = 内容层 + 身份层 + 表演层

从这个结构可以看出:IP 配图不是覆盖普通配图,而是在原来的内容合同上增加角色和表演结构。

把这些结构真正放进一个 Skill 文件夹里,大致会是这样:

text
ip-illustration-skill/
├── SKILL.md              # 总入口:工作流与调用规则
├── profiles/
│   ├── character.md      # 角色身份与人格
│   └── styles/           # 线稿、拼贴、毛毡等风格
├── references/
│   ├── actions.md        # 动作库
│   ├── performance.md     # 表情、视线与姿态
│   ├── composition.md     # 内容结构、镜头与版式
│   └── qa.md             # 一致性与失败标准
├── assets/               # 角色参考素材
└── scripts/              # 生成、叠字与后处理

重点不在于照搬这些文件名,而是让身份、风格、动作、表演和验收各自独立,后面改任何一层,都不用推翻整套 Skill。

03 第一层:IP 形象不是一张参考图,而是一组可管理的身份事实 ​

先说 IP 形象怎么管理。

不管是做短剧里的连续角色,还是做公众号里的形象图片,大致思路都是一致的:必须让同一个人物跨场景、跨姿势、跨镜头以后,仍然保持身份一致。参考图的作用不只是告诉模型"这个人长什么样",更重要的是建立一组稳定的人物条件,让读者每次都能认出这是同一个人。

最常见的做法,是找一张自己满意的照片或卡通图,扔给模型,然后说:"以后都照这个人画。"

单张可能不错,批量一定会漂。

因为一张参考图同时携带了太多偶然信息:当时的角度、衣服、表情、光线、姿势、背景和构图。你没有告诉模型哪些必须保留,哪些可以变化,它就只能自己猜。

所以,IP 管理的第一步不是收集更多图片,而是建立"角色圣经"。

至少要写清楚四类信息。

视觉锚点:怎样才能认出是同一个人

以艾笑老师 IP 为例,需要稳定的不是一句"知性中年女性",而是更具体的事实:脸型与年龄感、发型、眼镜、常用服装轮廓、代表性配饰、身材比例,以及明确不能滑向的方向。

这些特征里还要区分主次。

脸、年龄感和发型是高优先级身份锚点;服装可以在一个范围内变化;背景、标题位置和当时的姿势则不属于身份。

在我的角色档案里,"她是谁"会被写成机器可以读取的事实,而不是一段临时发挥的形容词:

text
# 角色档案
身份 = 成熟知性女性 + 黑色低马尾 + 细窄眼镜
气质 = 知性 / 松弛 / 艺术 / 现代
服装 = 酒红上衣 + 深蓝短外套 + 黑色阔腿裤
配饰 = 左手食指银戒 + 左腕科技手环

这就是所谓"定义身份":把年龄感、发型、眼镜、服装和饰品分别锁定,后面的每一种姿势和画风都从这里继承。

人格锚点:她给人的感觉是什么

同样一张脸,可以被画成甜美网红、严肃老师、科技主播或者成熟编辑。

所以还要写清楚角色的气质和行为边界:她是成熟、知性、松弛、现代,还是可爱、热闹、夸张?她会不会卖萌?她面对复杂问题时,是兴奋地展示,还是冷静地拆解?

人格会直接影响表情、动作幅度和画面尺度。

参考素材:每张图到底能证明什么

参考图不能只是一个没有说明的文件夹。

正面照负责脸和神态,侧面照负责轮廓,坐姿图负责身体比例,三视图负责服装结构,手部特写负责配饰位置。每张素材都要说明"锁定什么"和"不锁定什么"。

否则模型很容易把参考图里的偶然姿势、标题位置甚至背景,一起复制到所有画面。

所以参考素材库里,每张图都会标明自己的职责,同时明确哪些东西不能跟着它一起锁死:

text
# 参考图管理
正面参考 → 锁定脸与神态
坐姿参考 → 锁定身体比例与松弛感
三视图   → 锁定服装轮廓

不锁定 → 标题、排版、背景、具体动作

失败标准:什么情况必须判定为不是这个 IP

例如年龄明显变小、脸变成网红模板、眼镜消失、配饰跑到另一只手、身材比例突然变化,或者角色气质从冷静分析变成夸张卖萌。

没有失败标准,"像不像"就永远只能靠当场感觉。

角色档案里也会直接列出禁止漂移的方向:

text
# 身份失败标准
如果出现:写实皮肤 / 幼态脸 / 网红脸 / 配饰错位
那么判定:人物身份漂移,重新生成

做到这一步,IP 才从"一张参考图"变成一套可检查、可复用的身份系统。

这套方法也不只适用于 IP 配图。只要任务需要同一个人物反复出现——短剧、连续分镜、数字人、品牌海报、课程形象图——都可以按照"身份事实、参考素材、可变边界和失败标准"的方式管理人物一致性。IP 配图只是其中一个具体应用。

04 形象和画风必须分开,否则你永远只能画一种样子 ​

很多现成的 IP 配图 Skill 还有一个问题:把角色身份和画风绑死了。

角色最初用的是极简线条,替换成自己的 IP 后,仍然只能沿用极简线条。想改成毛毡、拼贴、版画或者编辑卡通,角色就开始变脸。

这是因为系统没有分清两件事:

  • 角色身份决定"她是谁"。
  • 渲染风格决定"这一张怎样被画出来"。

同一个艾笑老师 IP,可以被画成克制线稿,也可以是毛毡定格、纸张拼贴、版画或者精致编辑卡通。风格变了,脸型、年龄感、发型、眼镜和核心气质仍然应该保持。

这里用毛毡做示意,只是因为材质变化最直观。真正可以切换的远不止毛毡:极简线稿、纸张拼贴、松弛手绘、高冲击撞色、艺术版画和精致编辑卡通,都可以在不改角色档案的前提下单独替换。把几种画风并排放在一起看,变化的是表面,留下来的才是 IP。

反过来,同一种毛毡风格也可以服务不同 IP,不能谁用了毛毡,最后都长成同一个人。

所以在结构里,角色档案和风格档案必须是两份独立配置。换风格时新增风格,不重写人物;换人物时新增角色,不重写整个配图流程。

比如毛毡风格文件只声明自己负责"渲染表面",并明确继承原来的角色身份:

text
# 毛毡风格
继承身份 = 艾笑老师角色档案
只改变   = 毛毡材质 + 手工轮廓 + 色彩质感
保持不变 = 年龄感 + 发型 + 眼镜 + 服装 + 配饰

这里改变的是画面材质,不是角色身份。所以风格可以从编辑卡通换成毛毡,人物仍然是同一个人。

这一步解决的,才是"我不喜欢线条风格,能不能换成别的风格"这个问题。

05 第二层:动作设计不是换一个姿势,而是让 IP 参与内容 ​

有了稳定形象,还不够。

很多所谓 IP 配图,人物每张都站在一边:一会儿指向流程图,一会儿指向几个关键词,一会儿站在机器旁边。看起来换了姿势,实际上她从未真正进入内容。

动作设计首先要回答一个问题:

如果把人物从画面里删掉,这张图的核心意思还完整吗?

如果答案是完整,那人物大概率只是装饰。

真正有效的 IP 动作,应该承担画面里的关键关系。

讲筛选,她可以亲手把不同素材放进筛选器;讲连接,她可以把两个断开的模块接起来;讲修复,她可以补上一段断裂的链路;讲判断,她可以检查仪表、拨动转盘或比较两边的砝码;讲拆解,她可以把一个黑箱拆成几层;讲复盘,她可以沿着反馈回路回看问题。

这些动作在 Skill 里会被写成一组可选择、可轮换的动作规则:

text
# 角色动作
筛选 → 把素材放进漏斗
连接 → 接上断开的模块
修复 → 补好断裂的链路
判断 → 拨转盘 / 称砝码

验收:删掉人物后画面不受影响 → 动作设计失败

所以动作库不是让人物"姿势丰富一点",而是让不同内容都能找到一个真正参与其中的动作。

这时,普通配图里的"关系结构"仍然存在,只是角色变成了完成这段关系的动作主体。

例如文章要表达"只会调用 Skill,不等于拥有自己的能力"。

普通配图可以画成左右对比:左边是一只封闭黑箱,输入内容后直接吐出同款图片;右边是一套可以拆开的模块,风格、角色、动作和 QA 各有位置。

IP 配图则可以让艾笑老师亲手打开黑箱,把"角色""风格""动作"三个模块逐一拆出来检查。她不是站在旁边介绍这套结构,而是在执行"拆解"这个核心动作。

同一段内容,结构没有变;IP 的加入让读者多记住了一个持续出现的行动者。

06 表情、视线和动作也要拆开,才能真正二次加工 ​

动作并不只是"站着、坐着、抬手"。

同一个检查动作,可以是怀疑、专注、惊讶、警觉,也可以是确认完成后的放松。表情决定态度,视线决定注意力,头部姿态决定情绪方向,身体动作决定人物与物件的关系。

如果把这些全部写死在一张角色参考图里,后面就很难改。

更合理的做法,是把角色表演拆成几组可组合变量:

text
角色身份:她是谁
动作:她正在做什么
表情:她用什么态度做
视线:她在看哪里
人物尺度:主角、共同主角、中景还是局部特写
渲染风格:这一组表演最终怎样被画出来

在实际 Skill 里,一张图的角色表演会以这样的结构进入生成合同:

text
# 角色表演
动作 = 检查决策转盘
表情 = 怀疑审视(中等强度)
视线 = 看向转盘
头部 = 轻微倾斜
画风 = 可替换,不影响以上表演

这段配置表达的是:她正在怀疑地检查决策转盘,目光必须落在转盘上,表情强度适中,头部轻微倾斜。人物是谁、她的身体在做什么、最后画成毛毡还是线稿,都由其他字段负责。

这样,同一个"怀疑检查"可以放进线稿、毛毡和编辑卡通三种风格;同一个"连接模块"可以搭配专注、吃力或完成后的轻松表情;同一个 IP 也可以从全身动作切换到手部特写。

二次加工的空间,就是这样被保留下来的。

但文字怎样进入发布图,并不只有一种答案。这里必须把两种交付模式分开。

第一种:一次生成图文融合

Image 2、Banana 这类模型已经可以在一次生成里同时完成人物、场景、动作和少量中文。对于公众号正文配图,如果标题短、文字少,而且文字本来就是画面构图的一部分,直接融合生成反而更自然,也更高效。

这篇文章现在的大部分 16:9 配图就是这种方式。下面这张图虽然讲的是"画面与文字分两步",但它自身的制作方式其实是一次性的图文融合生成:人物、场景、标题和标注都在同一张图里完成。

第二种:先生成纯图,再二次加文字

这种方式先让模型生成干净的角色场景,再由确定性发布工具扩展画布,放入标题、说明、栏目名和品牌元素。它更适合标题需要反复修改、同一画面要适配多个尺寸,或者字体、字号和位置必须长期统一的场景。

下面就是我之前做过的一组真实案例。第一张是模型生成的无字底图;第二张没有重新生成人物,而是在同一张底图上扩展画布,再由发布层加入稳定中文。

对应到 Skill 里,文字策略应该明确写成两种可选模式,而不是一律要求分成两步:

text
# 文字交付模式
一次融合 = 人物 + 场景 + 少量中文 → 直接成品
两阶段 = 纯图 → 扩展画布 + 标题 + 说明 → 发布成品

短文字、图文关系紧密 → 一次融合
频繁改字、多尺寸复用、品牌排版严格 → 两阶段

所以真正重要的,不是规定所有配图都必须拆成两次,而是让 Skill 明确知道当前选择的是哪一种交付模式。一次融合追求自然和效率;两阶段保留稳定修改文字与复用版式的能力。两种模式服务的是不同需求,不能混成一个默认答案。

07 从普通配图到 IP 配图:看清结构,再按八步升级 ​

把前面的内容放在一起,两种配图的差别就很清楚了。

层级普通非 IP 配图IP 配图
内容层选择认知锚点、提炼核心意思完全保留
关系层流程、对比、分层、路线、因果完全保留
构图层主体、物件、空间、画幅、文字区完全保留,但要为人物关系重新构图
风格层手绘、板书、拼贴、毛毡、版画等与角色身份解耦,可替换
身份层不需要固定人物新增角色圣经、参考素材和身份 QA
表演层主要靠物件表达动作新增动作、表情、视线、姿势和人物尺度
连续性单张成立即可还要检查跨图身份稳定、动作轮换和镜头重复

用一句更容易记住的话说:

普通配图负责把内容画清楚。IP 配图在此基础上,还要让"同一个人"持续用"不同动作"把内容演出来。

这也是为什么 IP 配图一定比简单换脸更复杂。

它不是多了一张人物素材,而是多了两套长期管理的系统。

如果要把一套普通配图升级成 IP 配图,可以按下面八步依次完成。

第一步:先保留原来的普通配图流程。不要一上来就推翻认知锚点、结构选择、视觉隐喻和 QA。IP 层应该建立在已经能把内容讲清楚的系统上。

第二步:建立角色圣经。写清楚视觉锚点、人格、可变项、不可变项和失败标准。不要只放一张头像。

第三步:整理参考素材并标注证据边界。说明每张图负责脸、侧面、坐姿、服装还是手部细节,也说明它不能决定什么。

第四步:把角色身份与风格拆开。先验证同一个人能否跨两到三种风格保持身份,再继续增加毛毡、拼贴或版画等变体。

第五步:建立动作库。动作不要从"站、坐、抬手"出发,而要从文章常见语义出发:筛选、连接、修补、比较、拆解、记录、验证、回看。

第六步:增加表情和视线系统。把怀疑、分析、发现、警告、确认等态度做成可以和动作组合的变量,避免每张图都是同一个微笑。

第七步:建立连续画面的 QA。检查角色有没有漂移,动作是否重复,人物与物件的尺度是否可信,表情和正文语义是否匹配,最近几张是不是又回到了同一种站姿。

甚至"同一个表情换了画风后还在不在",也可以写成回归用例:

text
# 回归测试
同一个"怀疑检查"动作
分别生成:线稿版 / 毛毡版 / 拼贴版 / 版画版 / 编辑卡通版

必须保持:同一个人 + 同一种表情 + 同一个视线目标

这就是把"感觉不像了"变成可以复查的工程条件,而不是等每次出图以后再凭印象争论。

第八步:明确文字交付模式并保存生产参数。短文字、图文关系紧密时,可以选择一次融合生成;需要频繁改字、多尺寸复用或严格品牌排版时,再选择两阶段制作。无论采用哪一种,都要保存每张图使用的角色、动作、表情、风格、画幅和交付模式,让下一次修改有明确入口。

08 真正的定制,是把配图工作流改成自己的 ​

回到最开始的现象。

为什么很多 IP 配图看起来都一样?

不是因为角色形象有问题,而是很多人只拿走了最终画面,没有改造背后的工作流。他们会调用,会复制,会替换一张参考图,却没有继续追问:普通配图原本怎样解释内容?角色身份怎样稳定?风格怎样替换?动作怎样承担语义?表情怎样变化?失败怎样被检查?

一套真正定制化的 IP 配图 Skill,必须同时对应你的内容结构、角色设定、视觉偏好和发布场景。它知道你的文章通常在哪里需要配图,知道这个 IP 哪些特征不能漂移,也知道面对不同语义时应该怎样行动和表达。

艾笑老师可以是卡通,也可以是毛毡、拼贴或版画;可以站在系统前,也可以坐着分析、俯身检查、伸手连接、拆开黑箱;可以怀疑、专注、警觉,也可以在完成之后松一口气。

变的是风格、动作和表情。

不变的是角色身份,以及她始终在帮助读者理解内容。

会用别人的 Skill,只是获得一次结果。能把普通配图、角色身份和角色表演拆成不同层,才真正拥有一套可以持续生长的 IP 配图系统。

先把配图的内容结构保留下来,再把你的 IP 作为一个真正的行动者放进去。到那一步,读者记住的才不只是某种流行画风,而是你的角色、你的表达方式,以及只有你能持续讲下去的内容。

以真实任务为主线的千问办公社区实战读本 · Pixel icons by HackerNoon