Qwen-Image-2.1人像实战:中文提示词、编辑技巧与老照片修复指南
Qwen-Image-2.1这模型一出来玩人像的朋友圈就热闹了。以前用开源模型写中文提示词总有种话说了但没完全说的憋屈感——中文的人名、发型描述、表情细节经常一改就翻车。Qwen-Image-2.1对语义的理解和人像细节的刻画实测下来确实顺滑很多尤其发型变换、表情微调和老照片修复这几块是目前开源社区里少数能稳定输出结果的方案。我这篇不打算复述官方文档就把这一两周高强度实测出来的提示词写法、翻车记录、修复流程和整合包部署经验一次倒出来。适合刚接触AI绘画的新手也适合已经在用ComfyUI、想换模型或者想把人像细节控制得更精准的老手。无论你是想给照片换发型、调表情还是翻新一张泛黄的全家福下面的内容都可以直接抄作业。1. 先搞清楚Qwen-Image-2.1在人像方向到底强在哪1.1 中文理解能力才是人像提示词的胜负手以前用跨语言模型写中文人像描述经常遇到话不达意的尴尬。你写齐肩短发稍微卷一下它可能给你生成一头波浪卷写轻熟风它也可能理解成浓妆艳抹。Qwen-Image-2.1在中文训练语料上的投入明显比前代更大对人脸的生理特征描述很敏感空气刘海低马尾方圆脸微垂眼这类词汇能正确映射到对应的视觉元素上。这一点看似基础实际上决定了提示词的表达半径。提示词的本质就是把视觉期望翻译成模型听得懂的符号模型的语义理解越接近人的直觉我们写提示词的时候就越不需要迁就它。比如我调一款轻复古写真的时候写胭脂色腮红唇部微干眼神松弛看镜头但不聚焦镜头Qwen-Image-2.1出来的图基本是那个感觉而用之前的开源模型时常得到一个瞪大眼睛的标准证件照。顺带一提最近社区里流行用鹈鹕骑着自行车穿过菜市场这类奇怪组合句来测试模型的语义绑定能力Qwen-Image-2.1在这种抽象组合上的表现也确实比同级别的开源模型更稳。中文的语序灵活、修饰关系多变这种测试恰恰能反映出模型对主语-动作-场景三层结构的绑定能力这也是人像提示词里谁在哪里做什么最依赖的能力。1.2 从单张生成到局部编辑人像工作流的完整链路2.1版本还有一个很值得提的变化它把文生图、图生图和图像编辑串成了一条完整链路。以前的很多模型要么是无条件重绘导致主体完全变样要么理解不了只改刘海、其他别动这种局部指令。Qwen-Image-2.1在图生图编辑工作流里能做到换发型不动五官改表情不换脸型这对做头像定制、写真集、短视频分镜设计的人来说是真正能省时间的硬功能。说到本地跑大家最关心的就是配置。Qwen-Image-2.1发布时有完整版和Turbo蒸馏版Turbo版推理步数更少对消费级显卡更友好。整合包里通常预置了ComfyUI和对应插件如果你是第一次接触这个模型别一上来就纠结各种高阶参数先把Turbo版跑通一条生成链路看清出图速度和效果再深入折腾更多玩法。我自己就是用整合包搭建的环境测下来出图稳定性和社区原版工作流一致省去了手动装依赖的麻烦。2. 人像提示词的结构化写法从能看懂到听得懂话2.1 一套可以反复使用的四段式结构我把人像提示词拆成四个模块你按顺序往里填词基本不会出大错主体坐标区画面里最核心的那个人长什么样。包括性别、年龄段、脸型、五官特征、发型、发色、衣着、姿态动作。这是全图的锚点写得越具体模型越不容易跑偏。空间环境区人在哪、背后是什么。室内还是室外、什么样的场景、背景是干净还是杂乱、景别是特写还是半身。环境信息直接决定画面的叙事感。光影质感区光从哪个方向来、是什么时间的光、什么色调氛围。比如午后窗边自然光柔光灯箱效果黄昏逆光轮廓光光是一切质感的来源。画质等级区镜头焦段、景深、清晰度、风格倾向。比如85mm人像镜头浅景深皮肤纹理真实高清细节。这里的关键是四个区的词不要互相打架。常见的翻车是主体区写白色蕾丝长裙环境区写废弃工厂风格区又写甜美清新几个区互相拔河模型只能随机挑一个方向妥协。写提示词应该像搭积木每一块都指向同一个视觉目标即使个别词描述得不是那么精准整体方向不会偏。我反复测试过的一组正面案例是这样的一位35岁的中国女性鹅蛋脸五官比例协调齐肩黑发微微内扣穿米色针织衫 站在老式书店里手持一本摊开的书柔和暖光从侧面窗户洒落背景书架自然虚化 半身构图85mm人像镜头皮肤纹理自然真实情绪平静松弛电影感调色高清细节这组关键词生成的图主体一致性和氛围统一性都不错。你会发现句式其实非常人话不需要堆砌抽象难懂的术语关键是每个信息点都要有明确的画面指向。2.2 中文提示词的几个翻车点分享几个我踩出来的真实坑。第一别用好看、漂亮、美丽这类情绪化形容词。它们在模型里往往会被映射到平滑磨皮白幼瘦滤镜的方向一旦叠加到人像上人物的真实感和个性就没了。想要精致的五官不如直接描述五官立体鼻梁线条清晰眼神光明显这种具体的生理特征。第二自然这个词要慎重。虽然模型支持中英文混合提示词但自然仍然容易飘。你写自然的表情它大概率给你一个面无表情或者完全随机表情。更可靠的写法是给出明确的表情状态嘴角轻微上扬眉头舒展目光看向镜头左侧。表情写得越具体模型执行得越准。第三关于负面提示词。Qwen-Image-2.1对负面提示词有响应但不要堆太多写三五个最关键的就可以了。我的推荐项是extra fingers, distorted hands, oversaturated color, deformed face中文负面词也可以但英文的命中率实测更高。负面词堆太多会挤占正向词的位置反而影响出图质量。2.3 提示词工程不该只靠感觉现在流行一个词叫提示词工程很多人以为就是调调词汇、改改语序。实际上真正的提示词工程更像实验管理。不要凭记忆写长提示词一定要养成保留版本记录的习惯。我每次写定的提示词会存成一个笔记文件标题格式是日期核心动作模型版本比如0328-复古红裙-2.1-turbo。这样反复调整的时候能够快速对比哪个版本效果最好不至于来回改到最后自己都不知道哪版能用。另外网上有一些提示词助手工具和词库补全脚本我试过不少但真正用下来的频率很低。原因很简单AI帮你生成的提示词往往太正确四平八稳地堆满各行各业的标准词条但缺少人对审美的主观判断。工具可以当词典用提供词汇多样性主结构必须自己搭因为只有你知道这张脸想要什么感觉。3. 发型与表情编辑实操让修改点哪改哪3.1 发型编辑的提示词策略换型不换脸发型编辑最大的痛点就是换了个头。明明只想把长发改成短发结果脸完全变成了另一个人。Qwen-Image-2.1在图生图编辑工作流里稳了很多但前提是提示词里必须把保持面部这件事写清楚。我常用的提示词句式是这样的保持原人物的面部特征、五官轮廓和肤色质感完全不变。 将她的头发修剪为齐耳波波头发尾内收增加少许额前碎发。 头部角度、拍摄光线和背景保持一致。关键词是完全不变和保持一致。这类指令词在模型的局部重构里权重很高把保持条件和修改条件分成两句话来写模型更容易区分哪里能动、哪里不能动。如果你用的是局部重绘Inpainting方案遮罩一定要比发型区域大一圈。我以前常犯的错是把遮罩精确画在发际线边缘结果模型把头发修成贴头皮的假发感毫无蓬松度。正确的做法是把遮罩外扩到耳朵上方和颈部两侧给模型留出发挥的余地出来的新发型才能有自然的空气感和层次感。3.2 表情编辑微表情才是真正的难点表情编辑比发型更精巧。大笑、大哭、愤怒这些大表情其实很好出模型非常擅长——面部肌肉扭曲幅度越大越不容易出错。难的是微表情礼貌而不失尴尬的微笑强打精神的平静委屈但不哭。这类抽象情绪词没法直接映射到面部肌肉上。我的策略是用生理特征翻译情绪。模型不理解尴尬但它理解嘴角微微抽动目光偏移眉毛轻微上挑。所以每当我需要表达微妙情绪都会先拆解成脸部肌肉的组合状态开心嘴角上扬眼角微微弯起整个面部肌肉放松忧郁目光低垂嘴角自然闭合且轻微下压眉毛稍微松弛惊讶眉毛明显上挑眼睛睁大嘴巴微张不闭合克制嘴唇轻抿眼睛平视面部肌肉不做过大动作在Qwen-Image-2.1上实测微微稍微轻这类程度限定词它把握得相当好但我仍建议在句末加一条总控指令表情变化幅度保持轻微不夸张维持原图的情绪氛围基本不变。这条指令能有效防止表情编辑变成表情包生成——一旦模型开始放飞神仙提示词拉不回来。3.3 编辑工作流的去噪强度设置编辑类任务绕不开denoise强度这个参数也就是去噪强度。简单理解denoise越高模型越倾向于重新画越低越是贴着原图微调。不同任务要用的档位完全不同。发型这类大面积结构变化我把denoise放在0.55到0.65之间比较合适既能把长发改成短发又基本保留脸部结构。表情这种细微调整0.25到0.4就够再高容易把整张脸都重绘一遍。如果只是修复画质或者调整色调0.15到0.25是安全区间低于0.1基本等于没跑。这几档参数我分别跑了多组对比发现0.25左右的denoise能保留脸部原有的皮肤纹理0.55时背景和衣服开始出现轻微漂移超过0.7基本等于重画了一张新图。所以你在拿别人的工作流时特别要注意检查denoise的节点数值不同作者默认值差异很大直接套用容易翻车。建议拿到手后先固定一张测试图分别用三档denoise跑几遍记住自己这套环境的手感。4. 老照片修复实战记录一张1970年代的全家福4.1 修复前先做的三件事很多人拿到老照片直接丢给模型结果修出来一张塑料感全家福问题就出在准备工作没做够。第一件事预处理原图。用手机翻拍老照片的时候尽量保持镜头平行于画面不要有透视变形。我习惯用手机自带的文档扫描模式翻拍再用裁剪工具把画面拉正。脏污明显的大霉斑、水渍能先徒手清理就先清一遍这一步是为模型减负让它的算力尽量花在修复而不是去污上。第二件事列出问题清单。我拿到每张老照片都会先写下问题分类模糊程度、噪点强度、是否有划痕、有没有褪色偏色、人物五官有没有破损。不同类型的问题对应不同的提示词描述。比如噪点问题要写去除颗粒噪点模糊要写恢复边缘锐度褪色要写校正偏色、恢复自然肤色。一次修复兼顾的问题越多提示词越复杂反而越容易让模型顾此失彼。第三件事决定修复方向。是修复成高清现代数码照还是保留旧照片质感。这两个方向的提示词完全不同。前者要写清晰锐利、色彩鲜艳、现代相机质感后者要写柔和的胶片颗粒、复古色调、保留岁月痕迹、不要过度平滑。我个人的建议是家庭老照片优先保留旧质感因为记忆中那种泛黄的氛围感比单纯的高清分辨率更珍贵。4.2 提示词设计实例一张全家福的完整修复词这张图的情况是五人合影黑白照片有横纹噪点、少量霉斑五官基本完整但边缘发虚。下面是我实际使用的完整提示词修复这张老照片。场景五个家庭成员站成一排拍摄于老式房屋前。 要求保持原画面中人物数量、站位、姿态、表情和服装细节完全不变。 去除所有划痕、横纹、噪点和霉斑修复破损细节但不改变人物结构。 人物五官边缘要清晰自然皮肤纹理真实不要过度平滑保留自然岁月痕迹。 整体色调为柔和的复古胶片质感轻微颗粒感不要新增任何人物或物体。重点说最后一句不要新增任何人物或物体。这是从多次翻车换来的教训修复模型特别喜欢在空白处脑补路人、小狗甚至树影造成凭空多出一个人的灵异照片。加这句负面约束能有效压制幻觉保证画面内容忠实于原始照片。4.3 分层修复从大结构到小细节从修复到统一我的修复流程分三层每层用不同的denoise档位。第一层整体结构修复。先缩略图预览把大块的破损、重影、结构性变形补好。这一步用denoise 0.5到0.6输出一张结构正确的中间图作为后面所有操作的底稿。第二层局部细节修复。把中间图放大针对具体的人脸区域做局部重绘修复五官边缘的模糊和局部瑕疵。人脸的皮肤区域、眼睛轮廓、嘴角细节分别框选处理。这一步denoise降到0.35左右优先保住还原度不能让模型把祖先的五官优化成网红脸。第三层画质统一。全图跑一次超分加轻微降噪denoise设置在0.15到0.2目标是让前面两层的修复痕迹消失纹理和色调统一。如果原图是彩色且偏色的这一层还要顺手校正白平衡让肤色看起来自然。这套分层逻辑的核心是大改小不动。第一步允许模型重建大结构第二和第三步必须贴着原图走。如果反过来一上来就低denoise抠细节模型会因为整体信息的混乱而被带偏越修越糊。实际执行时一版很难出片我通常修完一版放大检查手部、眼角、嘴唇边缘把不满意的地方单独框选再重绘一轮大部分老照片三轮之后就能得到可用的成图。不要指望一蹴而就这是典型的迭代活。5. 整合包下载与本地部署的完整流程5.1 整合包怎么选、去哪下Qwen-Image-2.1的整合包主要有两类。一类是打包好的ComfyUI懒人包解压即用内置模型权重、插件和启动脚本。另一类是源代码仓库搭配调用脚本适合本来就有自己AI绘画环境的用户。对大多数人来说懒人包更省心。去哪找我的建议是优先看官方仓库release说明里推荐的第三方整合包其次是技术社区的UP主分享。判断一个整合包值不值得下的标准有三条是否带模型权重很多整合包只有代码模型要另外单独下两者容量能差好几倍是否标注了测试显卡和显存型号标注清楚说明作者真的跑过不是随手打包是否有一键启动脚本和相关说明文档。这里必须补一句安全提醒。动辄几十GB的整合包下载后一定要核对文件名和官方仓库的文件大小。不要下到被篡改过的包来源不明的压缩包解压之前先用杀毒软件扫一遍。社区里出过整合包内置挖矿脚本的事虽然是个例但几十GB的东西多留个心眼总没坏处。5.2 整合包目录结构和模型放置以我用的ComfyUI整合包为例解压后的目录结构大致是这样ComfyUI_Windows_Portable/ ├─ python_embeded/ ├─ ComfyUI/ │ ├─ models/ │ │ ├─ checkpoints/ # 单一模型文件有时会放这里 │ │ ├─ diffusion_models/ # 拆分后的主模型文件 │ │ ├─ vae/ # VAE模型文件 │ │ └─ clip/ # 文本编码器文件 │ └─ custom_nodes/ # 插件目录 ├─启动脚本.bat └─ 使用教程.txt如果你下的是多模型通用的整合包Qwen-Image-2.1相关的模型文件可能散落在不同子目录不要看到目录结构和自己预期不一样就随意移动文件路径一旦变了加载时直接报错。插件一般都在custom_nodes里整合包通常预装好了。想确认插件是否生效启动黑窗口盯着看看加载节点列表时有没有报错就行。5.3 首次出图的验证清单模型跑不跑得通别急着上复杂工作流先做一个最小测试。我的验证流程四步第一步启动整合包打开浏览器界面。默认端口被占用时启动脚本一般会自动换一个端口注意看黑窗口输出的地址。 第二步加载一个基于Qwen-Image-2.1的示例工作流。整合包内一般自带JSON文件确认模型节点、CLIP节点、VAE节点都成功加载没有红色报错。 第三步用最朴素的提示词测文生图一只猫坐在窗台上油画风格。这张图能出来说明主链路是通的。 第四步切一个带图生图节点的编辑工作流用一张本地图片测试编辑能力。这步确认编辑链路通后面才能正式做人像项目。整套流程下来不超过十五分钟。跑通了再进正式工作流能少一半排查时间。5.4 硬件门槛、性能调优与Mac部署的补充跑Qwen-Image-2.1的硬件门槛其实没有很多人想象得那么高。Turbo版对显存压力小6GB到8GB显存基本能跑full版建议12GB以上才比较从容。如果只是偶尔修修老照片、换换发型做头像Turbo版完全够用出图快还能多试几个版本方案。显存不够时的几个优化手段开启低显存模式降低单批数量先把分辨率控制在1024以内出图后再超分放大。这些设置在整合包的界面上就有不用改代码。在Windows下Tiled VAE采样可以显著降低显存峰值但不同显卡驱动下表现不一不确定自己的环境支持度就保持默认设置。再单独说一下Mac用户。网上很多整合包是Windows版本Mac上直接跑不了。Mac本地部署一般走源代码加conda环境的路子Python版本、依赖库版本都要严格对齐官方仓库说明。MPS后端可以跑但速度远不如同价位的N卡台式机如果是重度使用我还是建议在不违反使用规范的前提下找一台N卡的机器跑或者用远程算力平台省下来的时间远比花的钱值。6. 常见问题与排查技巧实录6.1 高频问题速查表我把这几周群里被问得最多的问题整理成表遇到问题先对照着查现象可能原因解决思路出图全黑或全灰模型文件没放对位置VAE缺失检查models目录路径确认VAE节点已连接中文提示词完全无反应文本编码器没有加载CLIP模型检查CLIP节点确认模型和插件版本匹配人脸五官歪斜变形denoise过高或seed随机性太大降低denoise档位固定seed后再跑编辑人物后完全变样遮罩区域太小编辑节点连接错误外扩遮罩范围补充保持面部不变提示词中文提示词部分词条失效词条之间语义冲突或提示词过长拆分长句删掉抽象形容词让每个词都有画面指向这些问题的共性在于不要第一时间怀疑模型坏了八成是工作流里的节点连接出了问题。把工作流最小化是最高效的排查手段——把无关节点全部断开只保留最基础的生成链路问题一下子就能定位到是哪个环节丢了。6.2 压箱底的三个实操习惯第一个习惯是固定seed跑对照实验。人像生成里seed对脸部结构的影响极大同一组提示词只是换了一个seed脸型就可能从鹅蛋脸变成长方脸。所以当你调整提示词的时候seed一定不能变只有固定seed你才能判断当前画面变化是提示词改动导致的还是随机性导致的。否则你会发现越调越乱根本不知道哪个改动起了作用。第二个习惯是所有结果都存档。每次生成的图片连同完整提示词和参数一起保存形成自己的参数-结果对照库。这个习惯前期看不出价值但当你半个月后想复现某张图的风格或者同组提示词想再生成几个变体的时候就知道有多方便了。翻对照库永远比翻记忆可靠。第三个习惯是先把提示词写顺再调参数。很多新手一上来就把denoise、CFG、采样器这些参数试个遍结果提示词一塌糊涂再调参数也是空转。我的习惯是用固定的中庸参数先把提示词写顺用同一组参数反复调整词句直到出品稳定再去动高级参数做锦上添花。参数调优是优化问题提示词理顺是方向问题——方向错了参数再精细也白搭。最后说说我自己的真实体会。Qwen-Image-2.1的突出价值不在某张图能生成得多惊艳而在于把中文人像控制的门槛真正拉了下来。以前需要靠大量英文词汇技巧硬磨的控制感现在用几句人话就能实现但代价是工作流里暗藏了更多细节坑遮罩的边界在哪、denoise档位怎么选、提示词里保持面部不变的措辞结构如何安排这些不实际踩一遍很难有体感。如果你正准备拿它做人像项目我建议第一件事不是测各种花哨功能而是找一张自己家的旧照片完整跑一遍修复流程。这个任务最能摸清模型的脾气等到你能稳定修好一张老照片了写严谨的人像提示词也就变成顺手的事。