资讯详情

游戏公司AI绘画大赛背后:从扩散模型到团队协作的工程化落地指南

📅 2026/10/3 10:52:11 | 华诺云谱 👁 阅读
游戏公司AI绘画大赛背后:从扩散模型到团队协作的工程化落地指南
1. 一场内部比赛为什么值得外部开发者关注盛趣游戏办了一届AI绘画大赛这事在圈内传开的时候我第一反应不是“又一个公司搞活动”而是去翻他们的赛制设计和作品落地方式。原因很简单市面上绝大多数AI绘画比赛停留在“比谁生成的图好看”这个层面而一家有二十多年历史的游戏公司办这种比赛大概率会把AI绘画往实际生产管线里塞。这背后的思路才是真正值得琢磨的东西。AI绘画这个词这两年已经被说烂了但真正把它用起来的人都知道从“生成一张好看的图”到“生成一张能用的图”中间隔着一整套工程化的距离。盛趣这次比赛的核心价值不在于谁拿了奖而在于它展示了一条路径游戏公司如何把AI绘画从玩具变成工具从个人尝鲜变成团队协作。这套东西对独立开发者、小型工作室、甚至非游戏行业的视觉创作者都有直接的参考意义。我写这篇东西不是复述比赛新闻而是把这类AI绘画比赛背后真正涉及的技术选型、工作流设计、提示词工程、后期处理、版权合规等环节拆开来讲。适合谁看如果你正在尝试把AI绘画引入自己的项目或者你已经在用但总觉得“差点意思”那这篇内容应该能帮你省下不少试错时间。如果你完全没接触过AI绘画也没关系我会从最基础的原理讲起用生活化的类比把技术门槛拉平。2. AI绘画到底是怎么“画”出来的2.1 从噪声到图像扩散模型的核心逻辑很多人用AI绘画工具的时候感觉像是在跟一个黑箱对话输入一段文字出来一张图中间发生了什么完全不知道。这种“不知道”在调试的时候会非常致命因为你没法判断问题出在提示词、模型、还是参数上。所以我觉得有必要先把原理用大白话讲清楚。目前主流的AI绘画模型底层基本都是扩散模型Diffusion Model。它的工作方式可以这样理解假设你有一张清晰的照片你往上面不断叠加噪点直到它变成一团完全随机的雪花点。扩散模型的训练过程就是学习这个“加噪”的逆过程——给定一团雪花点一步步去掉噪声还原出一张清晰的图。训练完成之后你给它一团随机噪声它就能“去噪”出一张全新的图像。那文字提示词是怎么起作用的这里涉及一个叫CLIP的文本编码器。它把你说的话比如“一个穿铠甲的骑士站在悬崖边”转换成一串数字向量然后扩散模型在去噪的每一步都参考这个向量朝着“符合这段文字描述”的方向去还原图像。所以提示词的本质是“导航信号”你给的信号越精确模型走的路就越接近你要的方向。2.2 为什么同一个提示词每次出的图都不一样这个问题我被问过无数次。答案在于扩散模型的起点是一团随机噪声每次生成的初始噪声不同去噪的路径就会有细微差异最终结果自然不同。这跟“同一颗种子种下去每次长出来的叶子形状都不完全一样”是一个道理。这个特性有好处也有坏处。好处是你可以用同一个提示词批量生成几十张图然后挑最好的一张。坏处是你如果生成了一张特别满意的图想完全复现它就必须把当时的随机种子Seed固定下来。绝大多数AI绘画工具都支持设置Seed值这是做商业项目时必须养成的习惯——每一张定稿图都要记录它的Seed、模型版本、提示词、采样器、步数等参数否则后期想微调都无从下手。2.3 游戏行业为什么特别适合用AI绘画游戏行业的视觉资产需求有几个特点量大、风格统一、迭代频繁。一个中型游戏项目光是角色概念图、场景氛围图、道具图标、UI素材这些需求量就可能上千张。传统流程下原画师从草图到定稿一张图可能要花几天甚至一周。而AI绘画可以在几个小时内产出几十张方向性的草图原画师的工作从“从零画起”变成“筛选和精修”。盛趣这种体量的公司办AI绘画比赛本质上是在做两件事一是摸底看看团队里有多少人已经掌握了AI绘画工具能用到什么程度二是建标准通过比赛沉淀出一套可复用的工作流和提示词库让不会的人也能快速上手。这个思路对所有需要大量视觉产出的团队都适用不只是游戏行业。3. 从比赛作品反推一套可落地的工作流3.1 需求拆解先想清楚要什么再动手生成我看过不少AI绘画的翻车案例根源都在这一步拿到需求就开始写提示词生成了一堆图之后发现方向完全不对。正确的做法是先做需求拆解把一个大概念拆成具体的视觉元素。举个例子假设你要生成一个“赛博朋克风格的酒馆场景”。不要直接把这个词丢给AI而是拆成主体酒馆内部、风格赛博朋克、关键元素霓虹灯、全息投影、金属质感吧台、雨夜窗外、色调蓝紫为主、暖色点缀、构图广角、低视角。拆完之后你的提示词就有了骨架生成结果的可控性会大幅提升。这个拆解过程在游戏行业叫“原画需求文档”在AI绘画里其实就是提示词的结构化设计。我自己的习惯是建一个表格左边列视觉维度右边填具体描述最后再拼成完整的提示词。这样做的好处是当你需要调整某个维度的时候不用重写整段提示词只改对应的那一行就行。3.2 提示词工程权重、否定词与风格锚定提示词不是越长越好但结构一定要清晰。我常用的结构是这样的主体描述 风格限定 细节补充 质量词 否定词。每一部分之间用逗号分隔重要的词往前放因为模型对前面的词注意力更高。权重的用法也很关键。大多数工具支持用括号加数字来调整权重比如(neon light:1.3)表示把霓虹灯的权重提高30%。但权重不是越高越好超过1.5容易导致画面过曝或元素变形。我的经验是主体元素权重控制在1.1到1.3之间风格词控制在0.8到1.0之间质量词如high detail、8k保持在1.0左右就行。否定词是很多人忽略的利器。比如你生成人物的时候总是多出手指可以在否定词里加extra fingers画面总是偏暗可以加dark。否定词的作用是告诉模型“不要往这个方向走”在修正特定问题时比反复调整正向提示词更高效。风格锚定是另一个实用技巧。如果你需要一组风格统一的图可以在每张图的提示词里加入相同的风格描述词比如concept art、matte painting、artstation trending。更极致的做法是固定Seed值只改变主体描述这样生成的图在色调和笔触上会高度一致。3.3 模型选择不同模型适合不同任务市面上的AI绘画模型大致可以分几类通用型什么都能画但什么都不精、风格型特定画风特别强、专用型针对特定任务优化。游戏行业常用的模型一般需要兼顾角色、场景、道具三类需求。我自己的模型库是这样的一个通用底模用来打草稿和探索方向两到三个风格模型分别对应项目的美术风格再加一个专门做细节修复的模型。底模的选择要看你的项目风格写实类、二次元类、厚涂类各有对应的优势模型。风格模型通常是在底模基础上用特定画风的数据微调出来的社区里有很多现成的可以下载。这里要提醒一点模型不是越多越好。我见过有人硬盘里存了几十个模型结果每次生成都要纠结用哪个效率反而低。正确的做法是根据项目需求精选三到五个模型把每个模型的特性摸透知道它在什么场景下表现最好。3.4 参数调优采样器、步数与CFG这三个参数是AI绘画里最容易被忽视、但对结果影响最大的。采样器决定了去噪的具体算法。不同采样器在速度和质量上有差异有的适合快速出草图有的适合精细出图。我常用的组合是探索阶段用速度快的采样器定稿阶段用质量高的采样器。具体哪个采样器对应什么特性不同工具的叫法不一样建议花半小时把每个采样器都跑一遍对比同一提示词下的输出差异建立自己的认知。步数控制去噪的迭代次数。步数太低比如20以下画面会有噪点、细节不足步数太高比如100以上收益递减而且可能出现过拟合导致画面僵硬。大多数模型在30到50步之间能达到比较好的平衡。我的习惯是先固定其他参数只跑步数找到那个“再加步数也没明显提升”的临界点。CFGClassifier-Free Guidance控制模型对提示词的遵循程度。CFG太低模型自由发挥可能偏离你的描述CFG太高模型死板执行画面容易过饱和、缺乏自然感。一般建议在7到12之间调整具体取决于模型和提示词的详细程度。提示词写得很细的时候CFG可以低一点提示词比较简略的时候CFG需要高一点来约束模型。4. 实操全流程从零生成一张可用的概念图4.1 环境准备与工具链搭建先说硬件。AI绘画对显卡的要求比较高显存是关键指标。8GB显存可以跑大多数模型的基础生成但如果要做高分辨率出图或者批量生成建议12GB以上。没有独立显卡的话可以用云端算力平台按小时计费成本可控。软件方面我推荐从整合包入手省去配置环境的麻烦。整合包通常包含了模型管理、提示词输入、参数调整、批量生成、后期处理等全套功能。安装好之后第一件事是设置模型目录和输出目录把路径规划清楚不然后面模型多了会乱。工具链里还需要一个图片管理工具。AI绘画的产出量很大一次生成几十张图是常态没有好的管理工具很快就会出现“找不到之前那张图”的情况。我自己的做法是按项目建文件夹每个文件夹里再按日期和主题分子文件夹每张定稿图旁边放一个文本文件记录生成参数。4.2 提示词编写与迭代假设我要生成一张“废墟中的机械花园”概念图。第一版提示词我会写得比较宽泛abandoned mechanical garden, overgrown with vines, rusty metal structures, soft sunlight, concept art。生成四张图看看方向。看完之后如果觉得机械感不够第二版就加强机械相关的词abandoned mechanical garden, intricate gears and pistons, overgrown with vines, rusty metal structures, volumetric lighting, concept art, high detail。如果觉得色调偏冷就加warm sunlight或者golden hour。这个迭代过程一般需要三到五轮每轮生成四张图总共十几到二十张基本就能锁定一个满意的方向。关键是每轮只改一到两个变量这样才能判断到底是哪个词起了作用。一次性改太多出来的图变了你也不知道为什么。4.3 高分辨率修复与细节增强AI绘画模型在512x512或768x768分辨率下训练直接生成高分辨率图容易出现构图崩坏比如人物多出肢体。正确的做法是先低分辨率生成确认构图和内容没问题再用高分辨率修复功能放大。高分辨率修复的原理是把低分辨率图放大然后在此基础上重新去噪一遍补充细节。放大倍数一般设1.5到2倍重绘幅度Denoising Strength控制在0.3到0.5之间。重绘幅度太低细节补充不够太高画面会变样。这个参数需要根据具体图来调没有万能值。如果修复之后还有局部不满意的地方可以用局部重绘功能。框选需要修改的区域单独写一段提示词只对这个区域重新生成。这个功能在修手、修脸、调整道具细节的时候特别好用。4.4 后期处理与交付AI生成的图很少能直接交付通常需要后期处理。基础操作包括调色统一色调、锐化增强细节、去噪消除杂点。如果图要用于印刷或大屏展示还需要做色彩空间转换和分辨率适配。我自己的后期流程是先用AI工具做高分辨率修复和局部重绘然后导入图片处理软件做调色和锐化最后根据用途导出不同格式。如果是给3D建模做参考导出PNG就行如果是给宣传物料用可能需要导出TIFF并嵌入色彩配置文件。交付的时候记得把生成参数一并附上。这不是为了炫技而是为了方便后续修改。如果甲方说“这个图不错但能不能把光线改成黄昏”你只要有参数记录改一个词重新生成就行不用从头再来。5. 踩过的坑与常见问题排查5.1 画面崩坏类问题人物多手多脚这是最常见的问题根源是模型在低分辨率下对肢体结构的理解不够精确。解决方法有三个一是在否定词里加extra limbs、extra fingers二是降低CFG值给模型更多自由度三是用局部重绘单独修手。画面模糊可能是步数太低、模型不适合当前风格、或者提示词太笼统。先检查步数是否在30以上然后换一个模型试试最后考虑细化提示词。构图混乱通常是提示词里元素太多、权重分配不合理导致的。建议减少同时出现的元素数量把最重要的元素权重提高次要元素降低或删除。5.2 风格偏离类问题生成的图跟想要的画风差很远首先确认模型选对了没有。不同模型对同一组提示词的理解差异很大。如果模型没问题检查提示词里有没有明确的风格描述词。anime style和realistic出来的结果完全不同不写清楚模型就随机发挥。同一组提示词不同批次风格不一致检查Seed值是否固定。如果Seed固定了还是不一致可能是模型版本更新了或者采样器变了。做系列图的时候所有参数都要锁定。5.3 效率类问题生成速度太慢降低分辨率、减少步数、换用速度更快的采样器。如果这些都不行考虑升级硬件或用云端算力。批量生成管理混乱建立命名规范和文件夹结构。我的习惯是项目名_日期_序号比如mechgarden_20240601_001。每张图旁边放一个同名txt文件记录参数。提示词复用率低建一个提示词库把常用的风格词、质量词、否定词分类存好用的时候直接拼装。这个习惯能省下大量重复劳动。5.4 常见问题速查表问题现象可能原因排查顺序解决方法人物肢体异常分辨率低、CFG过高先查分辨率再查CFG提高分辨率、降低CFG、局部重绘画面模糊步数低、模型不匹配先查步数再换模型步数调到30以上、换风格匹配的模型风格偏离模型错误、提示词缺风格词先确认模型再查提示词换模型、补充风格描述词色彩过饱和CFG过高直接查CFG降低CFG到7-9之间生成速度慢分辨率高、步数多先降分辨率再降步数用快速采样器、云端算力系列图风格不统一Seed未固定、参数变动检查Seed和所有参数锁定Seed、固定参数组合6. 团队协作中的AI绘画管理6.1 提示词库的共建与维护一个人用AI绘画提示词存在自己脑子里就行。但团队用的时候必须建共享提示词库。盛趣这种比赛本质上就是在做提示词的沉淀——把每个人摸索出来的有效提示词汇总起来形成团队资产。提示词库的结构我建议分三层基础层通用质量词、否定词、风格层项目对应的画风描述、元素层角色、场景、道具的具体描述。用的时候从三层里各取所需拼装成完整提示词。这样既保证了风格统一又保留了灵活性。维护提示词库的关键是版本管理。每次项目结束把验证有效的提示词归档标注适用场景和效果评价。下次新项目启动先翻一遍历史库能复用的直接拿来用不能复用的在基础上改。6.2 生成参数的标准与记录团队协作最怕的就是“这张图怎么生成的没人知道”。所以必须建立参数记录规范。每张定稿图对应的参数文件至少包含模型名称和版本、Seed值、采样器、步数、CFG、提示词全文、否定词全文、高分辨率修复参数。这些信息看起来多但用工具自动导出的话几秒钟的事。关键是养成习惯从第一张图开始就记录不要等到需要的时候才后悔没记。6.3 版权与合规注意事项AI绘画的版权问题目前还在演进中但有几个原则是明确的第一不要用未经授权的版权素材做训练数据第二生成结果如果用于商业用途要确认所用模型的许可协议是否允许商用第三如果生成结果与现有作品高度相似需要人工判断是否构成侵权。团队内部应该建立审核机制AI生成的图在正式使用前由专人检查是否存在明显的版权风险。这个环节不能省尤其是商业项目。7. 这套方法还能用在哪些地方AI绘画在游戏行业的应用只是冰山一角。我试过把这套工作流迁移到其他领域效果同样不错。电商行业用它生成产品场景图省去了搭实景棚的成本。一个杯子放在什么风格的桌面上、配什么背景、打什么光用AI生成几十个方案选最好的那个再实拍效率提升非常明显。室内设计用它做概念方案客户说“我想要现代简约但带点工业风”设计师不用先画草图直接用AI生成几组不同方向的图让客户选。选定方向之后再细化沟通成本大幅降低。自媒体内容创作更不用说了封面图、插图、配图以前要么买图库要么自己画现在用AI生成风格统一还不用担心版权问题。甚至教育领域也在用比如历史课需要展示某个朝代的服饰AI可以快速生成参考图比找图片素材快得多。核心逻辑是一样的把AI当成一个“快速可视化”的工具用它来探索方向、沟通想法、验证概念而不是用它来替代最终的精修环节。人负责判断和决策AI负责执行和产出这个分工在哪个行业都成立。8. 我个人的一些实操心得最后分享几个我踩坑之后总结出来的经验都是些文档里不会写的东西。第一不要追求“一次生成完美图”。AI绘画的正确用法是“大量生成、快速筛选、精细调整”。我见过太多人花几个小时调提示词就为了生成一张图结果还不如生成二十张然后挑一张再修来得快。第二建立自己的“失败案例库”。每次生成出问题的时候把提示词、参数、问题现象记下来。积累到一定程度你会发现很多问题是重复的有了这个库下次遇到类似情况直接查就行不用重新试错。第三模型更新要及时但不要盲目追新。新模型出来先小范围测试确认比旧模型好再用到正式项目里。我吃过亏项目做到一半换了新模型结果风格对不上只能全部重来。第四硬件投入要量力而行。如果只是偶尔用云端算力更划算如果是团队日常使用本地显卡的长期成本更低。算一笔账一张中端显卡的价格大概相当于云端算力几百个小时的费用根据你的使用频率来选就行。第五也是最重要的一条AI绘画是工具不是魔法。它能帮你更快地看到结果但不能替你决定什么是好结果。审美判断、项目理解、沟通能力这些才是核心竞争力。工具越强人的判断力就越值钱。
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑