ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

MiniMax H3全参考模式提示词改写指南:六段结构与保留分析实战

2026/9/25 2:47:24 拓冰建站 浏览量
MiniMax H3全参考模式提示词改写指南:六段结构与保留分析实战 1. 全参考模式到底在解决什么问题第一次接触 MiniMax H3 的全参考模式Ref2VA时我下意识把它当成了普通的图生视频来用结果折腾了大半天出来的片子跟参考图完全是两回事。后来才搞明白Ref2VA 的核心逻辑不是“以某张图为第一帧”而是把参考素材当成一种全局约束条件让模型在生成过程中持续对齐参考里的主体特征、色调倾向和构图关系。这个区别很关键。普通图生视频你给一张图模型只把它当作起点后面怎么演化基本靠提示词自由发挥而全参考模式是把参考图拆解成多个维度的信息——主体长什么样、穿什么颜色的衣服、背景是什么质感、光线从哪来——然后在每一帧里都尽量维持这些特征的一致性。说白了它更像是一个“带着镣铐跳舞”的模式自由度低了但可控性上来了。那为什么还要改写提示词因为 Ref2VA 对提示词的敏感度和普通模式完全不同。普通模式下你写“一个女孩在雨中奔跑”模型可能给你生成各种风格但在全参考模式里同样的提示词会跟参考图产生复杂的交互——参考图里女孩是短发你提示词里写“长发飘飘”模型就会陷入两难最后出来的结果往往是两边都不像。所以提示词改写的本质是让文字描述和参考素材之间形成互补而非冲突把参考图无法表达的信息比如动作、时间变化、镜头运动用文字补上同时避免文字去覆盖参考图已经固定的特征。这套格式指南要解决的就是“怎么写出跟参考图配合得好的提示词”这个问题。它适合已经上手过 H3 基础功能、想进一步提升参考一致性的朋友也适合那些被“参考图明明很清晰但生成结果就是不像”困扰的创作者。接下来我会把参考标签体系、六段结构的写法、以及保留分析的具体操作拆开讲都是我自己反复试出来的经验。2. 参考标签体系给每张图打上模型能读懂的标记2.1 参考标签到底是什么参考标签是我在 Ref2VA 工作流里最先要处理的东西。你可以把它理解成给每张参考图贴的“身份说明”告诉模型这张图在本次生成中扮演什么角色、需要保留哪些特征、可以忽略哪些部分。没有标签模型只能靠自己的视觉理解去猜猜错了就是主体漂移、风格跑偏。我一开始觉得标签是可有可无的后来发现加了标签之后同一组参考图生成的一致性明显提升。举个例子我用一张人物半身像做参考不加标签时模型经常把背景里的书架也当成必须保留的元素导致镜头一动书架就变形加上“主体参考仅保留人物面部与服装背景忽略”这样的标签后镜头运动就自然多了。标签的写法没有绝对标准但有几个原则是我踩坑后总结出来的第一标签要短控制在十个字以内太长了模型反而抓不住重点第二标签要具体说“保留红色外套”比说“保留服装特征”有效得多第三标签之间用分号隔开避免逗号造成的歧义。2.2 常用参考标签分类与适用场景我把常用的参考标签分成几类方便你按需取用标签类型示例写法适用场景注意事项主体锁定主体参考锁定面部人物、宠物、特定物体不要同时锁定多个主体容易打架风格迁移风格参考色调对齐想要参考图的色彩氛围风格标签和主体标签不要混用构图引导构图参考机位对齐需要保持画面布局构图参考对镜头运动限制较大局部保留保留服装保留发型只关心某一部分特征要明确写出忽略其他部分材质参考材质参考纹理对齐产品展示、布料质感材质标签对光照变化敏感这张表是我自己整理出来贴在显示器旁边的每次写标签时对照一下能省不少试错时间。需要强调的是标签不是越多越好。我试过一张图贴五六个标签结果模型直接“过载”生成的东西四不像。一般来说一张参考图配两到三个标签就够了最多不超过四个。2.3 标签与提示词的优先级关系这里有个很多人会忽略的点参考标签和提示词之间是有优先级顺序的。根据我的实测当标签和提示词描述冲突时模型倾向于优先满足标签里的约束。也就是说如果你给参考图打了“锁定面部”的标签但提示词里写“人物转头露出侧脸”模型会尽量保持面部特征不变但转头动作可能做得很别扭。这个特性可以反过来利用。当你希望某个特征绝对稳定时就把它写进标签当你希望某个特征可以灵活变化时就只在提示词里提不要打标签。比如做产品展示视频产品外观必须稳定那就打“主体锁定”标签而背景是纯色还是渐变可以在提示词里描述让模型自由发挥。提示标签和提示词冲突时不要指望模型能完美平衡最好的做法是从源头上避免冲突——要么改标签要么改提示词。3. 六段结构把提示词写成模型能执行的“分镜脚本”3.1 为什么是六段而不是一段我最初写提示词就是一句话堆砌“一个穿红裙子的女孩在咖啡馆里看书阳光从窗户照进来镜头慢慢推进。”这种写法在普通模式下勉强能用但在 Ref2VA 里经常出问题——模型分不清哪些是必须保留的参考特征哪些是希望生成的变化结果就是该稳的地方不稳该动的地方不动。六段结构的思路是把提示词拆成六个功能明确的模块每个模块只负责一件事。这样模型在处理时能更清晰地分配注意力该对齐参考的地方对齐参考该自由发挥的地方自由发挥。这六个模块分别是主体描述、动作与交互、环境与背景、光线与色调、镜头与运动、风格与画质。这六个模块的顺序不是随便排的。主体描述放最前面是因为模型对开头的信息最敏感镜头与运动放在靠后位置是因为它属于“全局指令”太早出现会干扰模型对主体和环境的理解。这个顺序是我试了十几种排列组合后固定下来的你可以直接照用。3.2 六个模块的具体写法与参数建议主体描述段要跟参考标签呼应。如果标签里写了“锁定面部”这里就不要再详细描述五官了只需要补充参考图里没有的信息比如“人物表情从平静转为微笑”。如果标签里没有锁定那这里就要写清楚主体的关键特征但注意不要跟参考图矛盾。动作与交互段是 Ref2VA 里最需要花心思的部分。因为参考图是静态的动作全靠文字来驱动。我的经验是动作描述要具体到身体部位和幅度比如“右手缓慢抬起至胸前”比“做一个手势”有效得多。另外动作幅度不要太大全参考模式下大幅动作容易导致主体变形。环境与背景段要明确哪些是参考图里已有的、哪些是新增的。如果参考图背景很干净你想加一些元素就在这里写如果参考图背景复杂且你想保留就写“背景保持参考图原样”。我一般会加一句“背景元素不遮挡主体”避免生成时背景抢戏。光线与色调段直接决定成片的氛围。Ref2VA 对光线描述很敏感写“暖色调侧光”和“冷色调顶光”出来的效果差异巨大。如果你希望跟参考图色调一致就写“色调对齐参考图”如果想改变氛围就具体描述光源方向和色温。镜头与运动段控制的是“怎么拍”。这里可以用一些摄影术语比如“缓慢推镜”“环绕运镜”“固定机位”。实测下来Ref2VA 对“缓慢”这个词特别敏感加了之后运动平滑度明显提升。另外镜头运动幅度建议控制在中小范围大幅运镜容易导致参考特征丢失。风格与画质段是收尾用来定调整体质感。可以写“电影感”“写实风格”“高清细节”等。这一段跟参考图的关系是如果参考图本身风格很强这里就写“风格对齐参考图”如果参考图风格中性你想加风格就在这里指定。3.3 六段结构的完整示例与拆解拿一个实际案例来说。参考图是一张室内人像暖光人物穿米色毛衣背景是书架。我想生成的视频是人物抬头看向镜头并微笑镜头缓慢推进。按六段结构写出来是这样的主体描述年轻女性米色毛衣发型与参考图一致动作与交互缓慢抬头视线从书本移向镜头嘴角微微上扬环境与背景室内书架背景保持参考图布局背景不遮挡人物光线与色调暖色调侧光从左侧窗户照入色调对齐参考图镜头与运动固定机位起始缓慢推镜至中景风格与画质写实风格电影感高清细节这六段加起来不到一百字但信息密度很高而且每一段都有明确的功能。我拿这个结构跑了十几次生成一致性明显比之前的一句话提示词好很多。你可以把这个例子当作模板替换成自己的内容。注意六段结构不是死规矩如果某个模块在你的场景里不重要可以简化甚至省略但主体描述和镜头运动这两段建议保留。4. 保留分析判断哪些特征必须稳住、哪些可以放手4.1 保留分析的操作流程保留分析是我在写提示词之前必做的一步。具体做法是把参考图打开拿一张纸或者开一个备忘录列出图里所有的视觉元素然后逐个判断“这个元素在生成中必须保持不变吗”。判断的标准有三个第一这个元素是不是主体的核心识别特征比如人的脸、产品的logo第二这个元素变了会不会导致观众出戏第三模型有没有能力在变化中保持这个元素稳定。我一般会把元素分成三档必须保留、尽量保留、可以变化。必须保留的写进参考标签尽量保留的写进提示词的主体描述段可以变化的就不提让模型自由发挥。这个分档过程看起来麻烦但做熟了之后五分钟就能搞定比反复生成再挑结果省时间得多。4.2 不同场景下的保留优先级不同场景下保留的优先级完全不同。我做人物类视频时面部特征和服装颜色是必须保留的背景和光线可以适当变化做产品类视频时产品外观和材质是必须保留的使用场景可以自由发挥做风景类视频时整体构图和色调是必须保留的具体云层形状可以变化。这里有个容易踩的坑很多人会把“必须保留”的范围划得太大结果提示词里全是约束模型被绑得死死的生成的东西僵硬不自然。我的经验是必须保留的元素控制在三个以内尽量保留的控制在五个以内剩下的全部放手。宁可少约束也不要过度约束。4.3 保留分析跟提示词改写的衔接保留分析做完之后提示词改写的方向就清晰了。必须保留的元素在参考标签里锁定提示词里不再重复描述尽量保留的元素在提示词的主体描述段里用“保持”“延续”这类词来引导可以变化的元素就是提示词里重点发挥的地方动作、镜头、氛围都往这里写。举个例子参考图是一个戴眼镜的男性在办公室。保留分析结果眼镜和面部必须保留衬衫颜色尽量保留办公室背景可以变化。那么提示词里就不写眼镜和面部主体描述段写“衬衫颜色延续参考图”然后把笔墨集中在“人物从看电脑转为看向镜头”“镜头从侧面缓慢转到正面”“背景从办公室虚化为抽象光斑”这些变化上。这样写出来的提示词既保住了核心特征又有足够的变化空间。5. 实操全流程从参考图到成片的完整走一遍5.1 素材准备与预处理正式写提示词之前素材准备这一步不能省。我一般会把参考图先过一遍做三件事裁剪到合适比例、检查分辨率、确认没有明显瑕疵。Ref2VA 对参考图的比例有要求如果参考图是竖版但你想生成横版视频最好提前裁剪或者留出扩展空间不然模型会自动裁切可能把关键部分切掉。分辨率方面我的经验是参考图短边不低于 768 像素太低了解析不出细节太高了处理速度会变慢。如果参考图有噪点或者压缩痕迹建议先做一次轻度的降噪和锐化但不要过度处理否则模型可能把处理痕迹也学进去。5.2 参考标签与提示词的协同编写素材准备好之后先写参考标签再写提示词。写标签时对照第 2 节的分类表确定每张图的角色。写提示词时按第 3 节的六段结构来每一段都回头检查一下有没有跟标签冲突。这个检查步骤很重要我至少有三分之一的失败案例是因为标签和提示词打架导致的。协同编写的一个小技巧是先把六段结构写完整然后逐段跟标签对照把冲突的地方改掉。比如标签写了“锁定面部”提示词主体描述段里就不应该有“面部表情变化”之外的描述标签写了“构图参考”提示词镜头段里就不应该有大幅运镜。5.3 生成参数设置与首轮测试参数设置这块我常用的配置是生成时长 4 到 6 秒帧率 24 或 30运动幅度中等偏低。Ref2VA 模式下运动幅度不建议调太高否则参考一致性会下降。首轮测试我一般会生成两到三个不同随机种子的结果对比一下稳定性如果三个结果差异很大说明提示词或者标签有问题需要回去调整。首轮测试的另一个目的是检查参考特征有没有被正确保留。我会重点看三个地方主体面部是否跟参考图一致、服装颜色有没有偏移、背景是否出现了不该有的元素。如果这三个地方都稳再进入下一轮优化。5.4 迭代优化与成片输出迭代优化主要调三个东西提示词里的动作描述、镜头运动幅度、光线色调描述。每次只调一个变量这样能清楚知道是哪个改动起了作用。我一般会迭代三到五轮每轮生成两到三个结果挑最好的那个作为下一轮的基准。成片输出前建议做一次高清修复。Ref2VA 生成的结果在细节上可能有些模糊尤其是面部和文字区域。高清修复的参数不要调太高否则会出现过度锐化的塑料感。我的经验是修复强度控制在 0.3 到 0.5 之间配合轻微的降噪出来的效果比较自然。6. 常见问题与排查技巧实录6.1 主体漂移与特征丢失这是 Ref2VA 最常见的问题。表现是生成视频里的人物跟参考图长得不像或者服装颜色变了。排查思路是先检查参考标签有没有正确锁定主体再检查提示词里有没有跟标签冲突的描述最后检查参考图本身是不是特征不够清晰。我遇到过一次参考图是侧脸生成出来全是正脸。后来发现是提示词里写了“人物转向镜头”模型为了满足这个动作把侧脸特征丢掉了。解决办法是把动作改成“头部微微转动”幅度小了特征就保住了。6.2 画面闪烁与帧间不一致闪烁问题通常跟运动幅度和帧率有关。运动幅度太大时模型在帧与帧之间来不及保持一致性就会出现闪烁。我的解决办法是降低运动幅度同时把帧率提高到 30让过渡更平滑。另外提示词里加“平滑运动”“稳定画面”这类描述也有帮助。还有一种闪烁是光线引起的。如果提示词里写了“光线变化”模型可能会在每帧里都改变光照导致闪烁。这种情况就把光线描述改成“光线保持稳定”或者干脆不写光线变化。6.3 参考图风格被过度覆盖有时候参考图本身风格很强但生成结果却变成了另一种风格。这通常是因为提示词的风格与画质段写得太强势把参考图的风格盖过去了。解决办法是在风格段写“风格对齐参考图”或者干脆删掉风格段让模型自己从参考图里提取风格。我个人的习惯是如果参考图风格明确风格段就只写“对齐参考图”四个字如果参考图风格中性才在风格段里指定具体风格。这样能最大程度保留参考图的原始调性。6.4 生成速度慢与资源占用高Ref2VA 比普通模式吃资源这是正常的。如果觉得速度太慢可以尝试降低生成分辨率或者缩短时长。另外参考图的数量也会影响速度我一般控制在两到三张太多了处理时间会明显增加。还有一个容易被忽略的点参考图的尺寸如果差异很大模型需要额外时间来做对齐。建议把所有参考图统一到相近的尺寸和比例能省不少时间。问题类型典型表现排查顺序解决方向主体漂移面部不像、服装变色标签→提示词→参考图锁定标签、减少冲突描述画面闪烁帧间跳动、光线忽明忽暗运动幅度→帧率→光线描述降幅度、提帧率、稳定光线风格覆盖参考风格丢失风格段→参考图质量对齐参考图、删风格段速度慢生成时间长分辨率→时长→参考图数量降分辨率、缩时长、减图这张表是我自己排查问题时用的速查表基本上覆盖了八成以上的常见问题。遇到新问题的时候我会先往这四类里套套不进去再单独分析。7. 我踩过的坑与独家经验7.1 标签写太满反而坏事刚开始用 Ref2VA 的时候我总觉得标签写得越多越保险一张图能贴七八个标签。结果模型直接“罢工”生成的东西完全没法看。后来才明白标签是给模型划重点重点太多就等于没有重点。现在我的习惯是每张图最多三个标签而且这三个标签必须是最核心的约束其他的一律交给提示词去引导。7.2 六段结构不是越长越好六段结构容易让人产生“每段都要写很多”的误解。我一开始也是每段都写三四句话结果提示词总长度超过三百字模型处理起来很吃力生成质量反而下降。后来我把每段压缩到一到两句话只保留最关键的信息总长度控制在八十到一百二十字之间效果明显好转。提示词的质量在于精准不在于篇幅。7.3 保留分析要动态调整保留分析不是做一次就完事的。我在迭代过程中发现有些一开始觉得“必须保留”的元素其实模型自己就能稳住根本不需要额外约束而有些一开始觉得“可以变化”的元素反而在生成中变得不稳定。所以每迭代一轮我都会重新过一遍保留分析把不必要的约束去掉把新发现的不稳定因素加进去。这个动态调整的过程是提升成片质量的关键。7.4 参考图的选择比提示词更重要这句话可能有点反直觉但确实是我的真实体会。一张好的参考图特征清晰、光线均匀、背景干净模型很容易就能抓住重点一张差的参考图模糊、杂乱、光线诡异你提示词写得再好也救不回来。所以我现在花在选参考图上的时间比花在写提示词上的时间还多。选图的标准就三条主体突出、光线均匀、背景不抢戏。7.5 多参考图的协同要分主次用多张参考图时一定要分主次。我的做法是选一张作为“主参考”承担主体锁定和构图引导的功能其他图作为“辅助参考”只承担风格或材质参考的功能。如果两张图都打主体锁定标签模型就会不知道该听谁的结果就是两个主体的特征混在一起出来一个四不像。主参考只能有一张这个原则我从来没破过例。8. 进阶玩法把 Ref2VA 用出导演台的感觉8.1 用参考标签模拟分镜控制熟悉了基础流程之后我开始尝试用参考标签来模拟分镜控制。具体做法是给不同参考图打上不同的“镜头角色”标签比如“主参考-中景”“辅助参考-特写”“辅助参考-远景”然后在提示词的镜头段里写“从远景过渡到中景再切特写”。这样模型在生成时会参考不同图片的构图信息来构建镜头变化出来的效果有点像简易版的分镜脚本。这个玩法对参考图的要求比较高需要准备同一主体在不同景别下的图片。但一旦跑通能实现的镜头语言就丰富多了。我拿这个思路做过一个产品展示视频从全景到特写再到全景过渡很自然客户看了还以为我是用专业分镜软件做的。8.2 结合导演台工作流的思路如果你用过 H3 的导演台功能会发现 Ref2VA 的六段结构跟导演台的分镜逻辑其实是可以打通的。导演台是把视频拆成多个镜头分别生成再拼接而 Ref2VA 的六段结构是在单个生成任务里模拟多个镜头的切换。两者结合的做法是用导演台规划整体分镜每个分镜用 Ref2VA 加六段结构来生成最后在导演台里拼接。这样做的好处是每个分镜的参考一致性都能单独控制不会因为一个分镜出问题影响整条片子。缺点是工作量比单次生成大适合对质量要求高的项目。我一般只在商业项目里用这个流程个人练习还是单次生成居多。8.3 高清修复与后期衔接Ref2VA 生成的结果直接输出的话细节上可能差口气。我的后期流程是先做一次轻度的高清修复再做一次色彩微调最后加一点颗粒感来统一质感。高清修复的参数前面说过了色彩微调主要是把参考图的色调再拉回来一点因为生成过程中色调可能会有偏移。颗粒感不要加太多一点点就够了目的是让画面看起来更自然不是做旧。后期这一步看起来跟提示词改写没关系但实际上如果你在提示词阶段就把光线和色调描述得很准确后期需要调整的幅度就很小画质损失也更少。所以提示词写得好后期省一半事这话不夸张。8.4 批量生成的参数管理做系列视频的时候我会把六段结构做成模板只替换主体描述和动作描述其他四段保持不变。这样能保证系列视频的风格一致性同时减少重复劳动。参数方面我会固定随机种子范围、运动幅度和帧率只调整提示词内容。批量生成时建议先跑三到五个测试确认模板没问题再全量跑不然批量出废片很浪费时间。模板管理有个小技巧把六段结构存成文本片段用的时候直接调用避免每次重新写。我自己的模板库里存了十几套不同场景的六段结构人物类、产品类、风景类都有用的时候改几个词就能跑效率提升很明显。9. 一些关于工具链和环境的零散经验9.1 本地部署与在线使用的取舍Ref2VA 在本地部署和在线使用之间体验差异主要在处理速度和批量能力上。本地部署的优势是批量生成方便不用排队适合需要大量迭代的场景在线使用的优势是省去了环境配置的麻烦适合快速验证想法。我自己的做法是前期用在线快速试提示词确定方向后再转到本地批量生成。本地部署对硬件有一定要求显存建议不低于 12GB否则处理高分辨率参考图时会比较吃力。如果显存不够可以降低参考图分辨率或者减少同时加载的参考图数量。在线使用的话注意一下单次生成的时长限制太长的视频可能需要分段生成再拼接。9.2 整合包与工作流的选择市面上有一些整合好的工作流包把 Ref2VA 的各个步骤串起来了。我的建议是如果你刚接触 Ref2VA先用原生流程走一遍搞清楚每个环节在做什么再去用整合包。不然出了问题你都不知道该从哪里排查。整合包适合已经熟悉流程、想提升效率的人。选择整合包的时候重点看它有没有把参考标签和六段结构的输入界面做好。如果整合包只是把参数堆在一起没有做结构化的输入引导那用起来跟原生流程差别不大。好的整合包应该能引导你按六段结构来写提示词并且自动检查标签冲突。9.3 版本更新与兼容性注意H3 的版本更新比较频繁每次更新后 Ref2VA 的行为可能会有细微变化。我的习惯是更新后先跑一组基准测试用固定的参考图和提示词生成一遍对比更新前后的结果。如果发现一致性下降或者出现新的问题就回退到上一个版本等下一个版本再试。另外不同版本对参考标签的解析方式可能不同。我遇到过某个版本突然不认“锁定面部”这个标签了换成“面部参考”才正常。所以更新后如果发现标签失效先试试换个写法不一定是模型坏了。10. 最后分享几个提升成功率的小习惯第一个习惯是每次生成前花两分钟做保留分析把必须保留、尽量保留、可以变化的三档元素列出来。这两分钟能省下后面二十分钟的反复生成。第二个习惯是提示词写完后朗读一遍看看有没有前后矛盾的地方。朗读能发现默读时忽略的逻辑冲突尤其是标签和提示词之间的冲突。第三个习惯是每轮迭代只改一个变量。同时改多个变量的话你永远不知道是哪个改动起了作用也没法积累经验。第四个习惯是建一个自己的案例库把成功的参考图、标签、提示词、参数都存下来。下次遇到类似场景直接调用改一改就行不用从零开始。第五个习惯是不要追求一次完美。Ref2VA 的生成有随机性同样的输入不同种子结果可能差很多。我的做法是每轮生成三个结果挑最好的那个作为基准继续迭代而不是死磕一个结果反复重跑。这些习惯看起来都是小事但积累下来我的成片率从最开始的三成提升到了现在的七成以上。Ref2VA 这个模式说到底是一个需要耐心调教的工具你花时间理解它的脾气它就会给你稳定的回报。