
拍短片之前先想清楚一件事MiniMax H3 这代视频生成模型的能力上限已经被大量实测逼得很高了。真正拉开差距的地方不在模型本身而在你喂给它的提示词结构。很多人抱怨生成结果不稳定画面像 PPT 切换角色一会一个样多数时候不是 H3 不行而是你还在用两三句话碰运气。这篇文章要解决的就是这件事怎么用 LLM 的思路把一句话灵感升级成一套专业的导演分镜提示词。我会给出一个可以复用的 Skill 结构并且把它定义成提示词管家 智能分镜 脑洞模式/强遵循度模式的组合。你不需要会用导演术语也不需要手动编排每个镜头只要把想法丢进去就能得到一份接近专业分镜脚本的 H3 提示词。先给出我的判断MiniMax H3 提示词写作正在从写作文变成写代码。传统的自然语言描述已经不够用你需要的是结构化、分层、带控制字段的提示词方案。谁先建立这套方法谁就能稳定产出高质量 AI 短片。1. 提示词不是越长越好H3 的真正瓶颈如果你已经把 MiniMax H3 玩过几轮大概率遇到过以下情况提示词写得很详细画面却还是混乱。把光照、机位、镜头运动全塞进一句话生成结果直接忽略后半段。角色在第一个镜头是黑色外套到第三个镜头突然变成白色。镜头切换像幻灯片完全没有电影的流动感。问题出在哪很多人认为提示词越详细模型越听话于是把能想到的视觉元素全部堆进去。但在 H3 这类视频生成模型中提示词解析更像是有损编码。模型会先抓取高频关键元素再放弃低优先级细节。你的描述一旦没有主次它就会按自己的理解随机组合结果就是失控。从模型原理角度看H3 要做的事很多文本语义理解、第一帧构图、运动估计、时序一致性、光影渲染。这些任务同时竞争有限的注意力资源。如果你的提示词没有用清晰的分层结构告诉模型先看什么、再看什么、最后补充什么它就只能平均用力。平均用力的结果就是什么都生成了一点但什么都不精确。真正的提示词瓶颈是结构缺失。你需要把一条提示词拆成多个语义槽位比如主体描述环境与背景镜头语言光影与色调运动方式氛围与情绪负面约束每个槽位各司其职模型才能像读配置表一样消费这些信息。这也是为什么 LLM 擅长做这件事它可以把一段口语化灵感自动填入标准槽位生成符合 H3 输入规范的提示词。2. 用 LLM 做导演的核心思路我在文章开头说提示词写作正在从写作文变成写代码这里展开解释一下。传统的视频生成操作路径是这样的你在输入框里写下一段描述然后生成不满意再改再生成。这像是一个人反复对着模型喊话效率很低而且你很难知道模型为什么会失败。引入 LLM 之后路径发生了本质变化一句话灵感 → LLM 根据导演方法论拆分分镜 → 输出结构化镜头序列 → 拼装成 H3 提示词 → 丢进视频生成工具LLM 在中间扮演的并不是翻译机而是一个具备导演知识库的中间层。它可以理解你的创意意图然后按照既定规则做三件事拆分叙事把一句话扩展成起承转合的多镜头脚本。设计镜头语言为每个镜头指定景别、机位、运镜方式。统一视觉一致性固定角色外貌、服装、色调、环境氛围减少跨镜头的冲突。这就是为什么今年 Skill技能概念会火。Skill 听起来很玄本质上是把一套方法论文件注入到 LLM 的上下文中让它在回答时遵循这套方法。你可以把 Skill 理解成一个配置包里面包含了角色设定、输出模板、约束规则和示例。没有 Skill 的 LLM 是通用助手有了 Skill 的 LLM 才是专属领域的执行者。对 MiniMax H3 提示词这个场景来说Skill 的作用就是内置一套导演方法论。你不需要每句话都告诉 LLM 什么是景别、什么是运镜它会按 Skill 里定义的规则自动处理。顺带说一个容易混淆的点Skill 不是插件也不需要在本地运行模型。它只是一段结构化文本通常是 YAML、Markdown 或 JSON 格式通过提示词注入到 LLM 对话中。你完全可以在任何支持长上下文的 LLM 平台里使用也可以写脚本调用 API 时手动拼接。3. 什么是 Skill给 LLM 装上一套导演方法论Skill 的核心是将隐性经验显性化。每个熟练的提示词工程师脑子里都有一套什么该写、什么不该写、按什么顺序写的规则但这些东西很难复制给别人。Skill 就是把这套规则写下来整理成文件然后随时让 LLM 加载。一个 MiniMax H3 导演 Skill 至少要包含以下部分模块作用说明角色定义设定 LLM 扮演的身份例如资深影视导演与分镜师镜头语言规则定义景别、运镜、机位的使用规范每个镜头必须包含这些字段视觉一致性规则规定角色、服装、环境、色调的写法避免跨镜头漂移输出模板规定分镜脚本的排版结构方便后续拼装提示词负面约束告诉 LLM 哪些描述要避免例如不要生成文字字幕运行模式脑洞模式与强遵循度模式控制创意的随机性和结构化程度Skill 的启动方式也很简单。你可以把它放在 system prompt 里也可以在每次对话开头手动加载。实际工程中更推荐后者因为这样不会污染通用对话能力只在需要时触发。下面是一个简化版的 Skill 定义示例我用 YAML 来写。这个文件可以直接放入你的提示词工程库也可以作为 LLM 调用的 system prompt 模板。# 文件路径skill_director.yaml name: MiniMax H3 导演技能 description: 将创意灵感转换为 H3 可用的专业分镜与提示词 role: | 你是一名资深影视导演与分镜师熟悉电影镜头语言、灯光设计和视觉叙事。 你的任务是将用户的一句话创意扩展为完整的镜头序列 并输出符合 MiniMax H3 视频生成模型输入规范的提示词。 modes: creative: name: 脑洞模式 temperature: 0.9 description: 适合概念探索、视觉风格试验允许更大胆的意象和镜头组合。 strict: name: 强遵循度模式 temperature: 0.3 description: 适合需要严格按分镜执行的项目输出更规范减少意外生成。镜头语言规范shot_fields: - id: 镜头编号 - scene: 场景描述 - shot_size: 景别如特写、近景、中景、全景、远景 - camera_movement: 运镜方式如固定、推、拉、摇、移、跟、升降 - subject: 主体动作描述 - lighting: 光线与色调 - atmosphere: 氛围与情绪 - duration: 建议时长秒H3 推荐单镜头 5-8 秒一致性规则consistency: character: 每个镜头中主角外貌、服装、发型必须保持一致使用相同描述词。 environment: 环境配色、标志性元素、天气状态在每个镜头中保持一致。 color_grade: 整体色调确定后不要随意改变例如霓虹赛博、暖黄复古、冷灰写实。负面约束negative_prompt: - 画面中不要出现文字、字幕或水印 - 避免肢体畸形、多手指、脸型崩坏 - 避免镜头间角色服装突变 - 避免突然出现的无关物体输出模板## 分镜脚本 镜头 1 景别全景 运镜缓慢推进 主体... 光线... 氛围... ## H3 提示词 将镜头 1 的输出拼接为一段连续自然语言并加入 H3 输入规范要求的字段。把这个 Skill 加载给 LLM 后你再输入一只橙猫在雨夜屋顶上奔跑它就会自动进入导演模式输出一套完整的分镜脚本。这就是 Skill 的价值把个人经验变成可复用的生产工具。4. 环境准备你的 AI 短片工作台需要哪些组件要跑通这套流程你不需要一台特别强的电脑。MiniMax H3 本身是云端模型本地只负责调用 API 或使用官方工作台。你真正需要准备的是一套创意生产链路的软件环境。4.1 硬件与操作系统操作系统Windows / macOS / Linux 均可不影响核心流程。本地电脑普通办公配置即可。如果后续要用 ComfyUI 做更复杂的管线建议内存 16GB 以上、显卡 8GB 显存以上但这不是必须的。4.2 软件与账号MiniMax 官方视频生成工作台或开放平台账号用于最终生成视频。一个支持函数调用或长上下文的 LLM API例如国内主流大模型厂商的 API或者你已经在用的 ChatGPT API、Claude API 等。Python 3.8 以上环境用于编写提示词工程脚本。可选参考图。H3 支持参考图输入建议准备一张角色设定图或场景氛围图能明显提升角色一致性。4.3 依赖安装如果你选择用 Python 脚本调用 LLM API可以参考下面的安装命令。这里以 OpenAI SDK 为例其他厂商的 SDK 用法类似。pip install openai如果你不想写代码也可以直接使用支持 Skill 的对话客户端把 Skill 内容粘贴到系统提示词里。两种方式都能达到目的区别只在于脚本方式更适合批量生成和版本管理。4.4 需要准备的文件建议在本地建一个目录把所有提示词工程文件放在一起方便复用ai_short_film_project/ ├── skills/ │ └── director_skill.yaml ├── scripts/ │ └── generate_storyboard.py ├── inputs/ │ └── idea.txt ├── outputs/ │ └── storyboard_001.json └── references/ └── character_ref.png这个目录结构看起来简单但对后续多镜头批量生成、版本对照、失败回滚非常有帮助。强烈建议从一开始就按这个结构组织。5. 核心流程拆解从一句话到专业分镜现在进入正题。把一句话灵感变成H3 可用提示词我把它拆成五个步骤。每一步都有明确输出你可以按顺序执行也可以把中间步骤做成自动化脚本。5.1 输入创意并确定模式首先你需要确定这次创作要走哪条路线脑洞模式适合 MT 类视频、概念宣传片、艺术实验短片。这类视频不追求严格的物理逻辑更看重视觉冲击和意外感。此时 LLM 的温度可以调高提示词中允许出现非常规意象。强遵循度模式适合商业短片、产品展示、剧情叙事。这类视频要求镜头严格符合脚本角色、环境、动作都不能随意漂移。此时 LLM 的温度要调低输出结构要严格受模板约束。例如输入一句话一只橙猫在雨夜屋顶上奔跑身后是霓虹闪烁的赛博都市。脑洞模式可能会产出猫的脚印踩碎了空气中的数据流霓虹灯在雨水中融化城市像呼吸一样明灭。强遵循度模式则会产出画面从远景缓慢推至中景橙猫沿着屋顶边缘奔跑雨水飞溅蓝紫色霓虹光映在猫的侧脸。镜头保持稳定前景有雨丝光斑背景城市楼群清晰可见。两种模式没有绝对好坏关键看你需要什么。我建议你在项目早期用脑洞模式探索风格确定方向后再用强遵循度模式固化执行。5.2 LLM 进行分镜拆分拿到创意后LLM 需要把它扩展成 3-6 个镜头。不要小看这步这是整个流程中信息量最大的一步。一个好的分镜脚本必须覆盖以下信息镜头编号场景位置景别运镜方式主体动作光线与色调氛围与情绪时长以雨夜屋顶奔跑为例LLM 可以拆成 4 个镜头镜头 1远景雨夜赛博城市全貌霓虹灯在雨中闪烁楼顶有一只橙猫的影子在奔跑。镜头 2中景橙猫在屋顶边缘跳跃雨水打湿毛发蓝紫色霓虹光照亮线条。镜头 3特写猫的瞳孔倒映着城市灯光雨滴从胡须滑落慢动作。镜头 4全景猫从屋顶跃过大厦间隙镜头跟随掠过楼群最终落在远处塔楼的灯光上。这个扩展过程看起来简单但它需要 LLM 真正理解起承转合。所以 Skill 中必须定义清楚节奏规则第一个镜头建立环境最后一个镜头收束情绪中间镜头要有信息递进。5.3 为每个镜头生成 H3 提示词分镜脚本是导演视角H3 提示词是模型输入视角。两者不能混为一谈。导演脚本可以写得像散文但 H3 提示词必须尽量结构化并且可以加入负面提示词约束。这是很多新手最容易忽略的地方你有一份精美的分镜脚本但没有把它翻译成模型能消费的格式。H3 提示词通常建议包含主体描述环境描述运镜指令光影与氛围画质与风格后缀如 cinematic, 8k, highly detailed负面提示词在 LLM 生成提示词时我们可以使用一个 JSON 结构让后续自动拼装更可靠。5.4 组装分镜序列单镜头提示词生成后还需要组装成序列脚本。这一步的关键是镜头间的一致性。我会在组装时加入以下规则每个镜头的角色描述必须完全相同包括服装、发色、体型。每个镜头的灯光基调保持一致只允许强度的变化不允许颜色突变。镜头之间的运镜方式要有衔接感不能让观众的视线跳跃得过于生硬。5.5 输入 H3 并迭代最后一步是把组装好的提示词输入 MiniMax H3 视频生成工具。如果你有参考图可以在这一步上传。H3 对参考图的依赖度很高尤其是角色一致性场景一张角色参考图能省去你大量提示词控制工作。生成后不要急于换下一镜。你需要检查每个镜头是否满足景别、动作、光线、氛围四项基本要求。如果不满足优先微调提示词而不是重新随机生成。6. 完整示例Skill 定义 LLM 调用 H3 提示词输出这一节我们用一个完整的最小示例跑通流程。示例任务就是雨夜赛博都市橙猫屋顶奔跑。6.1 Skill 定义文件在项目目录的skills/director_skill.yaml中放入以下内容这是一个精简版本但已经可以运行# skills/director_skill.yaml name: H3 导演提示词技能 description: 面向视频生成模型的创意导演与提示词结构化工具 role: | 你是影视导演和视频提示词工程师。 你负责将用户创意拆解为电影级分镜 并输出可直接用于视频生成模型的提示词。 rules: - 分镜数量控制在 3-5 个节奏要有起承转合。 - 每个分镜必须包含景别、运镜、主体、光线、氛围五个元素。 - 所有镜头中主角描述必须完全一致禁止更改外貌和服装。 - 输出中不要出现文字、字幕、水印。 - 当用户输入创意时先输出分镜脚本再输出 H3 提示词。6.2 调用 LLM 的 Python 脚本下面这个脚本演示如何用 OpenAI SDK 调用 LLM并将输出保存为 JSON。如果你用的是其他厂商 API只要替换 base_url 和 api_key 即可。# scripts/generate_storyboard.py import json import yaml from openai import OpenAI # 读取 skill 定义 with open(skills/director_skill.yaml, r, encodingutf-8) as f: skill yaml.safe_load(f) system_prompt skill[role] \n \n.join(skill[rules]) client OpenAI( api_keyYOUR_API_KEY, base_urlYOUR_LLM_API_BASE_URL, # 以实际服务商为准 ) def generate_storyboard(idea: str, mode: str strict): prompt f创意{idea}\n运行模式{mode}\n请输出分镜脚本和 H3 提示词。 response client.chat.completions.create( modelgpt-4o, # 替换为你的模型名 messages[ {role: system, content: system_prompt}, {role: user, content: prompt}, ], temperature0.3 if mode strict else 0.9, ) return response.choices[0].message.content if __name__ __main__: idea 一只橙猫在雨夜屋顶上奔跑身后是霓虹闪烁的赛博都市 result generate_storyboard(idea, modestrict) with open(outputs/storyboard_001.md, w, encodingutf-8) as f: f.write(result) print(result)6.3 预期输出示例运行脚本后输出内容大致如下。这里展示的是核心部分实际内容会根据 LLM 版本和问题描述略有不同。## 分镜脚本 镜头 1 景别远景 运镜缓慢推近 主体雨夜中的赛博都市楼顶边缘有一只橙猫在奔跑 光线蓝紫色霓虹灯雨雾弥漫灯光反射在湿滑屋顶 氛围冷峻、孤独、充满未来感 镜头 2 景别中景 运镜跟随 主体橙猫跳跃过屋顶间隙雨水打湿的毛发根根分明 光线头顶路灯洒下冷白光两侧霓虹闪烁 氛围紧张、急促 镜头 3 景别特写 运镜固定 主体橙猫瞳孔倒映城市灯火雨滴从胡须滴落 光线光线在瞳孔中形成微小光斑 氛围安静、神秘 ## H3 提示词 镜头 1cinematic shot, wide shot, a rainy cyberpunk city at night, an orange cat running on a rooftop edge, neon signs flickering in blue and purple, rain and mist, reflections on wet roof, slow dolly in, moody atmosphere, highly detailed, 8k 镜头 2cinematic shot, medium shot, following an orange cat jumping across a roof gap, wet fur, cold white light from street lamps above, neon lights flashing on both sides, tense atmosphere, highly detailed, 8k 镜头 3cinematic shot, close-up, the orange cats pupils reflecting city lights, raindrops falling from its whiskers, bokeh lights in background, quiet and mysterious atmosphere, highly detailed, 8k6.4 最终输入 H3 的提示词在 MiniMax H3 工具中你可以直接粘贴上面的单镜头提示词也可以把所有镜头拼接成一个长提示词。我更推荐单镜头生成因为每个镜头独立控制后续替换失败镜头时不影响其他镜头。如果你选择拼接需要注意在镜头之间使用逗号分隔并在每个镜头描述后加上同样的一致性描述例如 same orange cat with wet fur。cinematic shot, wide shot, a rainy cyberpunk city at night, an orange cat running on a rooftop edge, neon signs flickering in blue and purple, rain and mist, reflections on wet roof, slow dolly in, moody atmosphere, highly detailed, 8k7. 验证你的提示词是否合格生成完成后不要只看像不像。你需要一套能落地的验证标准。按照下面四项来检查基本能覆盖 80% 的问题。7.1 结构检查打开你生成的提示词检查是否覆盖了以下槽位主体是谁是否明确环境在哪是否有空间感光线是什么颜色、什么方向镜头怎么动氛围是什么情绪只要有一项缺失提示词就算不合格。这时候不要急着重新生成先在缺失的槽位补一句有信息量的描述再进 H3。7.2 一致性检查对比同一项目的多个镜头检查角色描述是否完全一致。常见错误是镜头 1 写 orange cat镜头 2 写 a cat到镜头 3 又变成 the cat。这种细微差异会导致角色漂移。批量生成时建议把角色描述定义为变量所有镜头共用同一份描述。7.3 输出质量检查H3 生成后逐镜头检查主体动作是否符合提示词光线是否出现异常色偏镜头之间是否有明显跳变画面中是否出现多余物体如果出现轻微问题优先修改提示词里的对应槽位而不是整体推翻重来。例如光线不对只需要把 lighting 字段替换掉。7.4 负面约束检查把负面提示词也纳入验证清单no text, no subtitles, no watermark, no deformed hands, no mutated face, no inconsistent clothing如果生成结果出现文字、水印、肢体错乱不要只删提示词要检查负面提示词是否真的被注入到了请求里。很多工具在界面上有单独的负面提示词输入框很容易被忽略。8. 常见问题与排查方法这里整理了我认为最容易踩的 8 个问题。你可以直接对照排查。问题现象可能原因排查方式解决方案角色外观每镜头都变角色描述不一致对比各镜头主体字段将角色描述统一为固定变量镜头像照片没有运动感缺少运镜指令检查是否写了推拉摇移加入 dolly in/tilt up/pan 等运镜词画面偏暗或曝光过度光线槽位描述不足检查灯光方向与颜色补充明确光源和亮度描述生成结果包含文字未设置负面提示词检查负面提示词输入框加入 no text, no subtitles跳切严重前后镜头无衔接分镜之间缺乏连续性检查上一镜结尾与下一镜开头添加过渡镜头或保持运镜一致主体动作幅度过大导致崩坏动作描述过于复杂简化动作语义把一个动作拆成两个镜头角色与环境比例失调缺少景别与空间描述检查是否只有主体没有环境补充环境与空间关系如 wide shotAPI 调用超时或返回报错请求字段格式不对查看返回错误信息核对 model、temperature、message 字段需要提醒的是H3 这类模型的生成本身具有随机性。即使是同一条提示词多次生成结果也会不同。所以排查问题时要看趋势不要因为一次失败就断定提示词不可用。至少跑 3 次取相对稳定的表现来判断。9. 最佳实践与工程建议到了这一步你已经能跑通一句话到 AI 短片的流程。如果只是尝鲜到这里已经够了。但如果你想把它变成可复用的生产流程下面这几条会很有帮助。9.1 把角色描述固化为常量不要把角色描述在每个提示词里重写而是抽成常量。在 Python 中甚至可以放进配置字典CHARACTER { description: an orange cat with wet fur and blue eyes, clothing: no clothing, natural animal, features: slim body, medium length tail, }拼装提示词时直接使用CHARACTER[description]。这样既保证了跨镜头一致性也方便后续整体更换角色。9.2 建立分镜版本管理AI 短片和写代码一样需要版本管理。每次生成的分镜脚本、提示词、成片链接全部按项目命名归档。建议使用project_001/ ├── v1_storyboard.md ├── v1_prompt_01.txt ├── v1_prompt_02.txt ├── v1_output.mp4 └── notes.md不要等到第三次修改才发现第一个版本其实最好但你已经找不到第一个版本的内容。9.3 善用参考图MiniMax H3 对参考图的支持是提升一致性的捷径。建议你开拍前先准备两张图角色参考图正面、全身、单一背景。场景氛围图主场景的色彩、构图、光线参考。有了参考图即使提示词写得不够精细模型也能靠图像信息把角色和环境对齐。但要注意参考图不要用来做多人物混搭否则模型会混淆主体。9.4 控制镜头时长H3 单镜头生成时长通常不宜太长。更稳妥的做法是单个镜头 5-8 秒一个短片控制在 4-8 个镜头。超过这个范围生成失败的概率和后期剪辑成本都会明显上升。先做 15-30 秒的短片再扩展成长片。9.5 学会使用强遵循度模式做内容锁定当项目进入执行期尤其是商业交付时一定要用强遵循度模式。它会把 LLM 的温度调到较低让输出的分镜结构更稳定减少随机发挥。脑洞模式则留到前期创意探索阶段因为那里需要的是意外感不是可控性。9.6 不要迷信万能提示词模板最后这点很关键。网上流传着很多H3 万能提示词模板或NSFW 提示词这类模板的问题在于它们没有经过你自己的场景验证。真正的专业提示词必须针对你的主体、环境、光线、运镜目标做定制。模板的作用是告诉你字段结构而不是直接复制就能用。MiniMax H3 的出现把视频生成的门槛大幅降低了。但门槛低不代表上限低。最终作品能到什么水准仍然取决于你有没有一套稳定的方法论。Skill 的价值就在这里它把你的创作流程、导演知识和避坑经验固化下来让每一次生成都站在之前的最佳实践之上。如果你想继续深入下一步可以尝试三件事一是用脚本批量生成多组提示词建立自己的 A/B 测试集二是把参考图策略做得更细比如多角度角色表三是把多个镜头用剪辑工具拼起来加入音效和配乐验证成片节奏。这套流程跑顺之后你不需要等模型升级也能稳定输出高质量 AI 短片。