
AI短剧并不是一个噱头概念而是一条已经可以量产化的内容生产线。所谓AI短剧是指通过AI完成剧本创作、角色设定、分镜画面、动态视频、配音和剪辑等核心环节的影视级内容制作方式。相比传统影视拍摄它把剧组、摄影棚、演员等重资产替换成了提示词、模型和渲染流程一个人或一个小团队也能完成过去需要十几人协作的短片项目。这篇文章会围绕“剧本人设 - 分镜渲染 - 动态成片 - 配音剪辑”这条完整链路从0到1拆解一套可复制的AI电影/短剧生产流程并给出提示词模板、参数表、分镜表结构、排错路径和效率清单。整个流程的核心判断是AI短剧不是“让AI一次性生成一部电影”而是把影视制作拆成多个可验证的小环节每个环节有明确的输入、输出和验收标准。搞清楚了这条链路你既可以手工一步一步做也可以后续把它脚本化、批量化和模板化。1. 先看懂AI短剧的完整生产链路再决定从哪里开始1.1 一条AI短剧生产线由六个环节构成AI短剧生产的本质是把传统影视制作中的“创意策划、编剧、选角、美术、摄影、表演、录音、后期”压缩成一条可复算的数字流水线。按信息流向拆可以分成六个环节剧本人设用大语言模型写剧本核心冲突、情节走向、台词和角色设定。这一环节输出文字。分镜设计把剧本拆成镜头表明确镜号、景别、画面描述、台词、时长和字幕。分镜渲染用文生图或图生图模型把分镜描述转成静态画面也就是AI短剧的“底片”。动态成片用图生视频模型让静态画面动起来包括人物动作、镜头推拉、环境动态。配音音效用TTS合成台词语音加入环境音、音效和背景音乐。剪辑合成把所有片段按时间轴排列配字幕、转场、调色最终导出成片。环节之间的关系可以用下面这张表概括环节输入输出核心风险剧本人设故事梗概/灵感剧本、台词、角色卡剧情平淡、台词过长分镜设计剧本分镜表镜头缺失、景别混乱分镜渲染分镜表静态画面角色不一致、比例错乱动态成片静态画面视频片段人物形变、运动幅度过大配音音效台词文本音频文件情感平淡、断句错误剪辑合成视频/音频/字幕完整短片节奏拖沓、素材对不齐新人最容易犯的错误是跳过中间环节直接“让AI出一个视频”。结果往往是画面好看但讲不清故事或者角色每帧一个样。理解了六个环节后面的每一步才有明确输入输出和验收标准。1.2 链路顺序决定返工成本先有台词再出画面按顺序推进不是流程洁癖而是成本控制。六个环节里文字改动成本最低画面重生成成本中等视频重生成成本最高剪辑重排是最后一道成本闸门。如果先出画面再补台词一旦剧情调整分镜、画面、视频全部重来。推荐的项目节奏是三步走先把剧本和角色卡定死台词全部写完再进入分镜。分镜表评审通过后再逐镜渲染画面。画面质检通过后再逐镜生成视频。这里的检查点很关键每个阶段结束时都要有一个可确认的产物而不是直接进入下一阶段。例如分镜表评审时重点看镜头数量是否撑得起时长、台词是否和画面描述匹配画面质检时重点看人物是否还是同一个人、构图是否给字幕和动态留了空间。注意所谓“定死”不是不能改而是要有一个受控的修改流程。剧本改一个字要清楚它会影响哪几个镜头、哪些画面和哪些视频避免改了台词却忘记重出对应画面。1.3 一致性是AI短剧质量的分水岭AI短剧和AI绘画单图之间最大的区别是“角色要在多个镜头里是同一个人”。观众对脸的变化非常敏感同一角色在不同镜头里换发型或换外套观感会直接从“成片”跌回“素材集”。一致性至少有三层角色一致性脸型、发型、服装、配饰在不同镜头里保持一致。场景一致性同一个场景的光线、色调、道具布局不能跳跃。风格一致性全片保持同一种影调、镜头语言和画质质感。支撑一致性的手段包括固定随机种子、复用同一张角色参考图、把角色特征写进每个绘图提示词、训练角色LoRA以及最后在剪辑阶段统一调色。后面各章节会分别展开。2. 开工前准备工具分层、硬件判断与素材规范化2.1 按环节选择工具不要指望一个工具包办全部AI短剧生产是组合式工作流没有哪个单一工具能同时把剧本、画面、视频、配音做到最好。合理的做法是按环节选工具再通过统一的文件格式把它们串起来。相关工具迭代很快下面的工具分类只用于说明选型思路落地前要确认当前版本的支持范围。环节工具类别选型要点剧本大语言模型上下文长度、中文表达、输出结构化程度绘图文生图/图生图模型对中文提示词理解、角色一致性支持、可控参数视频图生视频模型运动幅度控制、生成时长、分辨率、稳定性配音语音合成TTS中文音色、情感、停顿、语速、导出格式剪辑视频剪辑软件字幕自动对齐、多轨道、模板、导出参数选型建议是“绘图和视频环节各选一个主力工具其他环节选顺手即可”。不要频繁切换主力工具因为每换一个工具风格和参数都要重新调教调教成本比大多数人预想的高。2.2 硬件要求分三档先判断本地渲染还是在线生成如果走本地Stable Diffusion或ComfyUI路线显卡显存是核心变量。以常见经验值划分显存档位建议生成分辨率适合工作说明8GB以下512x768以内分镜草稿、局部重绘生成速度慢适合学习8GB-12GB768x1024单镜头成图开启图生图和重绘比较从容12GB-16GB1024x1792批量渲染与微调LoRA接近日常生产力配置16GB以上更高分辨率训练/微调、较大批次生成可作为团队渲染机如果选择在线工具好处是没有显卡门槛缺点是排队、额度、风格可控性弱。学习阶段建议用在线工具先跑通全流程确认自己能产出完整短剧后再决定是否投入本地渲染。本地渲染的投入不仅是显卡还包括环境配置、模型下载和提示词调教时间这部分成本很容易被低估。2.3 建好项目目录和命名规范后面批处理才不混乱一个短剧项目涉及的素材数量比想象中多。以60秒竖屏短剧、12个镜头为例至少会有12张以上原始分镜图、12段以上动态视频、10段以上音频、1个字幕文件和若干版本的剪辑工程。没有命名规范第三天就会认不出文件。建议目录结构如下movie_proj/ ├── 01_script/ │ ├── script_v1.md │ ├── script_v2.md │ └── character_card.md ├── 02_storyboard/ │ ├── storyboard_v1.csv │ └── prompts/ │ ├── shot_001.txt │ ├── shot_002.txt │ └── ... ├── 03_frames/ │ ├── shot_001_001.png │ ├── shot_001_002.png │ └── ... ├── 04_video/ │ ├── shot_001_v1.mp4 │ └── ... ├── 05_audio/ │ ├── vo_001.mp3 │ ├── bgm.mp3 │ └── sfx/... ├── 06_edit/ │ ├── cut_v1.mp4 │ └── movie_v1.prproj └── 00_ref/ ├── style_ref.png └── char_lin_shen.png命名推荐格式是“序号_内容_版本或参数”例如shot_001_face_v2.png。文件名里包含镜号和版本便于自动化脚本批量读取也便于出问题时定位是哪一个镜头、哪一个版本的底片导致返工。2.4 先固化风格关键词包让每一帧都出自同一套审美很多人的AI成片像“拼图秀”问题出在换一个镜头换一套风格词。正确做法是先定义全片的视觉锚点把风格词固化成一段可复用的提示词片段拼到每一个分镜提示词后面。一个示例风格锚点cinematic film still, realistic natural lighting, teal and orange color grade, 35mm lens, shallow depth of field, fine film grain, high detail, vertical composition, 9:16, safe margin for subtitles这段描述的关键作用有三个确定画幅竖屏9:16、确定影调青橙调、胶片颗粒、确定镜头语言35mm、浅景深。每个镜头生成时都追加这个片段全片风格就会统一。风格锚点要根据实际生成效果持续修订不要一上来追求一步到位。3. 从0到1实现剧本人设写脚本、抽角色卡、锁定定妆图3.1 用AI生成剧本前先给它五条硬约束让大语言模型写剧本直接问“帮我写一个短剧剧本”通常得到的是流水账。原因是缺乏约束时模型会按通用套路输出冗长对白和过多场景。对短剧来说时间短、镜头少每一句台词都要承担信息量。一个可参考的提示词模板你是短视频编剧。根据下面的故事梗概输出一集时长约60-90秒的竖屏短剧脚本。 要求 1. 场景控制在3个以内镜头数控制在10-15个。 2. 每句台词不超过20个字适合配音。 3. 每个镜头输出镜号、景别、画面内容、台词、字幕、预估时长。 4. 至少设置3个情感起伏点。 5. 结尾保留悬念为下一集铺垫。 故事梗概一个外卖骑手发现顾客是十年前失踪的姐姐。模板里最容易被忽略的是“适合配音”和“预估时长”。台词超过20个字配音会赶、清晰度下降没有预估时长剪辑时无法估算总时长。脚本生成后还要人工过一遍删除解释性对白保留动作和冲突。3.2 抽取角色设定卡字段越具体越不容易跑偏剧本通过后把主角和重要配角抽出成角色设定卡。角色卡不只是给编剧看的更是给绘图模型提供约束的。字段要尽量具体字段示例绘图用途姓名林深文件命名与提示词引用年龄/性别27岁男性年龄感发型黑色短发微卷防止换发型五官下颌线明显单眼皮防止换脸服装深灰色风衣银色手表防止换装性格标签沉默、敏锐行为表现说话风格话少、句尾简短配音情绪角色卡写好后要把“外貌服装”压缩成一段固定的角色描述块每次绘图都复制同一段而不是每次重新描述。角色描述块越长越不稳定重点是“可识别的少数特征”通常三到五句足够。3.3 生成定妆图并用参考图锁定角色有了角色卡下一步生成定妆图。定妆图的作用是建立角色的“标准像”后续所有镜头都可以拿它当参考图。生成定妆图时建议输出正面全身和近景头像各一张包含三个要素服装、脸型、整体色调。示例定妆提示词character reference sheet, 27-year-old Chinese male, short black wavy hair, angular jaw, single eyelid, dark gray trench coat, silver watch, standing centered, front view, full body, neutral expression, studio soft lighting, plain background, photorealistic, 9:16生成多张候选后选定一张作为标准定妆图把它存入00_ref目录。后续所有绘图环节都把这张图作为角色参考图传入图生图模型配合固定随机种子使用。不要每一集都重新生成定妆图否则整部作品的连贯性会断裂。注意定妆图一旦确定就不要在项目中途随意替换。如果确实需要换服装或换造型建议新建一个角色版本而不是直接覆盖旧图否则前面镜头里的角色和后面镜头里的角色就不是同一个人。3.4 角色漂移的三种常见成因和对应解法角色漂移是AI短剧最高频的翻车点成因通常有三种每个镜头都用自己的话描述角色比如这次写“黑色夹克”下次写“深灰外套”模型就会换装。没有使用参考图只靠提示词脸型特征浮动。在同一场景内使用不同的风格锚点角色看起来像不同电影里走出来的人。对应解法是固定角色描述块、固定参考图、固定风格锚点三样同时满足漂移概率会明显下降。如果项目周期长可以考虑训练一个角色LoRA用几十张定妆图把角色特征固化到模型权重里生成速度和稳定性都更好但训练成本也更高。4. 分镜渲染从分镜表到可用画面的完整做法4.1 分镜表要包含哪些字段为什么景别无遗漏分镜表是剧本和画面之间的翻译层。它把一段文字剧情拆成逐镜头的执行指令绘图、视频、配音、剪辑都从这张表取数。推荐字段如下字段示例说明镜号004全局唯一景别中景远景/全景/中景/近景/特写画面描述林深在雨巷回头一句话概括动作台词真的是你吗配音文本字幕真的是你吗与台词一致或简化预估时长4秒决定视频生成长度参考图refs/shadow_rain.png场景或角色参考备注灯光偏冷给渲染和剪辑的说明景别这一列非常容易被忽略。AI模型不理解虚词但“特写”和“远景”是它相对能掌握的视觉概念。分镜表里明确景别才能保证镜头语言有节奏避免全片都是同一个距离的“大头贴”。4.2 把分镜描述改写成绘图提示词的通用公式分镜表里的画面描述通常是大白话不能直接作为绘图提示词。改写提示词的通用公式是“主体动作环境镜头光线风格锚点质量词”。举例画面描述“林深在雨巷回头”改写为full body shot, Lin Shen walking through rainy alley, turning his head back, wet black hair, dark gray trench coat, neon sign reflection on wet ground, night, cold blue rim light, cinematic teal and orange color grade, 35mm lens, shallow depth of field, film grain, photorealistic, 9:16, safe margin for subtitles可以看出角色描述块被完整插入风格锚点被原样拼接。动作放在句子前面环境放在中间镜头和光效放在后面。这个顺序不是绝对的但在多数模型上的表现比较稳定适合作为默认写法。4.3 批量抽卡、局部重绘与比例统一分镜渲染不是一次出图就收工而是“批量抽卡再挑卡”。每个镜头建议至少生成四到六张候选图选择一张构图、表情、比例都过关的进入下一步。抽卡时把所有候选图放在一起对比同一个镜头的候选图之间不要混用否则表情连续性会出问题。选中的画面如果只有局部瑕疵优先用局部重绘inpainting修复而不是整图重来。高频修复点包括手部、文字、脸部和画面边缘。重绘区域不要框得太大否则模型会重画主体。比例统一是整个项目最容易出问题的细节。绘图模型默认输出可能不是9:16必须先确认输出比例。所有镜头必须使用完全相同的分辨率和比例进入后期否则剪辑软件里会出现黑边和拉伸。4.4 进入动态环节前的分镜质检清单画面渲染完成后逐镜过一遍质检清单再进入图生视频阶段。清单应包括角色是否和定妆图一致发型、服装、配饰有没有变化。画面比例是否为统一竖屏9:16分辨率是否符合导出要求。主体是否完整是否有人被裁掉一半的情况。表情和动作是否符合分镜表描述情感是否连贯。构图是否给字幕留出了安全区上下边缘是否有重要内容。风格锚点是否生效光线和色调是否和上一镜头衔接。注意质检不要只在生成工具里匆匆看过而是把候选图导入剪辑软件的时间轴按分镜顺序逐帧预览。这样做能尽早发现跨镜头的色彩和构图断层提前统一处理。5. 动态成片、配音与剪辑把静止画面变成有节奏的短片5.1 图生视频先控制运动幅度再追求镜头运动图生视频是把静态分镜图变成动态成品的关键环节也是翻车最集中的环节。常见翻车是人物形变、面部扭曲、动作不合理。多数情况下问题出在“给的运动幅度太大”。进入图生视频时的建议参数参数学习环境建议值说明运动幅度低到中幅度越大越容易形变生成时长3-5秒短片段更容易稳定分辨率1080x1920附近按模型支持范围选择帧率24或30与最终成片一致尾帧可选需要固定结尾时使用随机种子固定方便复现和调整建议“小幅度优先”。如果想让镜头有推进感可以让主体保持基本静止由镜头推拉或环境光影变化提供“动感”这一策略的成功率远高于让角色做大动作。角色如果需要转头或走动拆成多个小动作短镜头中间用剪辑衔接比一步到位更稳。5.2 台词配音先断句再调语速和情感配音质量直接影响观看体验。用TTS合成台词时最容易踩的坑是把整句话一次性合成结果语速、断句、情感都不受控制。推荐流程是先断句再合成把台词按语义分成2-5秒一组的短句。每句单独合成得到多段音频。在剪辑时间轴上按分镜时长对齐这些短句。根据剧情需要给关键句选择不同的情感音色或语速。以一个句尾悬念为例角色发现姐姐后可以先合成“真的是你吗”这样一个短句再在剪辑里前面插0.5秒留白让反问前有一瞬间的安静情绪比直接连续合成更强。背景音乐和音效在配音之后加入注意不要让音乐压过台词。5.3 剪辑合成以台词时间轴为主干铺画面、字幕、音乐剪辑阶段的任务不是简单拼接而是把画面、台词、字幕、音乐、音效按节奏组织起来。推荐操作顺序先把配音短句按剧本顺序放入时间轴形成台词时间轴。根据每句台词的时长把对应视频片段铺到下层。为无声段落添加环境音效避免画面“太干”。生成字幕轨和台词严格对齐。最后加入背景音乐音乐音量压低到台词音量以下。这样操作的逻辑是台词是短剧的信息主干画面服务于台词所表达的内容。如果先铺画面再放台词常常会出现一个镜头讲两句话、切点错位、结尾没留白等问题。5.4 导出参数与发布前检查导出阶段参数不统一会造成不同平台颜色、清晰度差异。常用导出参考导出项建议值说明分辨率1080x1920竖屏短视频平台主流画幅帧率24或30全程统一编码H.264或H.265兼容性和体积折中码率8-12Mbps清晰度足够且体积可控音频采样44.1kHz或48kHz与配音素材一致发布前再检查一遍字幕是否越界、开头3秒是否足够吸引、结尾是否留下悬念、有没有出现角色漂移的镜头。这一步可以在剪辑软件的预览窗口连续播放两遍再导出。6. 常见问题排查现象、根因和验证顺序6.1 角色脸部不稳定现象同一角色在不同镜头里五官、发型或表情差异明显。可能原因按检查顺序排列角色描述块没有固定每次提示词里写法不一致。没有传入定妆参考图或参考图位置选错了。种子不固定同镜头重试时换脸。风格锚点不同色彩和光影变化造成“换人感”。处理方式先把角色描述块统一成一段固定文本再把定妆图作为参考图最后固定种子重新生成。仍不稳定时考虑训练角色LoRA。6.2 画面比例和构图错乱现象部分镜头是横图部分是竖图或主体被裁切字幕区被占满。原因通常是出图时没有锁定比例或分镜表里没有标注安全边距。排查时检查生成参数中的宽高比是否为统一9:16预览时检查画面上下边缘是否有字幕空间。解决办法是统一生成参数并在绘图提示词末尾写safe margin for subtitles。6.3 口型、时长和音频对不齐现象配音已经结束画面还在动或一句台词对应了明显不匹配的口型。原因是台词和画面的时长计算没有前置到分镜表。排查时打开分镜表的“预估时长”列对比实际视频片段时长和配音时长。处理方式是回到配音环节按句分段再在剪辑软件里拖动画面切点对齐语音波形。追求口型对齐时优先选择短句和近景镜头降低对口型难度。6.4 整体风格跳戏现象前一镜头是夜景冷色调后一镜头是白天暖色调看起来像是两部片子的片段。原因多半是每个镜头使用了不同的风格提示词或者绘图模型版本、参数不统一。排查时把所有镜头的提示词并排对比检查风格锚点是否一致、种子策略是否一致、是否有镜头在生成后被二次调色。处理方式是回到分镜渲染阶段统一调色后再进入剪辑。6.5 排查顺序建议遇到任何翻车按以下优先级检查输入是否正确分镜表字段、提示词、参考图是否对得上。命名和路径文件是否引用错版本。参数是否统一比例、分辨率、帧率、种子。风格锚点是否被意外修改。素材版本画面、视频、配音是否来自同一版分镜。工具差异不同工具的参数语义和默认值不同。多数AI短剧问题不是模型能力不足而是流程环节之间信息丢失导致的。7. 生产级工作流模板固化、版本管理与批处理扩展7.1 用提示词模板和分镜模板固化流程一集跑通后把本项目的提示词模板、分镜表模板、风格锚点、角色卡模板保存成可复用的文件而不是每次从空白开始。这样第二集、第三集的制作时间会大幅下降。分镜表可以直接用CSV维护。示例结构镜号,景别,画面描述,台词,字幕,预估时长,参考图,备注 001,特写,林深在雨巷抬头,三年前的雨也是这么大,三年前的雨也是这么大,3s,refs/rain.png,冷光 002,中景,林深推开门走进面馆,老板老位置,老板老位置,4s,refs/noodle_shop.png,暖光CSV的好处是能用脚本批量读取为下一步自动化批处理打基础。脚本可以遍历分镜表读取每一行的画面描述、参考图和镜头参数调用绘图工具的API生成画面。7.2 素材、种子和提示词都要做版本管理AI生成项目的版本管理比代码项目更容易被忽略。同一个镜头在不同时间生成的结果可能完全不同必须把提示词、种子、参考图、模型版本、参数记录进一张生成日志。一个简单的记录格式{ shot: 001, prompt: full body shot, ..., seed: 20240615, ref: 00_ref/char_lin_shen.png, model: xxx-v6, size: 1080x1920, steps: 30, cfg: 7.0, output: 03_frames/shot_001_v2.png }用文件记录或版本管理工具保存这些日志。出问题时可以按种子重现失败现场也可以快速选回上一版最优结果。没有日志的情况下AI生成项目只能靠记忆和翻目录越到后期越难维护。7.3 学习环境与批量生产环境的区别学习阶段建议“小、少、快”做一集60秒以内的短片镜头控制在8-12个重点跑通完整链路不追求每帧完美。批量生产阶段则需要额外保障配置外置化工具版本、模型路径、生成参数不要散落在各个界面里。批处理脚本用API或自动化工具批量渲染分镜图降低人工重复操作。监控和告警生成失败、显存不足、额度耗尽要及时看到。素材备份原图、视频、音频、工程文件定期备份。回滚方案保留上一版成片避免更新模型后全片返工。注意生产环境下“稳定性优先于炫技”。能稳定复现的效果比偶尔惊艳但不可复现的效果更有价值。每次更换模型或调整参数前先跑一个镜头样例确认影响范围再决定是否全片切换。7.4 从短剧延伸到广告、宣传片和漫剧AI短剧的生产链路稍作调整可以复用到其他类型的内容。广告片通常时长更短更依赖产品视觉一致性和节奏感宣传片重点在场景真实感和旁白情绪AI漫剧则把实拍质感换成动画质感把角色参考图换成二次元风格。核心差异是风格锚点和素材规范流程骨架是同一套。如果要做批量产出建议先跑通一个容易量化的环节例如“分镜图批量生成”再逐步扩展到视频和音频的批处理。扩展过程中持续归档每个项目的模板和日志慢慢形成自己的素材库。最后给一条最实用的建议不要等工具和环境都完美了再开始。先用一个3分钟以内的短剧样板走通全流程记录每个环节的实际耗时、失败点和可复用模板。这套“样板模板日志”的组合才是AI短剧制作真正可持续的部分。下一部作品的质量提升不是靠换一个更贵的模型而是靠把上一部踩过的坑沉淀到流程里。