
做AI短剧、AI电影现在已经不是有没有工具的问题而是有没有一套完整工作流的问题。剧本、人设、分镜、动态成片、配音、剪辑每一步都有对应工具但每一步之间怎么衔接、角色一致性怎么控制、批量素材怎么管理、最终成片怎么验证才是真正拉开差距的地方。这篇教程按“剧本人设 - 分镜渲染 - 动态成片 - 配音剪辑”的完整链路拆开讲从0到1给出可执行的制作流程、提示词模板、目录结构和排错思路。想入局AI影视创作赛道的开发者、内容创作者或者想给团队搭一套标准化AI内容生产流程的人可以直接对照着操作。1. AI电影/短剧制作链路全景速览AI影视创作不是某一个模型完成的而是多个工具串联成的流水线。先把整条链路看清楚再一步步落地。环节核心任务常用工具类型门槛等级剧本人设生成剧本大纲、人物设定、对白、场景描述大语言模型LLM低分镜渲染把剧本拆成分镜表生成角色参考图和分镜画面文生图模型 ComfyUI / SD WebUI中动态成片把静态分镜变成动态视频片段控制运动与运镜图生视频模型 / 视频生成平台中高配音剪辑生成配音、添加字幕、配乐、混音和最终剪辑TTS 模型 剪辑软件 / ffmpeg中这条链路有几个关键特点角色一致性是核心难点。同一角色在不同分镜里必须长得一样所以要建立角色参考图资产而不是每次都重新生成。分镜是连接剧本和成片的桥梁。AI生成视频的随机性很强没有分镜表直接生成基本很难拼成完整故事。批量任务是效率关键。一部短剧几十个镜头逐个手动生成不现实必须用目录化管理和批量调用。本地部署和在线API可以混用。剧本和配音对显卡要求低分镜渲染可以用本地GPU视频生成优先考虑在线平台或高配显卡。这套链路适合做3分钟以内的AI短剧、剧情切片、人物IP内容、广告片草案和影视前期预览。先跑通一个最小闭环再逐步放大到完整剧集。2. 适用场景与使用边界2.1 适合谁用AI影视创作链路的适用人群非常明确个人内容创作者一个人完成编剧、美术、导演、剪辑的活产出短剧和剧情视频。短剧团队用AI批量出分镜和动态预览降低前期拍摄成本快速测试剧情方向。广告和品牌方制作概念片、产品剧情短片用AI快速验证创意。影视行业从业者做分镜预览、动态故事板、场景气氛图辅助实际拍摄决策。2.2 不适合什么场景这套链路不适合对物理真实感要求极高的场景比如需要真人演员精确表演、复杂实景拍摄、多机位同步的院线级电影。AI视频目前对镜头内多人交互、手部细节、长时间连续叙事仍然不够稳定硬逼它做超出能力范围的镜头只会反复抽卡浪费时间和算力。2.3 版权与合规边界用AI制作影视内容必须注意几条红线人物肖像授权生成真人形象或模仿真人声音必须获得本人授权。版权素材使用受版权保护的IP角色、音乐、片段需要确认是否允许二次创作。平台规则AI生成内容发布到公开平台需要遵守平台关于AI生成内容的标识要求。深度合成合规涉及视频换脸、声音克隆等深度合成技术要保证用途合法并且不能用于虚假信息传播或欺诈。这部分不是可有可无的提醒而是决定作品能不能发布、能不能商用、会不会惹上纠纷的基础。3. 制作环境与前置条件制作AI电影不只需要一台电脑还需要一套干净的项目环境。建议先按下面的清单准备。3.1 硬件环境硬件的选择取决于你要用多少本地AI能力剧本编写、配音生成普通轻薄本也能跑CPU推理即可速度稍慢但够用。分镜渲染建议独立显卡。显存大小直接影响出图分辨率和批量速度但具体需求以选择的模型版本为准。图生视频对性能要求最高。有条件用高配显卡本地推理条件不足就使用在线视频生成平台。3.2 软件环境如果你要在本地跑文生图和视频生成模型先确认这些基础环境操作系统Windows 10/11 或 Linux 均可。Python环境AI绘图工具链通常依赖Python版本要求看具体工具。显卡驱动与CUDANVIDIA显卡需要安装对应驱动和CUDA用于GPU推理加速。模型管理工具如 ComfyUI 或 Stable Diffusion WebUI用于加载模型和批量出图。ffmpeg用于视频和音频的格式转换、拼接和后期处理。3.3 项目目录结构AI影视项目的素材量很大没有规范目录会很快失控。推荐按以下结构管理project/ ├── 01_script/ # 剧本、人物设定、分镜表 ├── 02_character/ # 角色参考图、角色一致性资产 ├── 03_storyboard/ # 分镜渲染图 ├── 04_video_clips/ # 动态成片素材 ├── 05_audio/ # 配音、音效、BGM ├── 06_output/ # 最终成片 └── logs/ # 批量任务日志从项目第一天就建立这个结构后面批量生成素材时能省掉大量整理工作。4. 第一步剧本人设4.1 用大语言模型生成剧本AI电影的第一步是让大语言模型帮你完成选题、剧情大纲、人物设定和分集设计。很多人都已经用过聊天类AI但用在剧本创作时提示词不能只写“帮我写一个短剧剧本”那样生成的内容全是套路。一个有效的剧本生成提示词至少需要包含题材、核心冲突、目标时长、集数规划、人物规模和风格基调。请帮我写一部AI短剧的剧本框架要求如下 1. 题材都市悬疑带一点轻科幻元素。 2. 核心冲突主角发现身边反复出现同一个陌生人而这个人宣称是来自未来的自己。 3. 时长规划单集3分钟以内共5集。 4. 人物规模主角、未来人、主角好友共3个主要角色。 5. 风格基调冷色调、紧张感强、每集结尾留悬念。 请输出 - 一句话故事梗概 - 分集剧情大纲 - 每集的关键场景列表 - 3个主要角色的完整人物设定卡4.2 人物设定卡的重要性人物设定卡决定后续所有分镜的一致性越详细越好。建议包含姓名、年龄、身份、外貌特征、服装特点、性格弧线、口头禅。外貌特征尤其重要因为它会直接转化为文生图的提示词。示例人物设定卡角色名林远 身份数据安全工程师28岁 外貌黑色短发偏瘦戴细框金属眼镜常穿深灰色连帽卫衣 性格谨慎、理性面对异常事件时习惯性寻找逻辑漏洞 标志性动作思考时不停转动无名指上的银色戒指 口头禅这不合理。在后续每一步分镜提示词、角色参考图、视频运动控制都要回看这张人物卡确保主角不会从第1集到第3集悄悄换了张脸。4.3 剧本拆分与验证剧本写完后需要验证它是否具备可拍摄性。判断标准很简单每一集是否有一个明确的事件转折。每个场景是否有可描述的画面而不只是对话。人物动机是否前后一致行动是否合理。是否能在3分钟内讲完一段有效冲突。如果剧本全是内心戏和长对白没有可视觉化的动作和场景后面分镜阶段会很难做。剧本阶段就应该发现并修正这个问题而不是拖到渲染阶段。5. 第二步分镜渲染5.1 从剧本到分镜表分镜表是把文字剧本变成画面清单的第一步。每一行代表一个镜头包含镜头号、景别、画面描述、台词、预计时长和是否包含运动。镜头号景别画面描述台词时长S01C01中景林远深夜坐在电脑前屏幕蓝光照在脸上不对数据怎么少了三秒5sS01C02特写林远手指停在键盘上缓缓抬头这不是我删的。3sS01C03全景窗外路灯下站着一个穿同款卫衣的人无台词4s分镜表可以直接让大语言模型生成。一个合格的提示词模板请把下面的剧本片段拆分为分镜表。 要求 1. 每个镜头使用镜头号标识。 2. 景别包含远景、全景、中景、近景、特写。 3. 画面描述要包含环境光、人物位置、服装细节。 4. 必须标注每个镜头是否包含运动并描述运动方向。 5. 台词要与画面对应没有台词的镜头写“无台词”。5.2 生成角色参考图在渲染正式分镜之前先做角色参考图。这一步决定整部片子的人物一致性。做法先用一段统一的角色描述提示词生成多张头像和全身立绘挑选最符合预期的一张作为后续所有分镜的“角色锚点”。角色参考提示词示例一位28岁中国男性黑色短发偏瘦戴细框金属眼镜 穿深灰色连帽卫衣坐在深色背景前正面全身照 电影感布光浅景深高清细节摄影棚质感生成后把选定的参考图保存到02_character/目录文件名要规范比如character_linyuan_front.png。后续分镜阶段要么以这张图为输入做图生图要么配合ControlNet类工具锁定姿态和构图要么训练轻量级LoRA模型来提高一致性。5.3 批量渲染分镜分镜渲染时同一个场景、同一个角色、不同镜头的生产方式要尽量复用一套提示词模板而不是每张图都从零写。这样可以显著提高批量出图的稳定性。一个通用分镜画面提示词模板电影感镜头[景别][角色描述] [角色动作][环境描述][光线描述] [氛围风格][画幅比例]高细节电影色彩分级然后用批量脚本逐条读取分镜表内容自动拼装提示词并调用出图接口。下面是一个Python批量调用思路的示例具体接口路径需要按你使用的工具调整import csv import requests def build_prompt(row): return ( f电影感镜头{row[景别]} f林远黑色短发细框金属眼镜深灰色连帽卫衣 f{row[画面描述]} f冷色调悬疑氛围电影布光高细节 ) with open(storyboard.csv, newline, encodingutf-8) as f: reader csv.DictReader(f) for row in reader: prompt build_prompt(row) payload { prompt: prompt, negative_prompt: 模糊, 低画质, 变形, 多余手指, width: 1280, height: 720, } # 这里的URL只是示例实际以你使用的绘图服务为准 resp requests.post(http://127.0.0.1:7860/sdapi/v1/txt2img, jsonpayload, timeout300) if resp.status_code 200: print(f渲染完成: {row[镜头号]}) else: print(f渲染失败: {row[镜头号]}, 状态码: {resp.status_code})批量渲染完成后要逐一检查分镜图与分镜表是否匹配重点看人物服装、发型、环境是否跨镜头一致。5.4 分镜渲染的判断标准一张分镜图是否合格看三个点角色是否和参考图一致尤其是脸型和服装。画面构图是否满足景别要求。是否具备电影感而不是一眼就能看出是AI生成的塑料质感。不合格的镜头直接删除不要等做成视频后再返工。分镜阶段返工成本最低。6. 第三步动态成片6.1 图生视频的核心思路动态成片阶段最常见的方式是图生视频把分镜渲染好的静态图作为首帧输入再附加运动提示词让模型生成一段动态画面。运动提示词和文生图提示词不一样。它重点描述“画面里发生了什么运动”而不是“画面里有什么东西”。比如镜头缓慢向前推进主角缓缓抬头眼神从屏幕转向窗外 窗外的人影静止不动背景有轻微雨声氛围镜头平稳无抖动生成视频时运动幅度从小到大分档测试。先试“轻微动作”再试“镜头推进角色转头”不要一上来就让角色做大幅动作否则画面变形概率很高。6.2 首尾帧与运镜如果你的视频生成工具支持首尾帧控制一定要用。首帧用分镜图尾帧设定为该镜头结束时的画面状态能明显提升镜头的连贯性。运镜控制也很关键。常见运镜包括推近、拉远、左移、右移、上摇、环绕。短剧镜头通常以缓慢推近或缓慢拉远为主运动速度不能太快否则画面会出现抖动和形变。6.3 批量生成视频片段视频生成比图像生成慢得多也更容易失败所以批量任务必须做好日志和重试机制。思路是遍历分镜目录对每个分镜图生成一个视频片段输出到04_video_clips/目录文件名和分镜号强关联。04_video_clips/ ├── S01C01.mp4 ├── S01C02.mp4 └── S01C03.mp4批量生成时不要一口气把所有镜头全丢进去。先选3个不同类型的镜头测试一个有对话、一个是纯环境空镜、一个有人物动作。确认这3个镜头质量稳定后再批量铺开。6.4 动态成片的验收标准角色在运动过程中没有明显形变。镜头运动方向符合分镜表设定。人物动作和台词时长相匹配。视频没有突然闪烁或画面跳变。3秒以上的镜头主体特征保持稳定。只要有一条不满足就要降级处理减小运动幅度、使用首尾帧、更换视频生成模型或者重新渲染分镜图。7. 第四步配音与剪辑7.1 用TTS生成配音配音质量直接决定成片的观感。AI配音工具已经能做到很自然的语气和停连关键是要给足上下文。推荐方法是按角色建立文案文件每个角色单独生成配音再在剪辑中混音。TTS接口调用思路如下具体参数按你使用的语音服务调整curl -X POST http://127.0.0.1:9880/tts \ -H Content-Type: application/json \ -d { text: 不对数据怎么少了三秒, speaker: linyuan, emotion: 紧张, output: 05_audio/S01C01_linyuan.wav }配音生成后第一件事是检查口误和断句。AI配音经常会在句子中间断出不自然的停顿尤其是长句、数字、英文混排必须在剪辑前修掉。7.2 视频和音频合成动态视频片段和配音单独生成后需要合成。最简单的方案是用ffmpeg把视频、配音、静音或背景音乐合成一个文件。ffmpeg -y \ -i 04_video_clips/S01C01.mp4 \ -i 05_audio/S01C01_linyuan.wav \ -filter_complex [1:a]adelay500|500[a1] \ -map 0:v -map [a1] \ -c:v copy -c:a aac \ 06_output/S01C01_merged.mp4这条命令把配音插入到视频的第500毫秒处视频轨直接复制不重新编码速度快。如果后续要加背景音乐可以再混一条音轨。7.3 剪辑与字幕剪辑阶段建议回到常规剪辑软件操作。工作内容集中在四块按分镜顺序排列片段根据剧情节奏调整每个镜头的实际时长。添加字幕确保AI配音的文本和字幕一致。压制背景音乐音乐音量不能压过对白。添加转场和音效但AI短剧的转场不宜花哨简单叠化或硬切更自然。8. 资源占用与性能观察8.1 显存与性能观察方法本地跑分镜渲染时观察资源占用的最直接方式是用显卡监控命令nvidia-smi在Windows上也可以打开任务管理器查看GPU使用率。启动出图任务后观察三个指标显存占用、GPU利用率、单张出图耗时。如果显存一直接近满载说明当前分辨率或模型规模已经接近硬件极限。8.2 降低资源占用的思路显存不够优先降分辨率而不是换模型。分镜阶段可以先以1280x720出图确认构图没问题后再决定是否需要更高分辨率。生成视频时优先控制帧数和单次生成时长短片段合成比一次性生成超长视频更稳定、更省资源。对视频生成环节如果本地算力不够完全可以把这一步放到在线视频生成平台执行然后把结果回传到本地目录。混合架构很成熟剧本和TTS用本地或云端API分镜用本地GPU批量出图视频生成用在线平台。8.3 端口与进程管理本地部署多个AI服务时端口冲突是第一大坑。建议每个工具固定使用不同端口并在启动后立即检查日志# 查看端口占用情况 netstat -ano | findstr :7860如果发现端口被占用修改启动配置换个端口不要强行杀掉其他服务尤其当那个服务里有正在跑的任务。9. 常见问题与排查方法问题现象可能原因排查方式解决方案不同镜头角色长得不一样提示词不统一、未使用角色参考图检查每个镜头的提示词和参考图建立统一角色提示词模板使用图生图和LoRA固定特征人物手部或面部变形运动幅度过大、模型极限不足看变形发生在运动前还是运动中降低运动幅度用首尾帧控制多抽几次卡视频画面闪烁跳变图生视频帧间不稳定逐帧播放定位闪烁位置缩短单次生成时长使用首尾帧或升级视频生成模型配音断句不自然TTS对长句处理差听高频错误片段拆分文本加入标点控制必要时语音后处理本地出图显存爆掉分辨率或批量数过高用nvidia-smi查看显存占用降低分辨率、减少批量数、缩小模型版本启动服务后页面打不开端口被占用或服务未就绪查看启动日志、netstat检查端口更换端口、重启服务、确认依赖安装完整批量任务中途卡住单个请求超时、网络断开检查日志和输出目录最近文件加超时和重试机制断点续跑生成内容含违规或授权风险素材授权不清、提示词跨边界排查素材来源和生成内容删除风险素材确认肖像和版权授权10. 最佳实践与使用建议10.1 先跑最小闭环不要一上来就规划20集短剧。先用1段对话、2个镜头、1个角色跑通“剧本 - 分镜 - 视频 - 配音 - 剪辑”的最小闭环。确认每个环节都能顺畅衔接后再扩展成完整短剧。最小闭环至少验证三件事角色一致性是否可控、批量生成流程是否顺畅、配音和画面能否对齐。10.2 把角色资产固化下来凡是花时间调通的角色参考图、提示词模板、人物设定卡都要存档。后续制作续集或系列剧时直接复用这些资产不需要重新调。角色资产是AI影视项目里最值钱的部分。10.3 批量任务要有日志批量生成分镜或视频片段时一定要输出日志。日志至少记录提交时间、完成时间、状态码、输出文件路径、失败原因。没有日志批量任务卡住后很难定位是哪一个镜头出了问题。10.4 发布前做合规复核发布公开内容前检查三件事角色形象是否涉及真人肖像配音是否模仿了特定真人声音剧本和画面是否包含未授权版权元素。AI生成内容建议在合适的位置添加AI生成标识避免违反平台规则。10.5 内容质检不能省AI生成的电影感不等于内容质量。情绪是否到位、叙事是否清晰、台词是否合理这些依然需要人工判断。建议在最终渲染前做一次完整的分镜表复查把所有不合格镜头统一标记、统一重做不要渲染完成后再逐段修补。11. 总结与下一步AI电影和AI短剧的制作本质上是一条“文字 - 图像 - 动态画面 - 声音 - 成片”的生产流水线。这篇教程把完整链路拆成了剧本人设、分镜渲染、动态成片、配音剪辑四个阶段每个阶段都给出了可执行的思路、模板和验证标准。如果你是第一次尝试下一步只做一件事拿一个3分钟以内的短剧剧本按第5章的分镜表模板拆成8到10个镜头挑其中3个镜头跑通分镜渲染和图生视频再配上1段TTS配音用ffmpeg合成一个20秒的样片。这个样片就是你的最小闭环。最容易踩的坑有两个角色一致性和视频运动幅度过大导致的形变。前者靠角色参考图和统一提示词解决后者靠首尾帧、小幅度运动和抽卡筛选解决。先把这两个坑避开后续做多集连续剧、多角色对话、动态分镜预览、甚至AI漫剧内容都有可复用的基础。建议收藏备用。工具和模型更新很快但链路本身不会变把每个环节的验证标准固定下来你的AI影视创作流程就会越来越稳。