ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

AI短剧制作全流程:从提示词到成片,用Wan3.0一个人搞定

2026/9/9 5:31:45 拓冰建站 浏览量
AI短剧制作全流程:从提示词到成片,用Wan3.0一个人搞定 1. AI短剧的逻辑变了从剧组到一个人的生产线先聊个现象。短视频平台上那些情节紧凑、反转不断的短剧以前要一个剧组、几十号人、几十万预算才能拍出来。现在你打开一个网页敲几段描述文字就能让AI直接把画面生成出来。这种变化不是“够用就好”的将就而是真的把短剧制作的门槛从工业级拉到了个人级。Wan3.0通义万相3.0就是这个趋势里比较有代表性的视频生成大模型。它最核心的能力是文生视频和图生视频——你给一段文字描述或者给一张参考图它就能生成对应的动态画面片段。跟早两年那种只能生成几秒模糊画面的模型比它现在能做到更长时长、更高分辨率、多镜头切换甚至生成带声音的视频这对于做短剧来说是质变。这篇内容适合谁一是短视频创作者想用AI批量产出剧情内容的二是编剧、分镜师想快速把剧本“可视化”看效果的三是纯小白没接触过任何AI工具但对短剧制作感兴趣的人。我会把整个流程从零讲起包括账号注册、免费额度、提示词怎么写、参数怎么调、踩了哪些坑以及怎么把这些片段串成一部能对外发布的短剧。1.1 传统短剧制作的重资产困局先给大家算一笔账看看传统短剧为什么难做。一部正经的竖屏短剧哪怕是低成本的也需要这几项硬支出演员片酬哪怕找素人一天也要几百到上千、场地租赁公寓、办公室、餐厅按小时算钱、摄影设备一台像样的微单加灯光至少一两万、后期团队剪辑、调色、配音、字幕。这还没算导演、编剧、场务这些人力成本。一个100集左右的竖屏短剧保守估计拍摄周期15到30天成本30万到50万起步。这个成本结构决定了传统短剧只有在投流ROI能跑正的情况下才敢开机。创作者想试错成本太高。想一天出三五个版本的剧情不可能。AI视频生成模型的出现把成本结构彻底换了。硬件成本归零用云端算力拍摄成本归零不需要实景和演员后期成本大幅降低AI直接生成视频画面配音和字幕也有对应的AI工具。剩下的核心投入是你自己的创意能力——写剧本、写提示词、做剪辑决策。1.2 大模型把创作流程压缩成了几步用Wan3.0这类模型做短剧整个工作流被压缩到四步写剧本、拆镜头、生成画面、剪辑合成。传统拍摄里剧本到成片之间隔着选角、定妆、勘景、布光、表演、NG、剪辑等一系列环节。但AI视频生成把这些环节全部抽象成了“提示词”这一个东西。你要做的只是把分镜脚本转换成模型能理解的语言然后让模型帮你“拍”出来。这里有一个很关键的认知转变以前我们叫“拍”短剧现在的准确说法是“生成”短剧。你不再需要指挥摄影师调整机位和光线而是告诉模型“这里用低角度仰拍、侧逆光、赛博朋克色调”模型会直接理解并渲染出来。这种抽象度的提升本质上让创作者回归到了叙事本身——你不需要懂摄影、灯光、布景但你必须懂故事、节奏和情绪。这也是为什么我说零基础可以上手但要做好心理准备你的短板不再是“技术不会”而是“创意够不够”——这其实是好事创意练起来比技术快多了。2. 上手准备账号、工具与免费额度详解工欲善其事必先利其器。在使用Wan3.0之前先把需要用到的工具和账号理清楚。做AI短剧不是只用一个大模型就完事通常是“视频生成模型辅助工具”的组合打法。2.1 注册与免费体验入口Wan3.0的体验入口在通义APP和通义万相官网上都可以找到。注册流程比较简单用手机号或者阿里系账号登录即可不需要额外的付费订阅才能进通常新用户注册后会送一定额度的免费生成次数日常也会不定期放出免费体验活动契合“免费体验”这个卖点。这里要提醒一个细节免费额度通常以“积分”或“次数”计算每次生成会消耗一定额度不同功能消耗不同。比如文生视频消耗的额度会比图生视频高长视频比短视频高。建议刚开始的时候先别一上来就生成最长时长先用短片段测试提示词效果确认画面风格对了再生成正式片段这样最省额度。另外一个选择是API调用如果熟悉编程可以通过API方式批量调用但这个涉及到模型部署和计量计费对新手不太友好初期建议先用网页端把流程跑通。2.2 辅助工具清单文案、绘图、剪辑、配音做一部AI短剧除了Wan3.0之外还会用到几类辅助工具。我把它们整理成一张清单方便大家按需准备。工具类型用途推荐方案AI文案辅助写剧本、对白、旁白各类大语言模型均可比如通义千问、文心一言等AI绘图生成角色设定图、场景参考图Midjourney、通义万相文生图、即梦视频生成核心画面生成Wan3.0通义万相视频剪辑拼接片段、加字幕、转场剪映、必剪、Premiere配音对白、旁白配音剪映自带TTS、魔音工坊、ElevenLabs音乐音效背景音乐、氛围音效剪映曲库、网易天音这张表里AI绘图这个环节比较关键因为Wan3.0支持图生视频如果你先用AI画出一张符合预期的角色或场景图再让Wan3.0把它“动起来”画面的可控性和一致性会高很多。后面我会专门讲这个用法。剪辑工具方面如果不想学复杂的专业软件剪映就完全够用。它自带字幕识别、TTS配音和曲库专为短视频场景优化过学习成本很低。2.3 第一次打开Wan3.0的界面认识第一次打开Wan3.0的生成界面可能会有一种“怎么这么简洁”的感觉。页面上通常就几个核心元素输入框、功能选择文生视频/图生视频、参数设置时长、分辨率、运动幅度等、生成按钮。不要小看这个简洁的界面里面每个参数都影响出片效果。我建议第一次使用的人先做一次“裸跑”——不调任何参数只输入一句简单的描述看看模型默认输出是什么水平再逐步调整。这样做的好处有两个一是快速建立对模型能力的直觉知道它能做什么、不能做什么二是后续调整参数时心里有底不会因为一次效果不好就怀疑自己或者工具的稳定性。3. 实操演示从剧本到成片的完整流程现在进入正题。我会用一个具体的例子完整走一遍AI短剧的制作流程。这个例子我会选一个悬疑反转类的小短剧因为这类内容在短视频平台上数据表现好而且对画面要求不算太高适合新手练手。3.1 剧本与分镜设计提示词工程的核心很多人做AI短剧最大的误区是上来就写提示词生成画面剧本环节完全跳过。这样做的结果就是生成了一堆零散的、没有叙事逻辑的画面最后剪辑的时候才发现拼不成故事。正确的顺序是先写一段足够短的脚本再拆成镜头列表最后给每个镜头写提示词。以我要做的这部悬疑短剧为例剧本我先压缩成一句话一个女孩回到老宅发现镜子里的人和自己动作不一致最后镜子里的自己对她诡异一笑。这个短剧本大概能撑15到20秒的时长做AI短剧练手刚刚好。接下来拆镜头我拆成4个镜号画面内容时长1女孩推开老宅木门走进来光线昏暗3秒2她走到梳妆台前坐下看向镜子3秒3镜子里的倒影延迟半拍才动动作不一致5秒4倒影停止模仿对女孩诡异一笑画面黑场4秒拆完镜头之后才是写提示词的环节。每个镜头的提示词我会包含以下几个要素主体、环境、动作、镜头运动、光线色调、画幅比例、风格参考。这里直接给出我用在Wan3.0上的提示词示例可以保存起来直接抄作业镜头1提示词一位二十多岁的年轻女孩穿着米色风衣推开一扇老旧的双开木门老宅内部昏暗微弱的顶光照亮门厅门轴发出吱呀声镜头缓慢推进电影感画面实景拍摄风格竖屏9:16中景为主镜头2提示词女孩坐在旧式梳妆台前柔和的侧光打在她脸上她缓缓抬头看向面前的镜子眼神带着一丝不安镜头从中景切换到近景动作自然竖屏9:16电影感色调镜头3提示词老旧镜子里的女孩倒影正在做一个抬手摸头发的动作但里面的倒影比现实世界慢了半拍产生强烈的错位感镜面反射泛着微光氛围诡异镜头固定位拍摄竖屏9:16写实风格镜头4提示词镜子里的倒影停止模仿嘴角缓缓上扬露出一个僵硬的笑容眼神直直盯着镜头随后画面快速变黑恐怖氛围拉满竖屏9:16特写镜头这套提示词的写法有几个底层逻辑可以拆解主体描述放在开头。模型会对前后文的注意力有不同的权重分配主体信息前置它更容易抓住核心。场景和光线细节要具体。不要只写“昏暗”要写“微弱的顶光”“柔和的侧光”这直接影响画面质感。镜头运动单独说明。虽然模型不一定完全听指挥但你写“缓慢推进”和“从近景切换到特写”输出画面的动态感受会明显不同。画幅比例一定写。短剧需要竖屏不写的话模型默认可能是横屏后续还得裁切白白损失质量。3.2 文生视频实操与参数设置提示词写好了接下来进入Wan3.0的生成界面操作。在文生视频模式下粘贴第一个镜头的提示词然后设置参数。这里我详细说一下每个参数的作用时长单次生成时长可按秒选择。Wan3.0支持最长生成较长时长的视频但我建议新手从短时长开始因为提示词和画面效果匹配需要试错长视频单次消耗额度高试错成本大。分辨率/画质可选高清或更高。短剧建议直接选高清选项因为最终要放到短视频平台画质太差会影响完播率。运动幅度这个参数控制画面的动态程度。数值越大画面中的运动越剧烈。做人物对话场景的时候运动幅度不要拉满否则人脸容易变形做动作戏的时候可以拉高一些。我建议第一次跑的时候全部参数用默认值只填提示词先看一次“标准答案”。然后根据输出效果微调提示词再调整其他参数。生成完成后Wan3.0会返回一段没有声音的纯视频片段。不要急着惊艳或失望先用剪映把4个镜头的视频都导进来按顺序排好。剪映的操作很简单媒体池导入 → 拖拽到时间线 → 调整顺序和长度。4段素材分别对应4个镜头每段大约在3到5秒之间我先按剧本时长粗剪一版。3.3 图生视频与人物一致性问题的破解在实际制作AI短剧的时候跨镜头的人物一致性是一个绕不开的痛点。文生视频模式下每次生成的画面都是“独立创作”的同一个人物可能第一次生成是瓜子脸第二次就变成圆脸了。对于剧情连贯的短剧来说这是致命的。破解方法有两种方法一先用AI绘图生成一张角色设定图。比如我用AI绘图工具画一张“二十多岁女孩米色风衣长发中式老宅复古风格”的角色立绘然后用Wan3.0的图生视频功能把这张图作为第一帧输入再加上动作描述提示词。这样模型会在参考图的基础上做运动扩展人物长相会被约束住。方法二在提示词里加入固定特征描述。比如每次都写“女主角瓜子脸长发米色风衣眼神带有忧郁气质”作为统一前缀后接该镜头不同的动作描述。虽然这个方法一致性没有图生视频强但配合后期剪辑基本够用。我的实际建议是如果角色在短剧里戏份较多用方法一先定角色图再生成视频如果只是背景人物或者单一场景用方法二省事省额度。图生视频的参数和文生视频类似但多了一个输入框——你需要上传参考图。上传之后点上“锁定角色”这样每次生成都会尽量保持第一帧人物的样貌。现场操作的顺序是上传参考图 → 输入动作提示词 → 设置时长和运动幅度 → 生成。3.4 剪辑配音合成让片段变成一个“作品”4个镜头的AI视频生成完毕后进入剪映做后期。这一步决定了你的片子是“AI素材堆砌”还是“一部完整短剧”。我习惯的剪辑顺序是粗剪把4段视频按顺序放在时间线上每段掐掉头尾多余的部分让节奏符合剧本设计。加转场AI生成的视频片段之间建议用“叠化”或“闪黑”这种比较轻的转场不要用花哨的3D转场会破坏电影感。配音与对白这部悬疑短剧没有台词只需要加一段环境音垫底。剪映的音频素材库里有“老宅环境音”“心跳声”“阴森氛围”等音效拖拽到时间线对应位置即可。如果台词多可以用剪映的“文本朗读”功能选择一位声音合适的配音员把对白粘贴进去生成音频。BGM短剧成败的一半在音乐。悬疑类我建议选节奏缓慢、低频较多的氛围音乐音量控制在比环境音低一点避免抢戏。字幕AI短剧尤其要重视字幕因为画面本身的信息密度不一定够观众需要字幕辅助理解剧情。可以直接用剪映的“识别字幕”功能自动生成字幕然后调整字体、大小、位置。最后导出的时候参数选择1080P、30帧、竖屏。如果平台对码率有要求选择“更高画质”导出即可。导出后保存一部15秒的AI短剧就完成了。整个流程走下来熟练以后大概15到20分钟能出一部。这个速度传统剧组想都不敢想。4. 我用Wan3.0踩过的坑常见问题与排查思路用了几个月Wan3.0从最开始生成一堆废片到后来能稳定产出可用的短剧片段中间踩了不少坑。我把典型问题整理成下面的排查表帮大家少走弯路。现象可能原因解决方案生成的画面混乱人物多余提示词信息量过大模型抓不住重点精简提示词一个镜头只聚焦一个主体必要信息前置人脸扭曲变形单镜头内运动幅度过大降低运动幅度参数或者缩短单镜头时长跨镜头人物长相不一致文生视频每次独立创作改用图生视频输入角色参考图锁定角色生成速度慢、排队时间长高峰期算力紧张错峰生成或者先本地把提示词都写好集中半小时批量跑画面有AI感的“塑料味”提示词缺少光影和材质描述增加细节具体光源方向、胶片颗粒感、镜头焦段等免费额度很快用完频繁GPT式试错用测试模式跑小片段确认效果后再生成正式片段4.1 提示词写不好画面一片混乱这个问题在AI视频模型里非常典型。新手写提示词容易像写作文一样恨不得把整个故事背景都写进去。比如“一个女孩在雨夜走进一家便利店她看起来很伤心因为刚刚和男朋友分手了便利店老板是一个慈祥的老人店里灯光很暖”——这串提示词如果丢给模型它大概率会生成一个莫名其妙的大杂烩画面。原因在于视频模型对长文本的理解力还做不到“读小说拍电影”的程度。一个镜头只做一件事、只描述一个主体、只说清楚动作和场景生成成功率会大幅上升。我个人的经验法则是提示词控制在30到50个字以内用短语而非长句用逗号分隔各要素。之前那个老宅悬疑短剧的例子就是按这个思路写的。4.2 人脸崩坏是怎么发生的人脸崩坏是视频生成模型一个“老大难”问题本质原因是模型在生成连续帧时对人脸的细节记忆不够稳定。尤其是镜头里人物转动头部、张嘴说话、快速运动时局部特征容易在帧间跳变。应对策略运动幅度参数调低给人脸更少的“变化空间”。单镜头内的动作尽量简单比如“抬头看镜子”比“摇头晃脑地看镜子”稳定得多。如果已经生成了面部崩坏的片段不要整体重做去生成同场景第二条替代素材然后剪辑时用“叠化”转场掩盖崩坏的起始帧。注意不要让AI生成任何违背公序良俗的画面内容模型本身也有内容审核机制做内容之前先想清楚边界。4.3 生成速度慢、排队时间长高峰期用Wan3.0尤其是晚上8点到11点这个时段排队时间可能很长。我的做法是晚上先把第二天要用的提示词全部写好整理到一个表格里第二天早上或者凌晨统一跑生成。这样既避开了高峰期也方便批量管理素材。还有一些小技巧可以提升效率同一段提示词可以先固定随机种子生成后如果不满意再微调描述。固定种子能确保每次生成的基础一致微调描述时结果会有延续性不会完全“翻车”重来。5. 从试玩到持续产出内容方向的进阶建议学会了基本操作之后下一个问题就是拿这个能力做什么内容直接上短剧就是一个方向但AI短剧的远不止“做短剧”这一个玩法。我想讲几个已经被验证过的方向供大家参考。5.1 热门AI短剧内容类型拆解竖屏爽文短剧霸总、逆袭、重生、穿越这是短视频平台上最成熟的品类。特点是情节套路化、结构高度模板化非常契合AI批量生成的优势。一部60集的短剧初步用AI生成素材选片段剪辑和做15秒的练习片相比工作量和传统团队比完全不在一个量级。AI漫剧二次元风格的动态漫画。用AI绘图生成漫画风格的角色图再通过图生视频让角色动起来。漫剧的好处是画面容错率高因为二次元风格本身就允许夸张和变形人脸崩坏问题不那么明显。历史/悬疑科普剧场把历史事件、未解谜团用剧情演绎的方式拍成短剧画面可以做得有电影感用旁白讲解推进叙事。这类内容的制作门槛不高但流量天花板高。品牌定制AI短剧如果你有客户资源或者电商资源帮品牌用AI短剧做广告投放单价不低。AI生成成本低可以快速出多版本物料做AB测试找素材方向这在传统制作流程里没法想象。5.2 批量生产的工业化流程如果想持续产出AI短剧内容建议根据自己的实际情况建立一套小流水线。我自己的流程大致是这样选题关注平台上近期热度较高的短剧梗概拆解其核心冲突和反转结构总结成“一句话剧情模板”。批量写脚本用AI文案工具把同一个剧情模板套进不同设定里批量产出10个左右的短剧本。拆镜头与写提示词每个短剧本拆成4到6个镜头批量写成提示词表格。集中生成在非高峰期批量跑Wan3.0一次生成当天所需的全部画面素材。剪辑团发用剪映批量剪辑、加字幕、配音遵循平台发布节奏做分发矩阵。这套流程跑起来之后一个人一天产出3到5部15到30秒的AI短剧是不难的。如果愿意深耕还可以把提示词模板、素材包沉淀下来越做越熟练形成自己的内容库。5.3 商业化变现的几个方向短视频平台分成与播放量激励把AI短剧发布到短视频平台赚播放量分成。星图/品牌合作有一定粉丝量后接品牌定制短剧。素材出售把你生成的AI视频片段打包上传到素材平台供其他创作者下载使用赚取被动收入。课程与知识付费如果你想做重一点也可以把自己掌握的AI短剧方法论整理成教程或课程服务更多想入行的人。这条路误区也挺多有人觉得AI短剧随便生成就能爆实际上选题、节奏、完播率仍然是决定数据表现的关键变量有人一上来就买一堆付费课程反而忽略了免费工具本身已经把门槛降得很低了。我的建议是先免费把工具用熟做出3到5部完整的作品再考虑要不要投入金钱和更多时间。我在实际使用中最大的体会是AI短剧制作最难的从来不是技术而是到底要讲一个什么故事。工具已经免费摆在那里Wan3.0的画质和稳定性也够用真正的分水岭在于你能不能持续产出有钩子、有反转、能让观众看完不划走的内容。所以别纠结工具版本和参数细节把时间和精力花在选题、剧本和剪辑节奏上这才是性价比最高的投入方式。最后再分享一个小技巧做AI短剧的时候把每个镜头的提示词、生成参数、效果评价记在一个表格里看起来多花了几分钟但积累一段时间之后你手里会有一套“提示词参数库”做下一部片子的时候直接调用效率和成功率都会明显提升。这个习惯我从第一天就坚持了现在回头看是让我做AI短剧少走弯路的关键一步。