返回AI 短视频工作台
个人创作11 环节

把 22 分钟的短片,拆成 11 个可生产的环节

一个把「剧本 → 分镜 → 资产 → 音视频」串成一条链路的短片生产工作台。 8 篇文章配 8 种视觉风格,导演美学注入拆镜与提示词,角色与场景用参考图锁一致性。

行业短片创作 / 影视交付形态可部署的生产工作台
时间2026-08 起分级L1(可公开)

这条链路解决的是什么

单张 AI 出图早就不稀奇了,真正难的是让一张张图连成一部片子:角色在第 3 场和第 9 场得是同一个人, 场景要接得上,分镜得按剧本走,参数还得能复现。这个工作台就是把这几件事固定成流程。

做法

一、先定风格,再动手。 每篇文章配一份视觉手册,把画风写死;拆镜和提示词都由导演美学控制, 而不是每次现编。风格不定版,后面所有镜头都会返工。

二、资产先行。 角色、场景、道具先生成设定图并入库,后续所有镜头都从资产引用,不靠文字描述「同一个人」。

三、按场拆镜、按镜出图。 整片剧本按场号取文本拆镜,每个场出分镜卡,再逐镜生成。 批量生成会自动跳过已完成的镜头,可以中断后继续。

四、参考图锁一致性。 多图参考的视频链路按场串联,角色与场景参考图同时喂进去, 不依赖首帧,避免「第一帧像、第三秒就变脸」。

结果

十一个环节全部跑通并留有实测数据(见上方数字表);产出侧累积了数百个生成资产与数十条冒烟视频, 可以随时回看某次生成用的参数。

边界

只对可复现的流程与参数负责。内容是否符合平台要求、模型权重是否可商用,需要按项目单独确认。 剪辑与成片导出不在链路里——这一点在报价口径里也写明了。

证据

实测数字

指标实测说明
单张成图26 秒 / 3072²Z-Image Turbo · RTX 5070 Ti 16GB
分镜图30 秒 / 1440×2560竖屏 9:16
分镜转视频约 4 分钟 / 864×480MiniMax H3 图生视频
图生 3D44 秒 / GLB 15.09 MBHunyuan3D 本地推理
已跑通环节11 项含无限画布、资产节点、批量生成、语义检索
限制

这个方案不适合什么

成片剪辑与导出(转场、字幕、调色、混音)不在链路内,需要另配后期。

产量与硬件强相关:上面的数字都在单张 16GB 显卡上跑出来,换机器会变。

角色一致性靠参考图锁定,不等于「同一个人物任意角度都完全一致」。

本地模型的商用授权归模型方,需按项目逐一确认。