最近尝试了ToonFlow,整体体验了AI短剧的生成流程。目标是搭建一套本地的T2I(文生图)和I2V(图生视频)管线,于是先后试了LTX 2.3、Flux、SDXL等一系列模型。最终,出于种种原因,还是回到了 Z-Image Turbo + Qwen-Image-Edit + Wan2.2 这条国产模型路线上。

为什么最终选了这套组合?
- 国产模型进步明显:不得不承认,国产开源模型在有限资源下的表现已经很能打了。
- 本地跑得动:我的显卡是RTX 3060 12G,这套组合在量化后刚好能塞进显存,推理速度也在可接受范围内。
- 效果够用:单看测试效果,自己搭工作流是可以跑通的。Z-Image Turbo的文生图速度快、质量稳定;Qwen-Image-Edit的多角度编辑能力正好满足短剧分镜的视角切换需求;Wan2.2的图生视频效果虽然比不上线上商业模型,但胜在免费、可控。
配置完LLM的模型,还差ToonFlow对接Comfyui的配置,于是参考了其他大神分享的配置,最后结合AI重新改了一套生图配置。

文生图走ZIT管道,图生图走Qwen-Image-Edit(1~3张参考图),加了多角度增加了多视角lora,方便后期调视角,顺带着也撸了I2V和首尾帧转视频的配置。
imageRequest(config, model)
│
├── 无参考图 → Z-Image Turbo 文生图
│ └── CLIPLoaderGGUF → KSampler(steps=8,cfg=1) → VAEDecode
│
└── 有参考图(1~3张) → Qwen-Image-Edit 多角度
└── UnetLoaderGGUF → LoraLoader×2 → TextEncodeQwenImageEditPlus
→ FluxKontextMultiReferenceLatentMethod → KSampler(steps=4)

T2I很顺,全程无尿点
LLM用的Deepseek很顺,从小说章节分析->事件分析->故事骨架->改编策略->剧本->资产提取,非常顺畅。

关键词构造都没问题,然后就是顺着流程往下走,T2I也成功生成了相关资产,整个资产在本地完成。整体来说受限于本地模型,生成质量肯定比不上线上的商业模型,MiniMax H3也测试了免费的积分,非常强。但是本次旨在测试生成流程,感受短剧的流水线,不做过多赘述。
资产生成完成后,正式进入视频生成工作台。从左到右依次是五大块,剧本、导演计划、分镜表、分镜面板和视频工作台入口。

剧本下方一长条,是衍生的资产图,根据剧本可能会衍生更多的资产。

在右方对话框跑完后,就开始生成分镜图,跑起来非常慢,平均一张832×480,需要跑150s左右。

不过最终还是跑完。

I2V和首尾帧转视频
顺带着也测试了了I2V和首尾帧转视频的流程,一开始一直提示少参数,仔细对比发先确实是,修复后开始生成。如果配置跟上,Wan2.2的图生视频效果理论上是可以达到商用质量的。

但速度确实慢——4秒的视频跑了将近10分钟。而且第一张图的脸崩了,导致整个视频都崩了,这也是本地模型的一个痛点:一旦前期生成有瑕疵,后续所有环节都会被放大。

整体感受
①优点
这段时间算是把整个大流程算跑通了。
- 流程跑通了,从剧本到分镜到视频,整条管线是可工作的
- 国产模型在有限资源下的表现令人惊喜
- 本地部署意味着无限调用次数,不受API配额限制
② 不足
跑了一个视频,4s钟跑了将近10分钟,尤其是之后才看到,第一张图其实脸绷了。
- 速度慢:平均一张832×480的分镜图需要跑150秒左右
- 质量受限:受限于本地模型,生成质量肯定比不上线上商业模型(如MiniMax H3、Runway Gen-3等)
- 容错率低:前期一个小瑕疵会被后续环节放大,需要反复调试
③ 对比线上服务
测试了MiniMax H3的免费积分,效果确实非常强。如果追求成品质量,线上服务是更好的选择。但如果目的是测试生成流程、感受短剧流水线,本地部署如果配置顶上去,能满足日常需求,但是说真的,相比MiniMax H3,真实无法直视。
可以感受下MiniMax H3,图片是网图仅作测试用,如果侵权请联系我删除。

关于 AI 生图多角色一致性的几点思考
① 传统方案:LoRA 是最稳的,但有门槛
目前最大的痛点就是角色一致性,尤其是多角色的锁脸。传统方案里最稳的是训练 LoRA——如果你做长剧有固定主角,这是值得投入的。
② 现状困境:DiT 新架构上条件控制工具链严重缺位
像 Z-Image Turbo 这类新模型采用的是 DiT 架构而非传统 U-Net,现有的 ControlNet、IP-Adapter 等条件控制手段在 DiT 上缺乏成熟适配。目前想在 Z-Image 系列上精准控制人物身份几乎不可能,我也没发现好用的工具,多角色场景更是无解。即便是 MiniMax H3 这种视频 DiT,效果很好,但多角色长序列里后期帧依然会脸跑偏,至于是否增加更多约束会更好,没有测试,看AI短剧中的脸部保持的挺好,理论上可行。
③ 根因分析:降噪过程是全局广播,无法隔离
后来想想,这问题的根因其实在降噪过程本身:无论是 FaceID、InstantID、IPAdapter 还是 ControlNet,所有条件注入都是全局广播的——模型在降噪时把所有信息混在一起更新,胡子眉毛一把抓,全在同一个 latent 里。没有分开的独立空间用来存放不同人物的身份、五官特征,多人物同框、切换拍摄视角的时候,特征就会互相串扰,出现脸型漂移、五官错乱。说通俗点就是一锅乱炖。
④ 未来方向:让降噪“定向化”
所以我觉得未来的突破方向比较可能的是让降噪过程“定向化”——比如把“锅”结构化(分层降噪、条件异步注入、条件路由),要么在“锅”外解决(独立生成+后期合成)。不管哪条路,核心都是同一件事:别再一锅乱炖了。
本文作者:ZKCOI
文章名称:本地AI短剧流水线初探:从模型选型到ToonFlow落地
文章链接:https://www.zkcoi.com/myblog/6408.html
本站资源仅供个人学习和交流,如若转载,请注明出处,详见《免责声明》。
微信扫一扫
支付宝扫一扫
