一
判断一个 AI 系统有没有进化,我不太看它用了多少模型,也不先看它能连续跑多少轮。
我会看一次失败之后,下一次任务拿到的输入有没有变。
一份报告引用错了数据源,修掉当前报告当然有用。一个测试失败,改到测试通过也有用。一张图里人物衣服漂了,补参考图、改 prompt、重跑镜头,同样有用。
这些都可能只是闭环优化。它们让当前产物过关,却不一定让下一次少犯同类错误。
如果这次错误改变了下一次任务的输入、检查、样例、资产或默认参数,系统就有了一点记忆。如果系统还能回头比较哪类修法有效、哪类修法只是堵住一次问题,它才接近自进化。
二
生成器负责拿出候选。它可能是一个 LLM,也可能是检索器、代码生成器、图像模型、视频模型,或者一个会调用工具的 Agent。它不负责保证每次正确,它先把可能性放到桌面上。
评估器负责把“不对”拆成信号。报告里的事实是否错了,代码是否破坏了测试,图片里的角色是否漂移,回答是否满足用户意图,格式是否能交付,合规红线有没有踩到。评估器看不见的问题,后面通常只能靠人救。
优化器负责决定怎么改。它可以重跑,可以改 prompt,可以换检索源,可以补一条测试,可以把坏样例放进回归集,也可以把问题退回上一层。
很多系统看起来有 Loop,实际只会反复再试一次。这个循环能把当前产物磨到能看,但很难让下一次少犯同类错误。
生成器决定系统能尝试什么;评估器决定系统能看见什么;优化器决定一次失败会停在当前产物,还是变成下一次任务会收到的约束。

三
闭环优化改的是当前产物。
报告里某个数字错了,重新查表后改对。代码里一个测试红了,修到测试变绿。图片里角色衣服漂了,补参考图重跑。当前交付物变好了,这一层就成立。
没有闭环优化,系统连交付都站不住。
但闭环优化不等于进化。判断它有没有越过当前产物,要看修复原因有没有进入下一次任务。报告系统有没有记住新的数据源校验,代码库有没有多出回归测试,图像链路有没有多出角色状态字段。没有这些,下一次还是可能从同一个地方摔下去。
闭环优化解决“这一次能不能过”。进化解决“下一次是不是少踩同一个坑”。
四
进化改的是后续任务的条件。
一个事实错误被修掉以后,系统可以多一条数据源校验。一个代码缺陷被修掉以后,仓库可以多一个测试。一次角色漂移被修掉以后,分镜模板可以多一个服装状态字段,角色卡可以补一张参考图,反例库可以收下这张坏图。
这些留下来的材料往往很普通。模板、资产、测试、反例、评分维度、工具默认值,都算。
和我在 Claude Code Skill 不过是一个文件夹? 里说的一样,很多时候 skill 就是文件夹、规则、脚本和参考材料的组合。它把一次临时手法,改成下一次可以复用的用法。
连续角色镜头生成 `skill`
-> 输入角色卡、角色状态表、场景、分镜
-> 先锁服装、情绪和光源
-> 再生成静帧
-> 再做视频
-> 检查脸、衣服、姿态、动作延续
-> 失败时局部重跑、拆镜头,或者退回资产层失败换了位置。下次任务会拿到一栏字段、一条测试、一个反例,或者一个不同的工具默认值。

五
自进化改的是改进方式本身。
人指出「这里错了」,系统照着修,只说明外部反馈进来了,还不是自进化。
自进化要多看一层。系统要比较不同修法的效果,发现哪些规则长期有效,哪些只是堵住一次 hack;还要发现错误经常在哪一层才暴露,是生成器能力不够,评估器看错了,还是优化器总把返工放在太晚的位置。
评估器也要被评估。一个文本报告评分器如果总把“格式完整”误判成“任务完成”,就不能只给它再贴一条规则。更干净的做法,是把事实一致性、用户意图满足、交付格式拆开,各自补样例,再看下一批报告里误判率有没有下降。
在自进化里,优化器不只是“改产物”,也在改“以后怎么判断、怎么归因、怎么保存经验”。
六
AI 漫剧可以拿来做例子。
漫剧不是一个模型调用。它从剧本、故事蓝图、角色资产、分镜、静帧、视频到剪辑发布,中间每一层都会制造候选、暴露问题、触发修改。
公开资料里,小云雀这类短剧 Agent 产品已经能从标准剧本进入故事蓝图、角色设计和分镜,并让人继续编辑角色与分镜。Vidu 这类视频模型把「参考生视频」和主体库放到更靠前的位置,用多参考素材维持角色和场景连续性。腾讯云开发者社区的行业文章也把漫剧制作拆成剧本、分镜、素材、视频生成、后期剪辑和发行运营等环节。1 2 3
`IP` / 选题
-> 剧本改编
-> 故事蓝图
-> 角色、服装、场景、道具资产
-> 分镜 / 故事板
-> 静帧 / 参考生视频
-> 视频生成与选片
-> 配音、音效、字幕、剪辑
-> 发布
-> 数据复盘
这里只拿漫剧做观察窗口。它把三个角色和三层改进压在同一条链路里,问题比较容易看见。
七
剪辑这一步,最容易看见评估器有没有前置。
剪辑可以拆到很细。先把目标视频交给 Codex 拉片,拆出风格规则;原片另走一遍语音识别和信息提取,产出信息卡,不能把字幕当信息卡;关键帧只看静图,静图过了,再剪 15 到 25 秒样片;改的时候不说「不好看」,只说「弹出慢一倍,蓝色改黄色」,其他地方不动;成片以后,再抽关键帧检查。
拉片分析和内容拆解,不是在做最终视频,而是在给评估器准备风格规则和信息卡。关键帧预览、短样片渲染,让生成器先交便宜的候选,不要一上来就赌整片。具体修改意见把“不好看”翻译成优化器能执行的约束,也限制它别顺手改坏别的地方。成片后的抽帧检查,把最后一关重新交给评估器。
如果这六步只服务这一条片子,它仍然只是闭环优化。下一条片子开始前,风格规则、信息卡字段、关键帧检查清单、样片长度和修改写法留下来,它就是进化。再往后,系统比较哪些规则真减少返工,哪些只是让流程变重,才谈得上自进化。
保险报告、代码生成、投研分析、客服问答也一样。看一个 AI 系统有没有进化,不要只看这次输出漂不漂亮。看下一次任务开始前,输入、评估、样例和工具默认值有没有变;再看这些改动有没有被后续任务验证过。
相关
- 在能力边界上造题:可验证后训练的原理与实践
- Agent-Native
- 如何放心 100% AI 交付需求(2) — Loop 与 Agent Loop
- 如何科学评测 Agent 生成的文本报告:从评分体系到评测器的元评测
- 保险产品解读报告系统:Multi-Agent 生产链路与评测闭环
- Claude Code Skill 不过是一个文件夹?
Footnotes
-
科技日报报道提到,小云雀短剧
Agent可以从标准剧本进入故事蓝图、角色设计、分镜生成,并支持人工编辑角色和分镜。参见:这部AI短剧“跑出”全流程制作加速度。 ↩ -
Vidu官方介绍“参考生视频”能力时,强调多参考图、角色一致性和场景连续性。参见:Vidu Reference to Video。 ↩ -
腾讯云开发者社区文章将
AI漫剧制作拆成剧本创作、分镜、图片素材、视频生成、后期剪辑、审核和发行运营等环节,并讨论制作团队角色。参见:AI漫剧:当技术重构创作边界。 ↩