创意任务解决率95%,让视觉AI自己练习,还能把经验带到视频
AI在完成任务后,能留下些什么?
来自北京航空航天大学、香港中文大学和新加坡国立大学的研究团队近日发布了OmniHarness,他们提出的思路是:让视觉智能体主动进行实践、检验成果,并将有效的流程保存下来。
当遇到新的需求时,AI手中便多了一份经过验证的方法。

论文全文:https://arxiv.org/abs/2609.16057
项目主页:https://omniharness.github.io/
代码与运行说明:https://github.com/OmniHarness/OmniHarness
创意任务解决率高达95%

在ComfyBench创意任务中,OmniHarness取得了95%的成绩,比表中表现最佳的对照方法SymbOmni高出27.5个百分点。当采用Codex GPT-4o配置时,总体解决率达到92.5%。
表格中的Pass指标衡量流程能否顺利执行,Resolve指标则评估输出结果是否满足任务要求。
OmniHarness两种配置的Pass率均为100%,ComfyMind和SymbOmni也达到了这一水平。真正拉开差距的关键在于,那些可运行的流程究竟产出了多少合格的结果。
当推理骨干同样设置为GPT-4o时,OmniHarness总体解决率为89.5%,ComfyMind为83%;在创意任务上,两者分别为95%和57.5%。
这表明,经验如何被调用、工具如何被组织,已成为模型能力之外值得关注的要素。
采用Codex进行规划后,总体解决率从89.5%提升至92.5%,复杂任务的解决率从76.7%升至83.3%。不同的规划配置,对应着多步任务表现上的差异。
但这种优势并非没有边界:复杂任务83.3%的成绩仍未超越ComfyMind的85%,并非在所有子集上都保持领先。
这些成绩对应着怎样的实际画面?
输入可以简单到一张花朵涂鸦。

涂鸦被重绘成一朵写实的红花,其风格又被用来生成一整片花田。

两次生成通过中间图像连接了起来。
换成四格漫画,任务变成讲述一个完整的周日早晨:醒来、看手机、发现是周日,继续躺着。画面和文字必须服务于整个剧情。

换成海报和书封,主题、标题、版式又构成了一组需要同时满足的要求。



餐桌编辑则更加精细:需要移除叉子,或者将其替换成勺子,同时还要尽量保留旁边的食物、杯子以及桌面布局。
在修改目标的同时,也要兼顾周围环境。

一次成功后,如何保留经验?
创作需求总是在变化。红花可能换成其他主体,重绘之后可能还需要调整布局。一次成功如何帮助下一次?
OmniHarness采用了符号策略学习的方法,将验证成功的流程整理成可用于某一类任务的策略。
以花田任务为例来理解:花朵和颜色可以替换,而先重绘草图、再借助参考生成新画面的连接方式,则可以成为一种可调整的方法。
保存的策略包含工作流模板、适用条件和资源依赖,而当前图片、具体描述等实例输入则被剥离出去。
后续调用时,系统会先检查策略是否适用,再绑定新的输入,并根据要求调整步骤或组合多条策略。
出题、检查、积累,经验如何循环起来?

第一步,将练习选择在值得探索的区域。
自主练习发生在下游任务明确之前。
只做熟悉的题目,难以填补能力空缺;挑战过于遥远,又缺乏方法支撑。系统结合练习记录与现有能力,确保探索有迹可循。
每轮默认生成10道候选题目,以新颖性和能力边界评分的乘积来决定练习哪一道:
本轮候选任务组成一个集合。
衡量题目是否少有练习,反映当前能力是否为探索提供了适度支撑。
同类情境练习得越多,新颖性得分就越低:
包含任务所需的能力,并记录相应“情境—能力”的练习次数。图生图任务以源图区分情境,文生图任务则共享一个标记。
得分按所需能力取平均值,避免因能力项列得多而自然占优。
每项能力由适用且未停用的流程中的最高可靠性提供支持;可靠性通过95% Wilson置信区间下界来估计。
整道题的能力估计取其中最低值:
这相当于先看短板:大部分步骤熟练,但某处缺少可靠方法,仍会拖累整体完成。
随后将能力估计转化为选题分数:
时得分达到最高;估计值趋近0或1时,得分都会下降,因此练习倾向于有基础但仍有挑战的任务。
表达能力支持程度,这套评分是一种选题启发式方法。
第二步,让检查跟上每一次执行。
系统安排步骤和依赖,将代码编译成ComfyUI工作流,然后检查流程能否运行、各步骤效果以及最终目标是否达成。
以花田任务为例:假如红花已偏离要求,下一步继续沿用,偏差也可能进入新画面。
失败后,系统会定位问题并进行局部修复,尽量保留已验证的部分;必要时会请子智能体协助,在重试预算内再次检查。
第三步,让成功与失败都成为下一次的依据。
验证成功的流程被抽象后入库,失败则记录证据、原因与修正方法。等价的流程会合并,可靠性随调用更新,经验继续影响选题和执行。
策略还要接受后续检验。新的成败记录,会继续影响它的可靠性与调用优先级。
经验换个使用者,还管用吗?



团队将自主练习后的策略库冻结,再适配到其他智能体的知识接口。宿主智能体保留原有的控制流程,模型也不进行微调。
交付的内容既包括成功流程模板,也包含失败证据与修正办法。其他智能体通过自身的检索、规划和执行机制来使用它们。
同一份经验,让三个系统的总体解决率都得到了提升:
ComfyAgent从32.5%提升至57.0%。
ComfyMind从83.0%提高到88.0%。
SymbOmni则从86.0%达到89.0%。
对应的创意任务增幅依次为27.5、17.5和10个百分点。
创意任务的提升均超过了各自系统的总体增幅。面对新要求,已有的流程和纠错经验仍能为不同系统提供帮助。
还有另一层迁移:只经过图像任务训练的冻结策略库,被用于视频工作流。
视频总体解决率为85.9%,比表中最佳对照方法高出5.1个百分点;视频到视频任务达到80.0%,高出13.3个百分点。
其中,图像策略负责内容构建、参考保持等操作,时序处理仍交给视频专用组件,二者需要经过适配与组合。
一次任务结束,经验的使用才刚刚开始
这条路径同样需要付出计算成本:自主练习、多轮验证和修复都会增加开销,检索效率与推理预算仍有优化空间。
OmniHarness展示了一种积累方式:模型参数不变,可调用的方法却随着实践而更新。
今天留下的经验,有机会成为明天处理新需求的起点。
参考资料:
https://arxiv.org/abs/2609.16057
本文来自微信公众号“新智元”,作者:LRST,36氪经授权发布。