创意任务解决率95%!让视觉AI自己练习,还能把经验带到视频

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
创意任务解决率95%!让视觉AI自己练习,还能把经验带到视频
8055点击    2026-09-18 09:35

AI完成任务之后,还能留下什么?


北京航空航天大学、香港中文大学和新加坡国立大学的研究团队最近发布了OmniHarness,给出的路径是:让视觉智能体主动练习、检查结果,再将有效流程留下。


面对下一个需求,AI手里能多一份经过验证的方法。


创意任务解决率95%!让视觉AI自己练习,还能把经验带到视频

论文全文:https://arxiv.org/abs/2609.16057

项目主页:https://omniharness.github.io/

代码与运行说明:https://github.com/OmniHarness/OmniHarness


创意任务解决率95%


创意任务解决率95%!让视觉AI自己练习,还能把经验带到视频


ComfyBench创意任务中,OmniHarness达到95%,超过表中最佳对照SymbOmni 27.5个百分点。采用Codex GPT-4o配置时,总体解决率为92.5%。


表中的Pass看流程能否执行,Resolve看输出能否满足任务要求。


OmniHarness两种配置的Pass均为100%,ComfyMind和SymbOmni也已做到。区分它们的重点,是可运行的流程交出了多少合格结果。


将推理骨干同样设为GPT-4o,OmniHarness总体为89.5%,ComfyMind为83%;创意任务上,两者分别为95%与57.5%。


这让经验如何被调用、工具如何被组织,成为模型能力之外值得观察的因素。


采用Codex规划后,总体由89.5%升至92.5%,复杂任务由76.7%升至83.3%。不同规划配置,对应着不同的多步任务表现。


优势也有范围:复杂任务的83.3%仍未超过ComfyMind的85%,并非所有子集都领先。


这些成绩,落在怎样的画面里?


输入可以简单到一张花朵涂鸦。


创意任务解决率95%!让视觉AI自己练习,还能把经验带到视频


涂鸦被重绘为写实红花,其风格又被用于生成一片花田。


创意任务解决率95%!让视觉AI自己练习,还能把经验带到视频


两次生成通过中间图像连了起来。


换成四格漫画,任务变成讲完整个周日早晨:醒来、看手机、发现是周日,继续躺平。动作与文字都要服务剧情


创意任务解决率95%!让视觉AI自己练习,还能把经验带到视频


换成海报和书封,主题、标题、版式又构成一组需要同时满足的要求。


创意任务解决率95%!让视觉AI自己练习,还能把经验带到视频


创意任务解决率95%!让视觉AI自己练习,还能把经验带到视频


创意任务解决率95%!让视觉AI自己练习,还能把经验带到视频


餐桌编辑则更细:叉子要移除,或替换成勺子,旁边的食物、杯子与桌面布局还得尽量保留。


改好目标,也要顾及周围。


创意任务解决率95%!让视觉AI自己练习,还能把经验带到视频


做成一次之后,怎样留住经验?


创作需求总在变。红花可能换成其他主体,重绘之后可能还要调整布局。一次成功怎样帮助下一次?


OmniHarness采用符号策略学习,将验证成功的流程整理成可用于一类任务的策略。


借花田任务理解:花朵与颜色可以替换,而先重绘草图、再借参考生成新画面的连接方式,可以成为可调整的方法。


保存的策略包含工作流模板、适用条件和资源依赖,当前图片、具体描述等实例输入则被抽离。


后续调用先检查是否适用,再绑定新输入,按要求调整步骤或组合多条策略。


出题、检查、积累

经验怎样转起来?


创意任务解决率95%!让视觉AI自己练习,还能把经验带到视频


第一步,把练习选在值得探索的地方。


自主练习发生在下游任务明确之前。


只做熟悉的题,难以补齐空缺;挑战太远,又缺少方法支撑。系统结合练习记录与现有能力,让探索有迹可循。


每轮默认生成10道候选题,以新颖性和能力边界评分的乘积决定练哪一道:


本轮候选任务组成集合。


衡量是否少有练习,反映当前能力是否为探索提供适度支撑。


同类情境练得越多,新颖性得分越低:


包含任务需要的能力,记录相应“情境—能力”的练习次数。图生图以源图区分情境,文生图共享一个标记。


得分按所需能力取平均,避免能力项列得多就自然占优。


每项能力由适用、未停用流程中的最高可靠性提供支持;可靠性用95% Wilson置信区间下界估计。


整道题的能力估计取其中最低值:


这相当于先看短板:大部分步骤熟练,一处缺少可靠方法,仍会拖累整体完成。


随后把能力估计转成选题分数:


时得分达到最高;估计值趋近0或1,得分都会下降,练习因而偏向有基础但仍有挑战的任务。


表达能力支持程度,这套评分是选题启发式。


第二步,让检查跟上每次执行。


系统安排步骤和依赖,将代码编译成ComfyUI工作流,再检查流程能否运行、各步效果及最终目标是否达成。


以花田任务说明:假如红花已偏离要求,下一步继续沿用,偏差也可能进入新画面。


失败后,系统定位问题并局部修复,尽量保留已验证部分;需要时请子智能体协助,在重试预算内再次检查。


第三步,让成败都成为下一次的依据。


验证成功的流程被抽象入库,失败则记录证据、原因与修正方法。等价流程会合并,可靠性随调用更新,经验继续影响选题和执行。


策略还要接受后续检验。新的成败记录,继续影响它的可靠性与调用优先级。


经验换个使用者

还管用吗?


创意任务解决率95%!让视觉AI自己练习,还能把经验带到视频


创意任务解决率95%!让视觉AI自己练习,还能把经验带到视频


创意任务解决率95%!让视觉AI自己练习,还能把经验带到视频


团队把自主练习后的策略库冻结,再适配到其他智能体的知识接口。宿主保留原有控制流程,模型也不微调。


交付的内容既有成功流程模板,也有失败证据与修正办法。其他智能体通过自身的检索、规划和执行机制使用它们。


同一份经验,让三个系统的总体解决率都提高了:


  • ComfyAgent由32.5%升至57.0%。
  • ComfyMind从83.0%提高到88.0%。
  • SymbOmni则由86.0%达到89.0%。


对应的创意任务增幅依次为27.5、17.5和10个百分点。


创意任务的提升均超过各自总体增幅。面对新要求,已有流程和纠错经验仍能为不同系统提供帮助。


还有一层迁移:只练过图像任务的冻结策略库,被用于视频工作流。


视频总体解决率为85.9%,高于表中最佳对照5.1个百分点;视频到视频达到80.0%,高出13.3个百分点。


其中,图像策略负责内容构建、参考保持等操作,时序处理仍交给视频专用组件,二者需经适配与组合。


一次任务结束

经验的使用才开始


这条路径同样需要付出计算成本:自主练习、多轮验证和修复都会增加开销,检索效率与推理预算仍有优化空间。


OmniHarness展示了一种积累方式:模型参数不变,可调用的方法随实践更新。


今天留下的经验,有机会成为明天处理新需求的起点。


参考资料:

https://arxiv.org/abs/2609.16057


文章来自于"新智元",作者 "LRST"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI漫画

【开源免费】ai-comic-factory是一个利用AI生成漫画的创作工具。该项目通过大语言模型和扩散模型的组合使用,可以让没有任何绘画基础的用户完成属于自己的漫画创作。

项目地址:https://github.com/jbilcke-hf/ai-comic-factory?tab=readme-ov-file

在线使用:https://aicomicfactory.app/

3
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

4
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

5
免费使用GPT-4o

【免费】ffa.chat是一个完全免费的GPT-4o镜像站点,无需魔法付费,即可无限制使用GPT-4o等多个海外模型产品。

在线使用:https://ffa.chat/

6
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner