谷歌创建WikiSkill,让AI代理记住错误并改进
谷歌研究的研究人员推出了WikiSkill,这是一个框架,可以在一个持久的维基中保留AI代理的错误和成功,从而为未来的执行创建更好的指令。测试显示在数学、电子表格和交互环境方面有显著进展,尽管该系统尚未在严格意义上代表持续学习。
- WikiSkill将执行轨迹、积累的知识和主动指令分为三个层次。
- 该框架将Gemini 3.5 Flash的平均值从49.5%提高到68.1%,将Qwen-3.6-27B的平均值从39.4%提高到63.3%。
- 大型模型更好地利用进化的技能,而较小的模型可以缩小部分差距。
忘记的代理的外部记忆
谷歌研究的研究人员提出WikiSkill作为一个框架,旨在解决人工智能代理的一个反复出现的局限性:每次执行结束后,获得的经验大部分消失。该系统不是在每个任务后修改模型参数,而是收集有关失败、成功和有用策略的信息,形成类似于协作百科全书的结构。然后,代理可以查阅这些材料,以便在下一个机会中采取更好的指令。
该提案并不意味着模型在传统意义上持续学习。模型保留其原始训练,但根据记录的经验为自己生成更精确的指令,这是一种不如永久学习优雅的解决方案,并可能容易受到累积错误的影响。尽管如此,研究结果表明,这种外部记忆可以显著提高需要多步骤和协调使用工具的任务的表现。
这一概念源于对Andrej Karpathy的观点的理解,关于一种语言模型的维基,在这种维基中,代理的经验转化为持久和累积的知识。WikiSkill将这一想法引入技能的自动发展,试图将先前的执行转化为可重用的程序,而不改变训练期间学到的行为。这一区别是相关的,因为它允许在不进行完整模型再训练的情况下测试行为变化。
该工作在五种类型的测试中进行了评估:数学推理、网络搜索、电子表格操作、关于文档的问题和回答,以及在虚拟环境中的交互任务。研究人员使用了Qwen的4亿、9亿和27亿参数版本,以及Gemma-4-31B和Gemini-3.5-Flash。这种组合使得观察在不同能力模型中积累的记忆如何在面对不同需求的任务中发挥作用成为可能。
三个层次和改进循环
WikiSkill将工作区组织为三个层次,各自发挥不同的功能。原始层保留每次执行的完整轨迹,包括工具调用、获得的响应和代理遵循的步骤;这些记录是不可变的,作为分析行为的原材料。在其上方是维基层,在这里经验被转化为结构化的结论,例如失败模式、操作建议和产生有利结果的策略。
维基层在任务完成后不会重置,而是随着每次迭代而增长,根据研究人员的描述。这种连续性允许后续执行查阅先前检测到的问题,即使导致这些问题的策略不再处于活动状态。第三层称为技能层,包含代理在执行过程中使用的程序指令,并作为系统的可修改部分。
循环开始于推理代理完成任务并产生新的轨迹。之后,维基维护者审查这些日志,以识别出错的地方和哪些决策有帮助,而技能提议者利用积累的结论建议对主动指令进行具体更改。因此,该架构将事实观察、经验解释和新行为应用分开。
在接受修改之前,验证或门控机制会在独立的任务集上测试它。如果更改改善了结果,则可以将其纳入技能层;如果对性能造成损害,则会恢复,而不删除导致提案的信息。即使是失败的更新也保留了效用,因为维基记录了尝试的内容以及为什么没有成功,从而使系统能够避免重复相同的路径或在后续回合中设计替代方案。
基于模型和任务的不平等结果
研究报告了WikiSkill在没有额外技能的代理中的改进。平均而言,Gemini-3.5-Flash的表现从没有技能的49.5%提高到有WikiSkill的68.1%,而Qwen-3.6-27B则从39.4%提高到63.3%。这些数字对应于五个基准的平均值,并根据工作中包含的表格从三次独立执行中计算得出。
在观察单个任务时,差异变得更加明显。Gemini-3.5-Flash在LiveMath中的得分从33.0%上升到72.6%,在SpreadSheet中的得分从50.5%上升到76.6%,这两个场景中积累的指令似乎产生了最大的影响。在Qwen-3.6-27B的情况下,WikiSkill在LiveMath中达到了61.9%,在SpreadSheet中达到了81.7%,而在没有技能时分别为33.9%和40.8%。
这些增益在所有领域并不均匀。数学任务和电子表格操作显示出最大的跃升,而OfficeQA需要回答关于文档的问题并处理长上下文,在多个配置中表现出更有限的进展。例如,在Gemini-3.5-Flash中,OfficeQA的得分从48.6%提高到60.7%,这是一个相关的改进,尽管小于在LiveMath和SpreadSheet中观察到的改进。
模型大小也影响了利用进化技能的能力。研究人员指出,Qwen-3.5-4B在需要在广泛上下文中维持多步骤搜索策略时难以可靠地执行,常常恢复到其默认行为。然而,配备WikiSkill的小模型可以与不使用该框架的大模型的表现相匹配,为提升资源较少的系统的效用开辟了可能的途径。
技能转移和待解决的限制
研究的另一个观察是,一个模型创建的技能可以转移到另一个模型,并且在某些情况下,效果可能比接收模型自行开发的指令更好。这一可能性指向一个共享的程序库,其中用于解决电子表格或浏览网络的技能可以在不同的代理之间重用。然而,结果并不能保证转移在所有情况下都是有益的,因此研究人员建议逐个验证。
转移需要谨慎,因为在一个模型中有效的指令可能依赖于其能力、推理风格或与工具的交互方式。较小的代理可能无法完全理解为较大系统设计的策略,特别是当任务要求在上下文中维持多个步骤时。验证机制提供了对这一风险的屏障,但并不能消除在使用环境中评估每项技能的必要性。
WikiSkill还揭示了记忆和学习之间的根本区别。维基保留信息,技能提议者生成新指令,但模型参数保持不变;因此,系统并未以持续训练过程所能获得的方式获得永久的内部理解。该解决方案可能改善可观察的行为,尽管一个糟糕的结论、不完整的记录或错误的推理可能会被纳入知识库,并影响未来的决策。
分层设计试图通过保持原始轨迹、结论和主动技能的分离来解决这个问题。能够恢复更新保护了即时执行,而保留失败的尝试防止了有用信息的丢失,以便后续分析。总的来说,这种方法展示了开发者如何构建具有累积操作历史的代理,而不声称他们已经解决了持续学习这一仍然开放的挑战。
研究结果表明,外部记忆可以成为在相同类型任务上反复工作的代理的重要组成部分。WikiSkill并未消除模型的局限性,也未确保每次经验都能产生改进,但它提供了一种系统化的程序来观察错误、记录策略、测试更改和保留经验教训。该框架的主要承诺在于将执行之间的遗忘转化为一个逐步的受控精炼过程。
-- 价格
本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。
猜你喜欢

教师节:阿根廷教师的收入及薪资最高的省份

Galaxy Digital与Fireblocks Trust Company签署合同

Gemini获新加坡主要支付机构牌照,提供数字支付及跨境转账服务

22岁马龙·拉姆承认盗窃2.45亿美元加密货币

韩国又开始赌国运了

ChatGPT、Claude、Grok 集体掉线,为啥都怀疑 Cloudflare?

18人因首宗美国加密货币RICO案件被控,涉及2.63亿美元BTC盗窃

加密货币诈骗者的狂欢结束了,他们在百万比特币盗窃后挥霍无度

三名游客在山上使用人工智能规划后获救

新加坡男子将就 2.4 亿美元比特币盗窃案认罪

谷歌澄清 Antigravity 账号封禁不影响 Google 账号

中国 AI 大模型调用量连续十九周领跑全球,腾讯混元 Hy4 preview 登顶

AI巨头发布新模型引发模型疲劳

霍斯金森警告白宫加密峰会与会者可能在中期选举后面临调查

从美股和A股26年Q2财报季,看Agent真正发生了什么

B.AI 接入 Gemini 3.8 Flash API

Google Gemini在分析视频时减少高达88%的令牌使用








