5001拉斯维加斯-港中文团队提出 Skill 生命周期管理 SLIM,让大模型智能体不再盲目堆积 Skill !
SLIM:让模子判定外部能力的去留,于繁杂使命中保留真正有效的支撑。作者丨郑佳美
编纂丨马晓宁
年夜模子智能体正于从“会谈天”走向“会干事”。
于网页搜刮、东西挪用、主动办公、软件操作、具身呆板人等场景中,智能面子对于的再也不是单轮问答,而是持续决议计划:它要理解使命方针,选择适合东西,履行多个步调,并按照情况反馈不停调解步履。
例如,一个家庭办事呆板人要完成“把冷却后的物品放到指定位置”,不克不及只知道“冷却”是甚么意思,还有要先找到准确物体,判定物体状况,完成冷却操作,再确认是否放置乐成;一个搜刮问答智能体也不克不及只天生谜底,而要先判定问题类型,检索证据,筛失无关信息,再构造终极回覆。
于这类行业配景下,外部技术逐渐成为 LLM agent 的主要能力来历。它们像是可复用的操作经验,可以或许帮忙智能体处置惩罚繁杂流程、长尾使命及轻易堕落的步调。
但问题也随之呈现:技术是否是越多越好?假如一直把技术塞进体系,智能体可能检索到过错技术,被无关信息滋扰;假如寻求“零技术推理”,又可能把一些低频但要害的能力删失,致使繁杂使命中掉误增长。也就是说,行业真正需要解决的不是“要不要技术”,而是“技术应该如何被治理”。
针对于这个问题,中国香港中文年夜学团队提出了《Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning》,简称 SLIM。这项研究把外部技术当作一个有生命周期的能力体系,而不是固定稳定的提醒质料。SLIM 会于练习历程中判定每一个技术的真实孝敬:有效的技术继承保留,孝敬变小的技术逐渐退休,当前能力笼罩不到的掉败场景再扩大新技术。
这让智能体的练习方式更靠近真实事情中的能力治理。好比于 ALFWorld 这种长流程使命中,一些清洁、加热、冷却、状况查抄相干技术仍旧需要保留于外部,帮忙智能体完成持续动作;而于 SearchQA 这种搜刮问答使命中,部门搜刮及推理计谋可能更易被模子接收,终极对于外部技术的依靠就会降低。
SLIM 想回覆的焦点问题,恰是年夜模子智能体走向繁杂使命时绕不开的问题:哪些能力应该写进模子,哪些能力应该留于外部,哪些能力又应该于掉败中被从头补上。

论文地址:https://arxiv.org/pdf/2605.10923

01
从「堆技术」到「管技术」研究团队的试验成果显示,SLIM 于总体体现上最佳,平均跨越最好对于比喻法 7.1 个百分点,这申明晋升不是偶尔来自某一个使命,而是来自练习历程中对于技术调集的动态治理。
SLIM 的上风不是固定利用统一批技术,也不是纯真增长技术数目,而是按照每一个技术于差别阶段的作用变化,决议哪些技术继承保留,哪些技术删除了,哪些技术需要新增。
于 ALFWorld 上,SLIM乐成率为 87.5,最强基线要领 SkillRL 为 75.0,晋升较较着。ALFWorld 的使命步调长、动作多、状况变化较着,智能体需要连续不雅察情况、判定物体状况、选择准确动作,并按挨次完成多个操作,以是这种使命仍旧需要一部门外部技术辅助。

SLIM 于这个使命上体现更好,申明颠末筛选后留下的外部技术,可以或许帮忙智能体处置惩罚繁杂流程及状况变化。于 SearchQA 上,SLIM不管是否携带技术都为 41.0,最强非 SLIM 要领 Skill0 为 39.3,虽然也有晋升,但不如 ALFWorld 较着。
SearchQA 重要缭绕搜刮、推理及回覆睁开,使命重点于在找到信息、构造推理路径并输出谜底,以是外部技术更像练习阶段的辅助,终极依靠较弱。带技术及不带技术的成果也能表现这类差异,ALFWorld 中带技术较着更好,申明它更依靠外部历程技术,SearchQA 中带不带技术差距很小,申明模子更易把技术中的搜刮及回覆计谋接收到自身能力中。
练习历程中,差别要领的技术变化也颇有代表性。SkillRL 的技术连续增长,申明它倾向不停累积技术,但技术多其实不必然更好,由于过量技术可能带来检索噪声及上下文滋扰。Skill0 的技术连续削减,末了酿成零技术,申明它倾向把技术全数内化到模子中,但这类方式可能会丢掉低频、长尾或者繁杂流程能力。雷峰网
SLIM 则先增长技术,再筛选技术,末了保留极少量有用技术,并终极保留 21 个技术,申明最优状况不是技术越多越好,也不是技术全数删除了最佳,而是保留仍旧有现实孝敬的技术。

溶解试验进一步证实了这一点,去失“退休”机制后机能较着降落,申明只增长技术而不删除了无效技术会影响效果;去失“扩大”机制后机能也降落,申明只筛选已经有技术还有不敷,还有需要补足当前技术没法笼罩的掉败环境;随机治理技术效果更差,申明技术增删不克不及随便举行。
固定技术数目也不如 SLIM,申明要害不是简朴节制技术数目,而是按照技术孝敬决议保留、删除了及扩大。案例阐发成果也撑持这个结论,有些技术利用频率高,但孝敬已经经很小,可能已经经被模子学会或者被其他技术替换;有些技术利用频率不高,但于特定使命中很是要害,不克不及由于低频就删除了。
还有有些新扩大出来的技术,后期也可能变患上冗余,申明新增技术其实不代表永世保留。是以,是否保留技术不克不及只看利用次数,更主要的是看禁用某个技术后,使命体现是否较着变差。


02
SLIM 把技术治理做成一个轮回研究团队的试验方针,是验证 SLIM 是否优在传统技术利用方式。试验重要对于比了三种思绪,一种是平凡 RL,重点放于练习 policy 上,一种是技术累积,也就是不停增长外部技术,还有有一种是技术内化,也就是逐渐删除了外部技术。雷峰网(公家号:雷峰网)
缭绕这些对于比,研究真正想回覆的问题是,LLM agent 于练习历程中,外部技术到底要如何变化。试验利用的基础模子是 Qwen3-4B,使命包括 ALFWorld 及 SearchQA,此中 ALFWorld 是模仿家庭情况使命 ,更偏动作履行,SearchQA 是搜刮问答使命,更偏信息检索及推理。
如许设置的目的,是不雅察 SLIM 于差别类型使命中是否都能阐扬作用。试验对于比对于象也比力周全,包括提醒类要领 Zero-Shot、Few-Shot,agent 类要领 ReAct、Reflexion,memory 类要领 Mem0、ExpeL,RL 类要领 GRPO、EvolveR,技术类要领 SkillRL、Skill0,以和研究提出的 SLIM。对于比规模较广,以是可以或许申明 SLIM 不是只比某一类较弱的 baseline 好,而是于多种要领系统中都有竞争力。

SLIM 的基本练习流程可以理解为一个不停轮回的历程。起首,体系会按照当前使命检索相干技术,然后让 agent 带着这些技术去履行使命,接着用 GRPO 更新 policy。练习一段时间后,体系会进入技术审计阶段,也就是查抄差别技术于当前练习状况下还有有无价值。
审计完成后,再决议技术是继承保留、删除了,还有是新增。技术检索时,技术被分成两类,一类是通用技术,合适多种使命中的计谋,另外一类是使命专属技术,针对于某类使命中的详细操作要领。每一次使命只会从当前 active skill set 里检索相干技术,而不是把所有技术全数塞进 prompt,如许可以削减无关技术带来的滋扰。

于判定技术孝敬时,SLIM 利用的焦点要领是 leave-one-skill-out 验证,即姑且禁用某个技术,然后比力禁用先后的验证体现。假如禁用后体现较着降落,申明这个技术仍旧有价值。假如禁用后体现险些稳定,申明相干能力可能已经经被模子学会。假如禁用后体现变好,申明这个技术可能孕育发生滋扰。
经由过程这类方式,研究团队可以预计技术的边际外部孝敬。按照孝敬成果,SLIM 会履行三种操作。Retain 指保留技术,合用在技术仍旧较着提高使命体现的环境,作用是让有效的外部能力继承介入后续使命,特别合适步调繁杂、轻易堕落的使命流程。

Retire 指退休技术,合用在技术孝敬持久很低的环境,可能缘故原由包括模子已经经学会相干能力,其他技术已经经笼罩它,技术信息过时,或者者技术会滋扰决议计划,作用是削减无效技术带来的噪声及上下文承担。Expand 指扩大技术,合用在某些使命区域连续掉败的环境,这申明当前技术库笼罩不足,以是体系会从掉败案例中总结新技术,用来补足原有技术库没有笼罩到的能力。
这个扩大历程不是盲目增长技术,而是按照掉败模式举行增补。终极推理时,练习已经经完成,体系会利用终极保留下来的技术调集,只检索相干技术,再也不继承履行保留、退休及扩大。试验中对于比了 SLIM 携带技术及没有携带技术两种环境,二者对于比可以不雅察模子终极是否仍旧依靠外部技术。

03
技术治理走向动态化研究的意义起首于在从头思索“技术连续累积”这类做法。SkillRL 一直增长技术,外貌上看外部常识变多了,但现实利用时可能带来新的问题。技术过量会让检索更易选错,prompt 中也会呈现更多无关信息,agent 甚至可能被过错技术误导,以是技术库其实不是越年夜越好。
其次,研究也反思了“零技术推理”这类做法。Skill0 试图把技术全数内化进模子,一部门技术确凿可以被模子学会,但其实不是所有技术都合适且可以或许放进模子参数里。低频技术、长尾技术及繁杂流程技术,可能仍旧需要保留于外部,假如强迫删除了全数技术,就轻易丧失一些局部但要害的能力。
SLIM 的焦点价值就于在,它不假定技术必需一直增长,也不假定技术终极必需全数消散,而是让技术按照孝敬动态变化,有效的继承保留,无用的逐渐删除了,缺掉的从头扩大,这更靠近真实 agent 练习中的能力治理历程。
从模子参数及外部技术的分工来看,常见能力合适被模子参数接收,反复呈现的简朴流程合适逐渐内化,低频但主要的流程合适外部保留,当前技术库没有笼罩的能力则合适新增技术。是以,SLIM 现实上是于进修“哪些能力放进模子,哪些能力留于外部”。
这也给 agentic RL 带来开导,传统 RL 重要优化 policy,而 SLIM 同时优化 policy 及外部技术调集,使 agent 不只是学会做使命,还有学会何时需要外部帮忙,是以更合适繁杂使命、长流程使命及东西利用使命。
差别使命也需要差别的技术治理方式,ALFWorld 更需要保留外部技术,由于使命触及持续动作、情况状况及挨次约束,SearchQA 更易把技术转化为模子计谋,由于使命更偏搜刮与回覆模式,以是不克不及同一采用“全保留”或者“全删除了”。
整体来看,SLIM 提供了一种更矫捷的技术生命周期治理要领,于练习历程中动态调解外部技术,终极形成一个精简但有用的技术调集,既防止技术过量造成滋扰,也防止技术过少致使能力缺掉。研究的焦点孝敬,是把外部技术调集从固定辅助东西,酿成可以及 policy 一路优化的练习对于象。

雷峰网原创文章,未经授权禁止转载。详情见转载须知。





