摘要
大语言模型智能体通过构建推理时工作流(结合推理、工具使用和代码执行)来日益解决复杂任务。尽管此类工作流能够灵活地解决问题,但在执行过程中发现的实用流程往往是短暂的:它们有助于解决当前任务,但无法以系统性地惠及未来任务的形式被保留。我们提出 FlowEvo,一个无需训练的框架,可将成功轨迹编译为可复用的技能记录。每条记录将一个可调用的工件与辅助结构化指导配对,并在可行时通过接口、回放和安全检查进行准入。这些技能记录在推理时持久化存储于技能库中。FlowEvo 围绕三个耦合机制组织:(1) 工作流到技能编译,从成功轨迹中提取可复用的可执行工件;(2) 技能到工作流反馈,检索积累的技能以支持未来问题解决——通过直接执行或结构化上下文注入;(3) 技能筛选,监控下游效用并抑制导致负迁移的技能。通过这种“工作流→技能→工作流”的反馈循环,FlowEvo 使智能体能够在不更新模型参数的情况下,随时间积累和优化任务解决能力。在涵盖交互环境(ALFWorld)和代码/数学生成(HumanEval、GSM8K)的基准测试中,实验表明,在我们的实现设置下,FlowEvo 在评估基线中实现了最佳的准确率-成本权衡。在 ALFWorld 上,FlowEvo 达到了 82.8% 的成功率,比最强基线高出 23.6 个百分点,而其每轮平均 token 使用量不到最高效基线的一半。控制消融实验证实,每个机制都对整体结果有贡献。代码已公开于此 https URL。