摘要
大型语言模型智能体通过构建推理时工作流(结合推理、工具使用和代码执行)来日益解决复杂任务。尽管此类工作流能够实现灵活的问题求解,但执行过程中发现的有用流程往往是短暂的:它们有助于解决当前任务,却无法以系统性地惠及未来任务的形式被保留。我们提出 FlowEvo,一种无需训练的框架,可将成功轨迹编译为可复用的技能记录。每条记录将可调用构件与辅助结构化指导配对,并在可行时通过接口、回放及安全检查进行准入。这些技能记录在推理时持久化存储于技能库中。FlowEvo 围绕三种耦合机制组织:(1) 工作流到技能编译——从成功轨迹中提取可复用的可执行构件;(2) 技能到工作流反馈——检索累积的技能,通过直接执行或结构化上下文注入来支持未来问题求解;(3) 技能筛选——监控下游效用并抑制导致负迁移的技能。通过这种工作流→技能→工作流的反馈循环,FlowEvo 使智能体能够在不更新模型参数的情况下,随时间积累并精炼任务求解能力。在涵盖交互环境(ALFWorld)和代码/数学生成(HumanEval、GSM8K)的基准测试中,实验表明,在我们的实现设置下,FlowEvo 在评估基线中实现了最佳的准确率-成本权衡。在 ALFWorld 上,FlowEvo 取得了 82.8% 的成功率,比最强基线高出 23.6 个百分点,同时其每轮平均 token 使用量不到最高效基线的一半。受控消融实验证实,每种机制都对整体结果有所贡献。代码已公开于此 https URL。