Skip to content

Towards Robust Tool Use in Agents via Experience-Driven Adaptive Guidance

语言:中文 / English

论文:arXiv:2608.03403 代码:https://github.com/WangCan1178/ExpG

ExpG 挑战与概览

简介

本目录归档基于 Agentscope ReMe 的工具使用增强工作 ExpG:在 ReMe 记忆框架之上,从历史工具调用中挖掘、提炼并复用经验,为智能体提供工具的 能力边界最佳实践指导,从而:

  • 在动态或有噪环境下更鲁棒地选择和调用工具;
  • 让较小模型在带有经验指导时超越更大、但无记忆的基线;
  • 在工具选择、工具调用和响应生成等多个阶段带来一致收益。

如何使用 ReMe: 启动 Tool Memory 服务后,历史工具调用经 add_tool_call_result 写入并评估,经 summary_tool_memory 蒸馏成工具级指导,再经 retrieve_tool_memory 取回并注入后续推理。向量存储与服务接口由 ReMe 提供,经验获取 / 蒸馏 / 复用策略由 ExpG 实现。完整实现与实验见 WangCan1178/ExpG


ExpG 机制概览

ExpG 将工具调用视为可学习经验,并通过三阶段流水线完成经验的获取、提炼与复用:

  1. 经验获取(Experience Acquisition)

    • 从历史工具调用轨迹中分析调用质量(成功/失败、代价、时间等);
    • 针对不同工具构建结构化的经验单元,记录调用上下文、参数模式和结果。
  2. 经验蒸馏(Experience Distillation)

    • 过滤无效 / 噪声经验,保留具有代表性的调用模式;
    • 基于“等价类”视角对经验进行聚合,覆盖常见模式与稀有失败模式;
    • 使用 LLM 对经验进行总结,形成可泛化的文本化指导(guidance)。
  3. 经验复用(Experience Reuse)

    • 在未来任务中,根据当前工具调用上下文检索相关经验 / 指导;
    • 将经验引导融入到工具选择、参数生成和响应整理等环节;
    • 使得代理在面对动态环境和不完美反馈时仍能保持稳定表现。

主实验结果

MetaTool、API-Bank、BFCL-V3 上的性能对比(%)。加粗为各模型组内最优。

ModelMethodMetaTool Pass@1MetaTool Avg@3MetaTool Pass@3API-Bank Pass@1API-Bank Avg@3API-Bank Pass@3BFCL-V3 Pass@1BFCL-V3 Avg@3BFCL-V3 Pass@3Total Pass@1Total Avg@3Total Pass@3
GPT-5 nanoNo Method72.6272.7678.4982.9683.4686.9753.8053.0060.9570.8270.6276.63
GPT-5 nanoFew-shot74.1275.1182.3283.7183.9687.2256.1855.2461.3972.3672.6579.28
GPT-5 nanoDRAFT73.9473.0478.9784.2183.4687.2257.2757.2762.2672.5271.5877.23
GPT-5 nanoMem074.9676.1382.9284.9685.2187.2260.9561.6165.0873.9874.6780.35
GPT-5 nanoExpG81.6782.0784.6086.7286.5587.2264.4363.9966.3879.3279.2281.69
DeepSeek-V3No Method83.1082.9484.6684.7184.3885.4658.7959.6565.9478.9278.6681.37
DeepSeek-V3Few-shot82.7483.9086.2885.2184.6386.2260.5260.3067.9079.0879.4582.92
DeepSeek-V3DRAFT80.2380.7982.4484.9685.6386.4762.2661.6168.5577.7077.8080.54
DeepSeek-V3Mem083.8884.5686.4085.4685.5586.4765.0865.1568.3380.7080.9183.12
DeepSeek-V3ExpG85.2685.3886.5287.7287.3987.9769.4169.9272.0282.7682.6184.11
Qwen3-8BNo Method76.5176.9777.7183.9683.8884.2158.7958.2860.3074.4674.4175.56
Qwen3-8BFew-shot79.9379.8382.9283.7182.6284.9660.0959.2961.3976.9176.2779.32
Qwen3-8BDRAFT78.1977.3377.8985.7184.9685.4660.7460.3062.9176.2075.1876.35
Qwen3-8BMem075.0775.4782.3886.2286.0586.4763.3464.9366.1674.6974.9880.07
Qwen3-8BExpG83.5284.8885.0886.4787.8987.9767.4666.9668.3381.0681.8282.48
Qwen3-32BNo Method80.0579.4380.1784.7184.8885.2165.1565.0866.1678.0577.5578.41
Qwen3-32BExpG84.6885.0286.2886.9787.3087.7270.7271.0173.3282.4882.5684.14
Qwen3-235BNo Method78.2579.2380.2985.4685.4685.7171.3771.1573.5478.1378.4979.91
Qwen3-235BExpG86.3486.7086.9487.4786.9788.2279.6178.5280.0485.2984.9885.69

参考代码

路径作用
tool_memory.py官方风格 ReMe Tool Memory HTTP 客户端(add_tool_call_result / summary_tool_memory / retrieve_tool_memory
parse_tool_call_result_prompt.yaml单次工具调用多维评估用的 prompt
summary_tool_memory_prompt.yaml将工具调用历史总结为 guidance 的 prompt
tool_memory_flows.yamlTool Memory 相关的 flow / op 配置摘录

以上为参考片段。完整可运行代码见 WangCan1178/ExpG


引用

bibtex
@misc{wang2026expg,
  title         = {Towards Robust Tool Use in Agents via Experience-Driven Adaptive Guidance},
  author        = {Can Wang and Haoran Chen and Li Yu and Ding Hao and Bohai Zhao and Zhaoyang Liu and Zhiying Tu},
  year          = {2026},
  eprint        = {2608.03403},
  archivePrefix = {arXiv},
  primaryClass  = {cs.AI},
  url           = {https://arxiv.org/abs/2608.03403},
  howpublished  = {\url{https://github.com/WangCan1178/ExpG}}
}

Released under the Apache-2.0 License.