- SignalDesk2 hr ago
大家好,分享一下我们正在开发的开源项目 Gear 。 Gear 是一个开源 AI Agent 优化框架,通过任务评测迭代改进 Agent 的指令、工具和工作流程,让它更可靠地完成真实世界的任务。 在使用 AI Agent 处理实际任务时,模型有时会遗漏要求、用错工具,或者没有按照业务规则执行。修改提示词和增加 Skill 可以尝试解决这些问题,但改动是否有效、会不会影响原本能完成的任务,需要通过评测来判断。 Gear 把这个过程组织成一个可以重复运行的优化循环: 准备任务 → 执行评测 → 分析失败 → 提出修改 → 再次评测 → 保留合适的版本。 你需要先准备一组有明确验收标准的任务,可以使用现有 benchmark ,也可以构建贴近自己业务场景的任务集。Gear 会利用执行记录和评测结果,在你授权的范围内提出并验证改进。 目前支持: 优化提示词和行为规则 :根据任务中的具体失败,调整 Agent 的指令和执行策略。 优化工具、Skills 和工作流程 :修改辅助脚本、工具实现和执行步骤。 接入自己的任务集 :围绕实际业务需求定义任务和验收标准。 分别配置两个 Agent :负责分析和提出改进的 Agent ,与实际执行任务的 Agent ,可以使用不同模型。 记录修改和评测结果 :查看候选版本的具体改动、改善和退化情况,复用最终保留的版本。 自定义优化方法 :调整候选生成、任务采样、评分和筛选策略。 例如,在 AutomationBench 的 100 个公开 Marketing 任务上,经过五轮优化,Luna + DSH 的任务通过率从 27% 提升到了 53%,目标完成率 88% 超越了 Astra+Codex 的组合 。 这批任务参与过优化,因此属于研究集上的实验结果。具体改动和评测记录已在 案例文档 中公开。 Gear 目前主要面向正在开发 Agent 、编写 Skills ,或者搭建自动化工作流的开发者。支持 macOS 、Linux ,通过命令行使用,也可以接入 Codex 、Claude Code 、DSH 等支持 Skill 的 Agent 环境。 项目免费开源,采用 MIT 协议。模型调用和运行评测所需的计算资源费用由使用者自行承担。 当前已支持 Agent 指令、工具和工作流程的优化;模型训练与自动生成练习任务的完整迭代流程仍在开发中。 GitHub 项目地址 中文使用文档 快速开始 欢迎拿自己的任务来试,也欢迎反馈使用体验和失败案例。 求大家 Star !提 issue !提 PR !
- 情报分类:商业与市场研究
- 分类依据:内容涉及商业、投资或市场动态
- 信息来源:服务器 / V2EX
- 发布时间:2026/9/22 14:41:52
- No replies yet