把一项工作接到 Agent 上,最常见的误判,是只看它能不能做,没有先算它值不值得长期跑。模型偶尔完成一次任务不难,真正要算的是每天处理多少次、人工要接管几次、一次错误会不会把省下的工时全部吃回去。一项低频且失败成本很高的任务,即使单次效果很亮眼,也未必值得自动化。

适合交给 Agent 的工作,通常有几个共同点:会重复,输入大致稳定,结果能检查,失败后能恢复。反过来,目标不停变化、结果只能靠主观判断、还握着高权限的任务,就算模型单次表现很好,也不适合直接自动运行。判断时可以先把“这个岗位能不能交给 Agent”改成“这个岗位里的哪一步可以交给 Agent”,任务颗粒度一缩小,答案会清楚很多。

六维任务筛选表

判断维度

先问什么

0 分

1 分

2 分

执行频率

这项任务多久发生一次?

偶发、一次性

每月数次

每周或每天重复

输入稳定性

输入的来源和格式固定吗?

经常变化、依赖临场信息

半结构化,需要整理

来源固定、字段清楚

流程边界

何时开始、何时结束清楚吗?

目标开放,没有停止条件

主流程清楚,例外较多

步骤和停止条件明确

结果可验证性

做完以后怎么判断对错?

只能靠主观判断

可以抽检或人工复核

可以按规则自动核验

所需权限

完成任务需要多大权限?

管理员权限或跨域敏感权限

涉及写入,但可加审批

只读或最小范围权限

失败成本

做错一次会造成什么后果?

不可逆或损失很大

可以回滚,需要人工处理

可以重试,几乎不影响外部

这张表是前期粗筛工具,不是行业统一标准,更不是经过测量验证的成功率模型。每项打 0—2 分后,可以暂时分成三层:9—12 分进入 Agent 试运行;5—8 分采用“Agent 处理、人工确认”;0—4 分先拆小任务,再考虑自动化。阈值还要跟着业务风险调整,权限和失败成本是红线项,哪怕总分到了 10 分,只要其中一项为 0,也要保留人工确认。

高分任务并不神秘。固定来源的行业信息监控、工单分类与回复草稿、CI 失败日志整理,输入和输出都比较清楚,结果也容易核对。内容选题、销售线索判断、合同差异审阅通常落在中间层,Agent 可以完成收集和初稿,人来处理语气、关系与风险。直接付款、删除生产数据、决定员工去留、对外作出法律承诺,则属于低分任务,不适合交给 Agent 独立执行。

筛选完以后,下一步可以做历史回放。历史样本不多时,先从最近 20 次真实输入开始,同一任务再重复运行,记录成功、人工接管和无法立刻发现的错误;这些结果用来寻找失败模式,不足以对外宣称完成率或可靠性。早期先开放读取权限,再增加有限写入,条件成熟后才考虑自动执行,这个顺序能省掉很多返工。

还有一个容易漏掉的动作:把任务写成一张小卡片,只保留六项——触发条件、输入来源、允许调用的工具、输出格式、人工检查点、失败后的处理方式。这张卡片写不清楚,Agent 的执行边界大概率也不清楚。任务卡能稳定下来,再接模型、工具和工作流,才更接近做点真能用的。

这张表同样可以放在 ZGI 这类 Agent Runtime 之前使用:先帮助初筛任务,再接模型、工具和工作流。真正值得自动化的,通常是高频、可验证、可恢复的执行环节;模糊判断和高风险决定仍然留给人。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐