哪些工作适合交给 AI Agent?
把一项工作接到 Agent 上,最常见的误判,是只看它能不能做,没有先算它值不值得长期跑。模型偶尔完成一次任务不难,真正要算的是每天处理多少次、人工要接管几次、一次错误会不会把省下的工时全部吃回去。一项低频且失败成本很高的任务,即使单次效果很亮眼,也未必值得自动化。
适合交给 Agent 的工作,通常有几个共同点:会重复,输入大致稳定,结果能检查,失败后能恢复。反过来,目标不停变化、结果只能靠主观判断、还握着高权限的任务,就算模型单次表现很好,也不适合直接自动运行。判断时可以先把“这个岗位能不能交给 Agent”改成“这个岗位里的哪一步可以交给 Agent”,任务颗粒度一缩小,答案会清楚很多。

六维任务筛选表
|
判断维度 |
先问什么 |
0 分 |
1 分 |
2 分 |
|
执行频率 |
这项任务多久发生一次? |
偶发、一次性 |
每月数次 |
每周或每天重复 |
|
输入稳定性 |
输入的来源和格式固定吗? |
经常变化、依赖临场信息 |
半结构化,需要整理 |
来源固定、字段清楚 |
|
流程边界 |
何时开始、何时结束清楚吗? |
目标开放,没有停止条件 |
主流程清楚,例外较多 |
步骤和停止条件明确 |
|
结果可验证性 |
做完以后怎么判断对错? |
只能靠主观判断 |
可以抽检或人工复核 |
可以按规则自动核验 |
|
所需权限 |
完成任务需要多大权限? |
管理员权限或跨域敏感权限 |
涉及写入,但可加审批 |
只读或最小范围权限 |
|
失败成本 |
做错一次会造成什么后果? |
不可逆或损失很大 |
可以回滚,需要人工处理 |
可以重试,几乎不影响外部 |
这张表是前期粗筛工具,不是行业统一标准,更不是经过测量验证的成功率模型。每项打 0—2 分后,可以暂时分成三层:9—12 分进入 Agent 试运行;5—8 分采用“Agent 处理、人工确认”;0—4 分先拆小任务,再考虑自动化。阈值还要跟着业务风险调整,权限和失败成本是红线项,哪怕总分到了 10 分,只要其中一项为 0,也要保留人工确认。
高分任务并不神秘。固定来源的行业信息监控、工单分类与回复草稿、CI 失败日志整理,输入和输出都比较清楚,结果也容易核对。内容选题、销售线索判断、合同差异审阅通常落在中间层,Agent 可以完成收集和初稿,人来处理语气、关系与风险。直接付款、删除生产数据、决定员工去留、对外作出法律承诺,则属于低分任务,不适合交给 Agent 独立执行。
筛选完以后,下一步可以做历史回放。历史样本不多时,先从最近 20 次真实输入开始,同一任务再重复运行,记录成功、人工接管和无法立刻发现的错误;这些结果用来寻找失败模式,不足以对外宣称完成率或可靠性。早期先开放读取权限,再增加有限写入,条件成熟后才考虑自动执行,这个顺序能省掉很多返工。
还有一个容易漏掉的动作:把任务写成一张小卡片,只保留六项——触发条件、输入来源、允许调用的工具、输出格式、人工检查点、失败后的处理方式。这张卡片写不清楚,Agent 的执行边界大概率也不清楚。任务卡能稳定下来,再接模型、工具和工作流,才更接近做点真能用的。
这张表同样可以放在 ZGI 这类 Agent Runtime 之前使用:先帮助初筛任务,再接模型、工具和工作流。真正值得自动化的,通常是高频、可验证、可恢复的执行环节;模糊判断和高风险决定仍然留给人。
更多推荐



所有评论(0)