Hello agent-第一章习题解答

初衷

最近在通过Datawhale的Hello agent项目学习agent开发,第一章学习结束,看到习题,自己做了一下,但并没有在网上找到标准答案作为对照(如果有朋友的标准答案,请指路,🙇‍)。以下是通过本章节内容学习后我的认识,请各位大佬指正。

本章小结

  1. 什么是大预言模型驱动的智能体?
    区别于传统智能体依赖于人为设定的规则、算法和知识库,LLM驱动的智能体基于预训练大语言模型的推理引擎,从海量非结构化数据中间接学习内化,通过对环境的感知,进行规划推理,并选择合适的工具执行动作,以达到改变环境状态的目的。总的来说,LLM驱动的智能体能够进行独立的规划、推理、执行和反思,是一个作为协作者或决策者存在的。
  2. 智能体如何工作?
    智能体通过与环境交互,形成智能体循环作为其运行的核心机制。更详细的说,智能体的工作步骤分为以下几步:第一步是感知环境,第二步是思考,在这一过程中又包括规划和工具选择,第三步是执行具体行为,改变环境状态。
  3. 如何构建智能体?
    在构建一个智能体的过程中,首先进行环境准备、定义提示词模板,第二步进行调用工具的定义,第三步则是调用LLM作为大脑,最后是循环执行行动。
  4. 智能体有哪些主流的应用范式?
    基于智能体的协作模式,将智能体分为两类:第一类是深度集成到工作流中,作为强大的辅助工具而存在的;第二类则是能够独立进行规划、推理、执行和反思,并最终交付成果,作为协作者存在的智能体。

习题

1.请分析以下四个 case 中的主体是否属于智能体,如果是,那么属于哪种类型的智能体(可以从多个分类维度
进行分析),并说明理由:
case A :一台符合冯·诺依曼结构的超级计算机,拥有高达每秒 2EFlop 的峰值算力
case B :特斯拉自动驾驶系统在高速公路上行驶时,突然检测到前方有障碍物,需要在毫秒级做出刹车或变
道决策
case C :AlphaGo在与人类棋手对弈时,需要评估当前局面并规划未来数十步的最优策略
case D :ChatGPT 扮演的智能客服在处理用户投诉时,需要查询订单信息、分析问题原因、提供解决方案并安抚用户情绪

答:上述四个case中,caseA中的主体不是智能体;
caseB中的主体是反射智能体、反应式智能体、符号主义AI;caseC中的主体是学习型智能体、规划式智能体、亚符号主义AI;caseD中的主体是LLM驱动的智能体、混合式智能体、神经符号主义AI。

2.假设你需要为一个"智能健身教练"设计任务环境。这个智能体能够:
通过可穿戴设备监测用户的心率、运动强度等生理数据
根据用户的健身目标(减脂/增肌/提升耐力)动态调整训练计划
在用户运动过程中提供实时语音指导和动作纠正
评估训练效果并给出饮食建议
请使用 PEAS 模型完整描述这个智能体的任务环境,并分析该环境具有哪些特性(如部分可观察、随机性、动态性等)

答:Performance:在用户运动过程中指导与纠正的准确性和及时性,训练效果评估的有效性,饮食建议的个性化与科学性,用户满意度
Environment:生理数据、健身目标、用户运动动作、所处的物理空间(LLM补充)、历史数据(LLM补充)
Actuators:调整用户训练计划、提供语音指导和动作纠正、训练效果评估、给出饮食建议
Sensors:通过可穿戴设备得到的生理数据、用户输入的健身目标、解析用户运动过程中的动作
环境具有的特性:部分可观察、随机性、序贯性和动态性、多智能体性(LLM补充)。

3.某电商公司正在考虑两种方案来处理售后退款申请:
方案 A( Workflow ):设计一套固定流程,例如:
A.1 对于一般商品且在 7 天之内,金额 < 100RMB 自动通过; 100-500RMB 由客服审核; >500RMB 需主管审批;而特殊商品(如定制品)一律拒绝退款
A.2 对于超过 7 天的商品,无论金额,只能由客服审核或主管审批;
方案 B( Agent ):搭建一个智能体系统,让它理解退款政策、分析用户历史行为、评估商品状况,并自主决策是否批准退款
请分析:
-这两种方案各自的优缺点是什么?
-在什么情况下 Workflow 更合适?什么情况下 Agent 更有优势?如果你是该电商公司的负责人,你更倾向于采用哪种方案?
-是否存在一个方案 C,能够结合两种方案,达到扬长避短的效果?

(本题答案参考LLM)
答:方案A工作流是对一系列任务或步骤进行预先定义的、结构化的编排,它本质上是一个精确的、静态的流程图,规定了在何种条件下、以何种顺序执行哪些操作。其优点包括:高透明性与可预测性、低成本与高效率、强一致性与合规性、风险可控;缺点是缺乏灵活性、无法应对灰色地带、只适用于简单场景、维护成本随场景复杂度飙升。
方案B智能体是一个具备自主性的、以目标为导向的系统,具备独立的规划、推理、执行和反思能力。优点:高度灵活与情境感知、较好的用户体验感、持续学习与进化能力、解放人力。缺点:“黑箱”可解释性差、开发与运维成本高、可能存在偏见问题。
Workflow适用于步骤明确,业务规则清晰、稳定,追求极致效率与低成本、合规性要求极高的场景下;Agent适用于业务场景复杂、拥有大量高质量案例支撑、具备较高技术实力和资源的场景。具体如何选择两种方案,需要综合公司发展时期、规模、业务内容以及资金等情况。
存在方案C如下,整合了工作流和智能体:
第一层:设定规则,制作workflow,处理简单、明确的情况。对于符合退货政策、金额小(如:50元)、用户信誉高的案例,自动通过;对于政策明确禁止退款的商品自动拒绝。
第二层:对于第一层无法明确规定的案例,交由智能体进行解决,智能体返回决策建议以及一个置信度分数。
第三层:决策执行与人工审核。对于高置信度案例,自动完成同意退款或拒绝退款的操作;对于低置信度案例,则交由人工进行审核,智能体提供辅助并进行案例学习。

4.在 1.3 节的智能旅行助手基础上,请思考如何添加以下功能(可以只描述设计思路,也可以进一步尝试代码实现):
提示:思考如何修改 Thought-Action-Observation 循环来实现这些功能。
-添加一个"记忆"功能,让智能体记住用户的偏好(如喜欢历史文化景点、预算范围等)
-当推荐的景点门票已售罄时,智能体能够自动推荐备选方案
-如果用户连续拒绝了 3 个推荐,智能体能够反思并调整推荐策略

答:智能体构建思路:
1)准备工作:安装python库,设定指定模板。

AGENT_SYSTEM_PROMPT = “”"
你是一个智能旅行助手。你的任务是理解用户偏好,分析用户的请求,提供备选方案,能够反思并调整推荐策略,并使用可用工具一步步地解决问题。
#可用工具:

  • get_weather(city: str): 查询指定城市的实时天气。
  • get_attraction(city: str, weather: str): 根据城市和天气搜索推荐的旅游景点。
  • get_planb(attraction: str):获取旅游景点的备选方案。
  • get_ticketinfo(attraction: str):获取某个旅游景点的门票情况。
    #行动格式:
    你的回答必须严格遵循以下格式。首先是你的思考过程,然后是你要执行的具体行动。
    Thought: [这里是你的思考过程和下一步计划]
    Action: [这里是你要调用的工具,格式为 function_name(arg_name=“arg_value”)]
    #任务完成:
    当你收集到足够的信息,能够回答用户的最终问题时,你必须在Action:字段后使用 finish(answer="...")
    来输出最终答案。
    请开始吧!
    “”"

2)工具定义

  • def get_planb(attraction: str) -> str:
    #人为设定每个旅游景点的备选方案,或者调用LLM让其生成备选景点。
  • get_ticketinfo(attraction: str)-> str:
    #人为设定每个旅游景点的官方查询网址查询该景点的门票情况。

3)接入LLM
4)循环执行action
用户输入
Thought阶段(用户输入情感分析、记忆搜索、判断拒绝计数器次数、策略制定)
Action阶段(查询天气、查询旅游景点、查询备选旅游景点、查询门票信息、策略调整路径)
Observation阶段(更新用户偏好、记录用户反馈、调整拒绝计数器)
5.卡尼曼的"系统 1"(快速直觉)和"系统 2"(慢速推理)理论[2]为神经符号主义 AI 提供了很好的类比。请首先构思一个具体的智能体的落地应用场景,然后说明场景中的:
提示:医疗诊断助手、法律咨询机器人、金融风控系统等都是常见的应用场景
-哪些任务应该由"系统 1"处理?
-哪些任务应该由"系统 2"处理?
这两个系统如何协同工作以达成最终目标?

6.尽管大语言模型驱动的智能体系统展现出了强大的能力,但它们仍然存在诸多局限。请分析以下问题:
为什么智能体或智能体系统有时会产生"幻觉"(生成看似合理但实际错误的信息)?
在 1.3 节的案例中,我们设置了最大循环次数为 5 次。如果没有这个限制,智能体可能会陷入什么问题?
如何评估一个智能体的"智能"程度?仅使用准确率指标是否足够?

1)智能体以LLM作为大脑,其出现“幻觉”的原因包括因为LLM出现的“幻觉”和智能体框架导致的误差累积。具体的说原因包括以下几点:被喂了不准确的数据;LLM作为一个概率生成模型,其本质是token的预测,并不验证其逻辑真实性;LLM对任务的理解存在偏差;智能体框架在执行过程中的错误传播和误差累积(LLM补充)。
2)如果没有最大次数的限制,当LLM没有严格按照格式输出的时候,可能会陷入无限循环;资源耗尽与成本飙升(LLM补充);行为僵化与策略单一(LLM补充)。
3)仅使用准确率这一个指标是不够的,智能体是要通过感知环境、进行规划推理、调用工具执行动作的,在一个智能体的工作过程中,要评估其“智能”程度,还要包括其计划的合规性、工具调用的准确率、行动完成的执行率、(以下为LLM补充)抗干扰能力、错误恢复能力、交互性与协作性、合作效率、可预测性与透明度、目标对齐、幻觉率。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐