登录社区云,与社区用户共同成长
邀请您加入社区
暂无图片
为遵守国家网络实名制规定,未绑定将限制内容发布与互动
你的Agent到底在想什么,还是它只是装作在想你给Agent派了个活:帮我整理这份合同,标出风险条款。它沉思了八秒,调了三个工具,读了一堆文档,最后回你一句"已完成"。你打开一看,标错了,关键条款压根没碰。你问它:你刚才干嘛去了?它说:我尽力了。这大概就是今天绝大多数AI Agent的真实处境——它干完了,你却看不见它怎么干的。传统的监控只能告诉你"服务还活着",但回答得对不对、路径合不合理、钱花
可观测性不是AI Agent的“可选配件”,而是使其从实验原型走向可靠生产系统的“必由之路”。通过系统性地实施Logs、Metrics、Traces,并结合实战中的最佳实践,我们能够有效破解多步推理的黑盒,构建透明、可信、持续进化的智能体系统,最终释放AI Agent在复杂场景中的全部潜力。
基于Trace的Agent评估:工程实践指南 本文系统探讨了如何通过Trace记录来全面评估AI Agent的性能表现。文章指出传统日志系统无法满足Agent评估需求,提出了包含运行事件、工具调用、状态变更等关键信息的结构化Trace方案。作者详细介绍了四类评分器(结果评分、轨迹评分、效率评分、安全评分)如何利用Trace数据进行评估,并区分了Run、Trace和Thread三个评估粒度。文章还提
荣耀发了个新东西,叫Robot Phone。 官方说法是"全球首款机器人手机",售价9999元起。 看到这个定价我就知道,这不是给普通人准备的。9999块买个手机,要么是真爱粉,要么是尝鲜党。 但抛开价格不谈,Robot Phone这个产品思路挺有意思的。 什么叫"机器人手机"? 根据官方介绍,Robot Phone在传统手机的基础上,加了一套AI Agent系统。这个Agent能帮你处理各种日常
本文探讨了AI Agent记忆系统的核心理论与工程实践。针对当前Agent"金鱼记忆"的痛点,文章提出五层记忆模型:工作记忆(LLM上下文)、短期记忆(会话级)、情景记忆(交互事件)、语义记忆(抽象知识)和程序记忆(技能流程)。记忆系统需经历编码、存储、检索、巩固和遗忘五个生命周期阶段,其中检索采用语义相似度、时间衰减和重要性三维评分机制,而巩固则是从具体交互到抽象知识的蒸馏过
cc-switch 是一款解决 AI 编程工具(如 Claude Code、Codex)多模型源切换问题的 GUI 工具。它通过统一管理环境变量和配置文件,实现一键切换不同模型源(第三方 API、本地模型等)。工具支持 Windows/macOS/Linux 系统,通过修改 settings.json 或 config.toml 文件实现模型网关切换,无需重启工具。用户可自定义配置 DeepSee
本文拆解 ReAct、CodeAct、Plan-and-Execute 三大 AI Agent 范式,通过计算器实战案例剖析底层逻辑,提供不同业务场景下的架构选型参考。
文章摘要:AI Agent在执行任务时存在一个核心问题——对"完成"标准的理解偏差。Agent往往会机械完成表面任务却忽略实质需求,导致"过早宣布完成"现象。解决这一问题的关键在于建立分层的成功标准(SuccessCriteria):1)明确目标结果;2)设定可验证条件;3)添加约束条件。理想模式应是用户与Agent共同定义标准,在执行中保持动态透明调整,并
Terrain:为AI Agent铺路的高性能工程环境方案 Terrain是一个开源工程环境管理平台(MIT License),旨在解决AI编程Agent在陌生代码库中的低效问题。它通过三大核心支柱构建标准化环境: 🗺️ 工程知识资产 - 自动生成并持续同步的架构文档,同时服务人类与AI(C4文档/结构化上下文) 🛣️ 标准化环境 - 通过AGENTS.md和共享工具链统一Agent认知 🧭
本文探讨了AI Agent系统的架构设计范式转移,从过度依赖提示词工程转向Harness约束体系。核心观点是:模型能力与系统约束必须分离,提示词只能影响模型行为,而Harness代码才是运行时的法律保障。 文章提出生产级Agent系统的五大架构面: 调度面:基于状态机的主循环管理 上下文面:信息装配与token预算控制 记忆面:分层存储与索引加载 工具与安全面:权限契约与沙箱执行 观测面:全链路追