2026年5月AI圈大盘点:Agent热得发烫,模型大战白热化,还有一个反常识的趋势

1. Anthropic 放出大招:Managed Agents 来了

Anthropic 在 4 月 8 日上了 Claude Managed Agents,公开测试。不是画饼——直接对标 OpenAI 的 Assistants API,但路子不一样。

几个要点:

  • 全托管执行层:你定义 agent 的行为和工具,基础设施(编排、沙箱隔离、会话管理、凭证处理)全部 Anthropic 搞定。不用再搭一整套 infra。
  • 长时间运行会话:agent 可以自主跑几个小时,断连不丢进度。这对实际生产太重要了——你不想半夜爬起来看它是不是卡住了。
  • 多 agent 协作(预览阶段):agent 可以自己拉起别的 agent 来并行工作。一个拆任务,分给三个子 agent 同时跑,最后合并结果。
  • 内置评估:定义成功标准,Claude 自己评估自己,迭代改进。

已经在用的大客户: Notion(工作空间内嵌智能体)、Rakuten(企业内部部署,一个 agent 一周上线)、Asana(AI 队友)、Vibecode(prompt 到部署全自动化,声称快 10 倍)。

Anthropic 的工程师博客系列也值得翻翻:“Decoupling the brain from the hands”、“Equipping agents for the real world with Agent Skills”——不是营销稿,是在讲架构。

2. CodeGraph:代码知识图谱,Agent 的"外挂大脑"

如果 Managed Agents 是引擎,CodeGraph 就是轨道。这个项目 4.5 个月涨到 37K 星。

它解决了什么? AI 编码 agent 最浪费 token 的就是一直读文件、搜代码、找上下文。CodeGraph 提前把代码建成本地 SQLite 知识图谱(AST 解析,不是 LLM 总结),然后通过 MCP 协议暴露 8 个工具出来。

支持 20+ 语言: TS/JS、Python、Go、Rust、Java、C#、PHP、Ruby、C/C++、Swift、Kotlin……连 Lua、Svelte、Vue 都有。还能识别 Django、FastAPI、Express、Rails 等框架的路由关系。

怎么用?

npx @colbymchenry/codegraph

自动检测你装了哪家的 agent,一键配好 MCP 配置。之后在 Claude Code 里问"这个函数谁调用的",它直接查图,不需要自己翻代码。

v0.9.8 更新(6月1日): Go 的 Gin 中间件链路追踪、Swift 延迟校验流程、God-file 多阶段问题处理。

这个项目最让我兴奋的是:它第一次让 AI agent 读代码的效率逼近人类直觉——你一眼就能看到"这个函数从哪来到哪去",现在 agent 也能了。

3. stop-slop 和 taste-skill:AI 味去不掉,市场就给你上一课

这可能是最反常识的趋势——两个纯文本 skill 文件加起来快 40K 星。

stop-slop(8K+ ⭐):一份 Markdown 文件,告诉 AI “不要怎么写”。8 条核心规则 + 禁用短语列表 + 应避免结构 + 改写对比示例。看完直拍大腿——每一条 AI 味症状我都见过。

taste-skill(31K+ ⭐):更进一步,教 AI “什么样的输出算有品位”。从 UI/UX 出发,现在扩展成多技能套件。还有个 npm 包 @taste-skill/modern-native

这两个项目爆火的背后是一个残酷的事实:用户对 AI 味的容忍度已经见底了。当每个人都用 ChatGPT 写文章,“作为…”、“值得注意”、“不可忽视的”、"划重点"就成了新的噪音。当全网都是同一种语气,内容就失去了信用。

对于做 API 中转站的来说,这个信号很直接:你的用户也在用 AI 生成内容,如果输出充满 AI 味,他们自己也知道不好。去 AI 味工具链会持续增长。

4. MoneyPrinterTurbo:76K 星的一键视频

这个项目从 60K 到 76K 就一周,涨了 1.6 万星。中文开发者做的 AI 短视频工具,主打"给文案就出片"。不是那种折腾一天才能出结果的——几行配置,一个 prompt,出来的视频发抖音/快手/B站够用。

为什么火?视频是目前最高频的内容消费形态,但生产门槛一直降不下来。MoneyPrinterTurbo 把门槛踩到了地板:不需要剪辑、不需要配音、不需要找素材。虽然效果和专业制作没法比,但搞定 90% 的信息流内容没问题。

对做分发的人来说,这工具值得看。想象一下:一篇技术文章写成脚本 → MoneyPrinterTurbo 出视频 → 全平台分发。一条流水线。

5. Opus 4.8 vs GPT-5.5:真正的"键盘大战"

这次不是社区瞎吵,是真的大佬下场。

基准测试数据(来源:Anthropic 系统卡):

  • SWE-bench Pro(编程):Opus 4.8 69.2% vs GPT-5.5 58.6%
  • Terminal-Bench 2.1(终端操作):Opus 4.8 74.6% vs GPT-5.5 78.2%
  • OSWorld-Verified(计算机操控):Opus 4.8 83.4% vs GPT-5.5 78.7%
  • GraphWalks 1M BFS(长上下文):Opus 4.8 68.1% vs GPT-5.5 45.4%
  • 定价:都是 $5/$25-30 每百万 token

Opus 4.8 在长上下文和 SWE-bench 上明显领先,GPT-5.5 在终端操作上更强。

antirez(Redis 创始人) 直接开喷:

“Anthropic 犯了一个大战略错误。以前他们拿自己新模型比旧模型,这次把 GPT-5.5 放进来了——结果反而让所有人觉得基准测试不可信。”

他的核心质疑很尖锐:如果 Opus 4.8 纸面上碾压 GPT-5.5,但用户实际体验觉得 GPT-5.5 更好用,那基准到底测的是什么?

DHH(Ruby on Rails 创始人) 站 GPT-5.5:

“我遇到的 GPT-5.5 让我惊叹的时刻比 Opus 4.5 以来任何模型都多。编程体验太顺畅了,太棒了。”

他提到用 GPT-5.5 写了 3 万行代码中的大部分。

我的看法: 这个争议的核心不是哪个更强——其实是"测的什么"和"用的什么"之间有了裂缝。Opus 4.8 在长上下文、全代码库推理上确实有架构优势,但 GPT-5.5 在日常编码的"手感"上更好。这两者不矛盾。理想的选择是路由:看任务类型决定用哪个,而不是押一边。

总结几个信号

  1. Agent 工具链在快速收敛 — Managed Agents + CodeGraph 形成"托管执行+本地代码图谱"的组合
  2. 内容质量成了新的焦虑 — 当 AI 内容泛滥,"不像 AI 写的"反而成了稀缺品
  3. 视频生成门槛降到地板 — 文字到视频的 pipeline 已可用,内容分发逻辑在变
  4. 模型选择不是单选题 — Opus 4.8 和 GPT-5.5 各有胜负,路由策略比站队更有价值
Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐