2026年5月AI圈大盘点:Agent热得发烫,模型大战白热化,还有一个反常识的趋势
2026年5月AI圈大盘点:Agent热得发烫,模型大战白热化,还有一个反常识的趋势
1. Anthropic 放出大招:Managed Agents 来了
Anthropic 在 4 月 8 日上了 Claude Managed Agents,公开测试。不是画饼——直接对标 OpenAI 的 Assistants API,但路子不一样。
几个要点:
- 全托管执行层:你定义 agent 的行为和工具,基础设施(编排、沙箱隔离、会话管理、凭证处理)全部 Anthropic 搞定。不用再搭一整套 infra。
- 长时间运行会话:agent 可以自主跑几个小时,断连不丢进度。这对实际生产太重要了——你不想半夜爬起来看它是不是卡住了。
- 多 agent 协作(预览阶段):agent 可以自己拉起别的 agent 来并行工作。一个拆任务,分给三个子 agent 同时跑,最后合并结果。
- 内置评估:定义成功标准,Claude 自己评估自己,迭代改进。
已经在用的大客户: Notion(工作空间内嵌智能体)、Rakuten(企业内部部署,一个 agent 一周上线)、Asana(AI 队友)、Vibecode(prompt 到部署全自动化,声称快 10 倍)。
Anthropic 的工程师博客系列也值得翻翻:“Decoupling the brain from the hands”、“Equipping agents for the real world with Agent Skills”——不是营销稿,是在讲架构。
2. CodeGraph:代码知识图谱,Agent 的"外挂大脑"
如果 Managed Agents 是引擎,CodeGraph 就是轨道。这个项目 4.5 个月涨到 37K 星。
它解决了什么? AI 编码 agent 最浪费 token 的就是一直读文件、搜代码、找上下文。CodeGraph 提前把代码建成本地 SQLite 知识图谱(AST 解析,不是 LLM 总结),然后通过 MCP 协议暴露 8 个工具出来。
支持 20+ 语言: TS/JS、Python、Go、Rust、Java、C#、PHP、Ruby、C/C++、Swift、Kotlin……连 Lua、Svelte、Vue 都有。还能识别 Django、FastAPI、Express、Rails 等框架的路由关系。
怎么用?
npx @colbymchenry/codegraph
自动检测你装了哪家的 agent,一键配好 MCP 配置。之后在 Claude Code 里问"这个函数谁调用的",它直接查图,不需要自己翻代码。
v0.9.8 更新(6月1日): Go 的 Gin 中间件链路追踪、Swift 延迟校验流程、God-file 多阶段问题处理。
这个项目最让我兴奋的是:它第一次让 AI agent 读代码的效率逼近人类直觉——你一眼就能看到"这个函数从哪来到哪去",现在 agent 也能了。
3. stop-slop 和 taste-skill:AI 味去不掉,市场就给你上一课
这可能是最反常识的趋势——两个纯文本 skill 文件加起来快 40K 星。
stop-slop(8K+ ⭐):一份 Markdown 文件,告诉 AI “不要怎么写”。8 条核心规则 + 禁用短语列表 + 应避免结构 + 改写对比示例。看完直拍大腿——每一条 AI 味症状我都见过。
taste-skill(31K+ ⭐):更进一步,教 AI “什么样的输出算有品位”。从 UI/UX 出发,现在扩展成多技能套件。还有个 npm 包 @taste-skill/modern-native。
这两个项目爆火的背后是一个残酷的事实:用户对 AI 味的容忍度已经见底了。当每个人都用 ChatGPT 写文章,“作为…”、“值得注意”、“不可忽视的”、"划重点"就成了新的噪音。当全网都是同一种语气,内容就失去了信用。
对于做 API 中转站的来说,这个信号很直接:你的用户也在用 AI 生成内容,如果输出充满 AI 味,他们自己也知道不好。去 AI 味工具链会持续增长。
4. MoneyPrinterTurbo:76K 星的一键视频
这个项目从 60K 到 76K 就一周,涨了 1.6 万星。中文开发者做的 AI 短视频工具,主打"给文案就出片"。不是那种折腾一天才能出结果的——几行配置,一个 prompt,出来的视频发抖音/快手/B站够用。
为什么火?视频是目前最高频的内容消费形态,但生产门槛一直降不下来。MoneyPrinterTurbo 把门槛踩到了地板:不需要剪辑、不需要配音、不需要找素材。虽然效果和专业制作没法比,但搞定 90% 的信息流内容没问题。
对做分发的人来说,这工具值得看。想象一下:一篇技术文章写成脚本 → MoneyPrinterTurbo 出视频 → 全平台分发。一条流水线。
5. Opus 4.8 vs GPT-5.5:真正的"键盘大战"
这次不是社区瞎吵,是真的大佬下场。
基准测试数据(来源:Anthropic 系统卡):
- SWE-bench Pro(编程):Opus 4.8 69.2% vs GPT-5.5 58.6%
- Terminal-Bench 2.1(终端操作):Opus 4.8 74.6% vs GPT-5.5 78.2%
- OSWorld-Verified(计算机操控):Opus 4.8 83.4% vs GPT-5.5 78.7%
- GraphWalks 1M BFS(长上下文):Opus 4.8 68.1% vs GPT-5.5 45.4%
- 定价:都是 $5/$25-30 每百万 token
Opus 4.8 在长上下文和 SWE-bench 上明显领先,GPT-5.5 在终端操作上更强。
antirez(Redis 创始人) 直接开喷:
“Anthropic 犯了一个大战略错误。以前他们拿自己新模型比旧模型,这次把 GPT-5.5 放进来了——结果反而让所有人觉得基准测试不可信。”
他的核心质疑很尖锐:如果 Opus 4.8 纸面上碾压 GPT-5.5,但用户实际体验觉得 GPT-5.5 更好用,那基准到底测的是什么?
DHH(Ruby on Rails 创始人) 站 GPT-5.5:
“我遇到的 GPT-5.5 让我惊叹的时刻比 Opus 4.5 以来任何模型都多。编程体验太顺畅了,太棒了。”
他提到用 GPT-5.5 写了 3 万行代码中的大部分。
我的看法: 这个争议的核心不是哪个更强——其实是"测的什么"和"用的什么"之间有了裂缝。Opus 4.8 在长上下文、全代码库推理上确实有架构优势,但 GPT-5.5 在日常编码的"手感"上更好。这两者不矛盾。理想的选择是路由:看任务类型决定用哪个,而不是押一边。
总结几个信号
- Agent 工具链在快速收敛 — Managed Agents + CodeGraph 形成"托管执行+本地代码图谱"的组合
- 内容质量成了新的焦虑 — 当 AI 内容泛滥,"不像 AI 写的"反而成了稀缺品
- 视频生成门槛降到地板 — 文字到视频的 pipeline 已可用,内容分发逻辑在变
- 模型选择不是单选题 — Opus 4.8 和 GPT-5.5 各有胜负,路由策略比站队更有价值
更多推荐



所有评论(0)