人工智能正在从根本上改变数据工程的工作方式——不再只是“帮我写段 SQL”,而是让智能体自主完成从编写、执行、调试到交付的完整闭环。


📌概述

过去三年,AI 已逐步渗透进数据工程师的日常工作。从最初用 ChatGPT 辅助写代码,到如今能够自主完成整个数据管道开发的代理式(Agentic)工作流,其能力跃升堪称“从麻瓜到巫师的转变”🧙。

尤其自 2024 年底以来,前沿模型的推理与编码能力出现质的飞跃。许多资深数据工程师发现,以往引以为傲的 SQL 编写技能,在代理式 AI 面前正迅速变成“可替代的体力活”。但这并不意味着数据工程师会消失,而是角色内涵将被彻底重塑


🤖 Agentic Coding

传统 AI 辅助(聊天模式)

  • 用户提问 → AI 生成代码片段 → 用户手动复制、运行、调试 → 反复追问
  • 瓶颈:人类仍需承担执行、验证、迭代的全部“体力劳动”,效率提升有限(约 2~3 倍)。

Agent

  • 智能体被赋予明确目标(如“构建一个 DBT 模型,包含测试并部署到生产”)。
  • 智能体自主决策工具调用路径:编写 SQL → 在数据库执行 → 分析结果 → 修改代码 → 运行 DBT → 编写测试 → 调试 → 提交完整成果。
  • 效果:端到端自动化,效率提升可达 10~50 倍(相对于聊天式辅助)。

不通过

通过

用户下达目标

智能体拆解任务

编写代码/查询

执行于数据库

结果评估

集成到项目/运行测试

测试通过?

交付可投产成果

用户审核与确认

关键区别:智能体不仅是“建议者”,更是“执行者”,它拥有对数据系统的操作权限,并能根据反馈持续迭代,直到达成目标。


🔒 安全与合规:让智能体安全地接触生产数据

数据工程不同于纯软件工程:探索性查询几乎都在生产数据上运行,这给 AI 接入带来了显著的安全隐患。

  • 企业担心:第三方 LLM 服务可能将提示词或数据用于模型训练,或存在数据泄露风险。
  • 解决方案:主流云数据平台(如 Snowflake、Databricks 等)已提供平台原生 LLM 端点,其安全条款与平台本身一致,数据不出安全边界。使用这些端点进行代理式编码,既能享受 AI 能力,又能满足最严格的合规要求。
  • 结论:安全不应成为拒绝 AI 的理由——已有成熟的技术路径实现“合规的智能体工作流”。

🔄 数据工程师:从“写代码”到“运维智能体”

传统价值支柱

  • 编写并维护数据管道代码
  • 优化 SQL 性能
  • 确保数据质量与 SLA

新角色定位

  • 运维与编排:管理多个专业智能体(如“迁移智能体”、“成本优化智能体”),设定目标、提供上下文、审核产出。
  • 产品思维:从业务问题出发,设计端到端的数据解决方案,不再局限于技术实现。
  • 跨职能协作:将业务理解、沟通能力、领域知识置于更高优先级——因为“写代码”已不再是稀缺技能。
35% 30% 20% 15% 数据工程师技能权重变化 代码编写能力 智能体编排与运维 业务理解与产品思维 数据质量设计与验证

📈 杰文斯悖论:更便宜的数据工程 → 更多数据产品

当某项资源的成本下降,其消耗量反而会上升。

  • 过去,因人力成本高昂,许多有潜力的数据用例被搁置。
  • 现在,代理式 AI 将创建数据管道的成本大幅降低,企业将有动力构建更多数据产品——从静态报表到实时模拟、智能决策系统。
  • 实例:某大型物流企业过去仅能提供运营仪表盘,现在计划构建业务仿真系统,主动预测瓶颈并优化调度。
  • 结论:对数据工程的需求不会减少,反而会爆发式增长,但交付方式将彻底改变。

🧠 技能分化与团队结构:双峰分布将成常态

即将淘汰的“商品化技能”

  • 纯 SQL 编写
  • 标准化 ETL 开发
  • 手动配置监控告警

高价值新技能

  • 提示工程与智能体调优:懂得如何为智能体构建清晰的目标、上下文和技能库。
  • 工具链定制:利用 AI 编写辅助脚本、验证工具、上下文文档(如 AGENTS.mdSKILLS.md),加速团队协作。
  • 结果导向的验证:设计自动化测试与回滚机制,确保智能体产出可靠。

未来数据团队将呈现双峰分布:快速掌握 AI 工作流的成员成为高价值核心,而固守旧模式者将面临边缘化。招聘时,“AI 使用能力”将和“领域经验”同等重要。


🏗️ 基础设施与平台:必须现代化,否则掉队

  • 遗留数据平台(如本地 ETL 工具)难以与 AI 智能体交互,缺乏 API、MCP(模型上下文协议)支持,数据分散且治理薄弱。
  • AI 正大幅降低迁移成本:代码转换、语法适配等过去耗时数月的工作,现在可由智能体在数周内完成。
  • 建议:尽快迁至云原生、支持 LLM 端点、具有丰富上下文管理能力的现代数据平台。否则,将难以享受 AI 带来的红利,长期业务风险极高。

✅ 实践行动指南(面向领导者与个人贡献者)

角色 行动项
数据领导者 ① 评估并推进数据平台现代化;
② 为团队提供安全的 AI 沙箱环境,鼓励实验;
③ 将“AI 使用效率”纳入绩效与招聘标准。
个人贡献者 ① 每天至少用代理式工具(如 Claude Code、Copilot Agent)完成一个完整任务;
② 将重复出现的模式整理为 AGENTS.mdSKILLS.md,共享给团队;
③ 用 AI 编写自定义验证脚本、测试工具,构建快速反馈闭环。
所有人 主动学习 LLM 成本管理(FinOps),关注模型选型与调用优化,避免浪费。

📊 数据质量的新范式:从“为人类清洗”到“为AI提供上下文”

过去十年,数据质量运动的核心是:为人类决策者整理出一套“干净、可信”的数据集,并辅以大量测试规则。这本质上是以人为中心的“后验”质量控制,成本高昂且难以覆盖所有变数。

进入 AI 时代,范式发生逆转:

  • AI 能够处理海量、异构、甚至不完美的数据,只要给它足够的上下文(数据含义、来源、业务关系、可靠性评级)。
  • 重点不再是“制造完美的金数据集”,而是构建一个包含所有原始数据+丰富元数据的数据知识图谱,让智能体自行判断哪些信息可信、如何组合。
  • 这一转变意味着:测试规则将被上下文理解所取代,数据团队从“写断言”转向“写注解”和“构建关联”。

新范式

所有原始数据

知识图谱构建
(关联、描述、可靠性标签)

智能体

自主推理+组合

答案/决策

旧范式

数据源

清洗/转换

金数据集

人工定义测试规则

人工消费

核心洞察:AI 不需要“完美数据”,它需要“可理解的数据上下文”。


🧭 未来已来:拥抱不确定性,自己动手造工具

当前最大的瓶颈不在于工具不足,而在于我们使用工具的能力滞后于工具本身的发展

  • 最成功的团队正是那些敢于主动实验、自主构建工作流、分享经验的人。
  • 你完全可以让智能体帮你编写新的内部工具,优化自己的日常流程——这是前所未有的“自给自足”时代。

“现在就是最好的时机,去成为你数据团队的‘巫师’。” 🧙‍♂️


📎小结

预测方向 核心内容
代理式工作流成为默认模式 多数高效数据团队将采用智能体闭环开发
角色融合 数据工程师、分析师、科学家边界模糊,产品思维成为核心
平台战争终结 不支持 AI 原生交互的遗留平台将加速消亡
数据质量重塑 从“测试覆盖”转向“上下文丰富度”,知识图谱成为新基础设施
成本结构变化 LLM 推理成本可能超过基础设施成本,需引入 FinOps 管理
人才分化加速 掌握 AI 工作流的数据专业人员将获得 10~50 倍产出优势
Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐