LLM(Large Language Model,大语言模型)是用海量文本训练出来的"下一个词概率机"——你给它一段话,它基于训练时学到的统计规律,预测下一个最可能出现的词元(Token),一个一个吐出来,看起来就像在"思考"和"理解"。GPT、Claude、Gemini、Qwen、DeepSeek、Llama 等背后都是 LLM。

一、它是怎么工作的(通俗版)

想象一个读过整个人类互联网+几千万本书的"接梗朋友":你说半句话,他立刻接出下半句。LLM 干的事本质上一样,只是它的"阅读量"是天文数字。

完整流程:

  1. 分词(Tokenize):把你输入的文字切成模型能处理的数字单元(Token,可以是一个词、一个字、一个标点)

  2. 嵌入(Embedding):把每个 Token 映射成向量,让模型能做数学运算

  3. Transformer 多层网络:这是 LLM 的"发动机",核心是 自注意力机制(Self-Attention)——模型在处理每个词时,会计算它与上下文中所有其他词的关联程度,理解"她"指的是小红而不是苹果

  4. 输出头(LM Head):在词表上算概率分布,挑出概率最高的下一个 Token

  5. 循环:把新生成的 Token 拼回输入,重复上述过程,直到吐出"停止"标记

参数就是模型的"脑细胞数量":GPT-3 有 1750 亿参数,GPT-4 据传超 1 万亿。参数越多,能记住的模式越丰富。

二、LLM 能做什么 & 不能做什么

✅ 能力("涌现"出来的)

  • 写文章、诗歌、代码

  • 翻译语言

  • 总结长文

  • 逻辑推理、数学解题

  • 多轮对话

❌ 局限(工程上必须正视)

  • 幻觉:它可能"自信满满地说错话",因为它只是在预测"听起来合理"的词,不是在查证事实

  • 知识截止:训练完成后知识就冻结了,不知道训练之后世界发生了什么

  • 不会真正学习:跟它聊一万次,模型权重一个字节都不变——要让它"记住",要么微调,要么靠外部记忆/数据库

  • 原生无法操作外部世界:不能直接调 API、读文件、执行代码——需要 Function Calling 或 Agent 框架补齐

三、LLM vs AI Agent:关键区别

这是 2024-2026 年 AI 工程师必须厘清的关系:

维度

LLM

AI Agent

核心定位

推理引擎、语言大脑

自主任务执行系统

工作模式

被动响应,输入才输出

主动驱动,自主推进任务闭环

核心输出

文本、代码、文案

可落地的任务结果、操作日志

工具能力

原生无工具调用

多工具串联调用

记忆机制

仅短期上下文窗口

短期+长期+反思记忆

任务处理

单次指令

拆解复杂长任务,分步执行、纠错重试

一句话讲清关系

LLM 是 Agent 的"大脑",Agent = LLM + 规划 + 记忆 + 工具调用 + 执行闭环 + 自我反思

打个比方:

  • LLM 像只会动脑的顾问:你问问题,他给答案,但不会亲自去查资料、改文件、发邮件

  • AI Agent 像带助理的顾问:顾问(LLM)负责思考,助理(工具+规划+记忆)负责执行——查资料、改文件、发邮件,再把结果反馈给顾问

另一个类比:

  • 你问 LLM:"帮我算 (123+456)×789" → 它可能算错,因为它只是在"猜"下一个词

  • 你给 LLM + Function Calling 一个计算器工具 → 它会调用计算器,得到准确答案

  • 你给 Agent 一个目标:"帮我规划去上海的旅行" → 它会自己决定先搜机票→发现太贵→改搜火车→计算差价→升级酒店→给出完整方案,全程无需你一步步指挥

四、LLM 在 Agent 开发中的地位

在"AI Agent 开发工程师"工作中,LLM 的角色是:

  1. 推理内核:理解用户自然语言输入、做意图识别

  2. 规划器:把"清洗光伏板"这类复杂任务拆解成"移动到A排→横扫→移动到B排→横扫..."

  3. 决策器:根据工具返回结果判断下一步(继续/重试/升级给人)

  4. 反思器:任务失败后分析"为什么失败",调整策略重试

但你不会去训练 LLM——你把 GPT-4、Claude、DeepSeek 等当作"已存在的基础设施"来用,你的价值在于:

  • 怎么把 LLM 和企业 API、数据库、业务系统接起来(工具调用)

  • 怎么让 LLM 在多步任务中不跑偏(规划+反思)

  • 怎么控制成本和延迟(模型路由、缓存、Prompt 压缩)

  • 怎么让它不瞎编(RAG 检索增强、评估集、护栏)

五、工程上必须知道的 LLM 使用模式

1. Prompt Engineering(提示工程)

通过精心设计输入提示来引导模型行为,不需要额外训练。常见技巧:

  • Few-shot:给几个示例

  • Chain-of-Thought(CoT):让模型"一步一步思考"

  • 结构化输出:要求返回 JSON 格式

2. RAG(检索增强生成)

解决"知识截止"和"幻觉"问题:

用户提问 → 向量检索相关文档 → 把文档拼进 Prompt → LLM 基于真实文档回答

向量数据库用 Milvus / Chroma / pgvector。

3. Function Calling / Tool Use

让 LLM 学会"打电话"——输出一个结构化指令表示"我要调用计算器,参数是 X"。这是 Agent 能"动手"的基础。

4. Fine-tuning(微调)

在预训练模型基础上,用特定领域数据继续训练,让模型更擅长某个垂直任务。成本较高,不是 Agent 工程师的日常工作。

六、🎯 一句话总结

LLM 是一个被海量文本喂出来的"超级补全机"——给定上文,用概率预测下一个词,重复这个过程生成回答。它本身只能"说话",不能直接"做事";但通过接入工具调用、记忆、规划、反思机制,LLM 就变成了能自主执行复杂任务的 AI Agent。​ 作为 AI Agent 开发工程师,你不训练 LLM,而是把 LLM 当作"已存在的大脑",你的核心工作是设计 Agent 系统架构、封装工具、搭评估体系、做可靠性工程,让这个"大脑"在企业生产环境里稳定、安全、低成本地"干活"。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐