大模型开发基础 | 一文带你了解大模型部署及其调用
一、什么是大模型
AI大模型是人工智能领域的一种新型技术范式,指通过海量数据和巨量参数训练形成的通用性基础模型,具备跨任务迁移能力和复杂问题解决能力。
大模型的强大之处在于它的涌现能力一随着模型参数量和训练数据量的增加,模型会展现出训练过程中未明确赋予的新能力,比如逻辑推理、代码编写、多步骤问题解决等。
二、AI大模型学习及分类

1、AI大模型及上下游产业

2、如何学习?
作为初学者,可以先不用深入了解大模型的实现原理(如Transformer架构、注意力机制或训练细节),而专注于:
1)如何选择适合的AI大模型?
- 考虑应用场景需求
- 评估成本与性能平衡
- 考虑数据隐私要求
2)如何有效利用AI?
- 了解如何接入AI大模型?比如AI平台和工具
- 如何在程序中调用AI大模型?比如APL、SDK和AI开发框架
- 掌握提示工程技巧Prompt Engineering
- 掌握大模型开发工作流
3)了解模型能力边界
- 知道模型能做什么和不能做什么
- 了解模型可能出现的问题(比如幻觉)及处理方法
3、大模型应用开发工作流

4、如何使用?
在选择大模型时,可以关注以下几个维度,这里提供给大家一个对比表格,无需记忆,要用到的时候参考一下即可。

二、实战私有化部署大模型
私有化部署大模型的2种途径
1 云部署
2 本地部署
1、云部署(Linux)
1、选择云服务器配置
推荐配置(最低要求):
CPU:4 核(Intel Xeon 或 AMD EPYC 系列)
内存:16 GB
硬盘:50 GB(系统盘 + 模型存储)
系统:Ubuntu 22.04 LTS
2、登录服务器
- 方式1(新手友好):通过云控制台的 Web SSH 直接登录。
- 方式2(极客专属):本地终端使用 ssh 命令:ssh root@你的服务器IP
3、部署ollama
1) 下载ollama
curl -fsSL https://ollama.com/install.sh | sh
- 启动ollama服务
sudo systemctl start ollama # 启动服务
sudo systemctl enable ollama # 设置开机自启
- 验证安装
ollama --version #
输出示例:ollama version 0.1.20
- 运行模型
ollama pull deepseek-r1-llama:14b
注意:
14b 表示模型大小,越大需要的计算机资源(显卡、内存越多);
建议优先选择小模型测试如1.5b,4b,7b;
下载时间取决于服务器带宽,若中断下载,可用 ollama resume 继续。
2、 本地私有化部署(windows)
1、LLM Studio部署
1)进入到官网后进行下载并安装

2)进入应用下载大模型

3)进入到chat界面并点击顶部的选择按钮,进行搜索和下载新的模型:

4)下载后打开可直接进行对话

2、Ollama部署
1)Ollama官网下载安装包并安装

2)配置环境

3)下载DeepSeek模型
打开Ollama官网,点击顶部的Models链接

4)验证使用DeepSeek模型
假设我们安装了多个DeepSeek模型,可以通过"ollama list"命令查看:

可以通过"ollama run 模型名称"命令运行即可:

可以通过"/bye"命令退出:

3、本地大模型接入的3种方式
1、Chrome插件-Page Assist
1)通过谷歌浏览器官方插件地址搜索Page Assist

2)然后添加到Chrome:

3)固定插件显示位置
安装完成后,我们可以将该插件固定到浏览器顶部

4)进入界面

设置中文: 点击界面右上角的Settings按钮,将语言设置为简体中文,如下图所示:

选择模型: 点击主界面中的第一个下拉框,选择我们刚才下载的模型deepseek-r1:1.5b,如下图所示:

5)启用插件
对话演示: 接下来我们就可以进行对话了,效果如下图所示:

2、ChatBoxAI在线对话
1)打开https://web.chatboxai.app/

2)设置中文

3)配置环境变量
配置环境变量: 在用户环境变量中,我们点击新建,分别新建下面两组变量,如下所示:
OLLAMA_HOST 0.0.0.0 --任何IP都可以访问
OLLAMA_ORIGINS *


4)重启ollama
配置好环境变量后,我们重启下Ollama,目的是让https://web.chatboxai.app/能自动识别连接到Ollama服务,然后刷新下https://web.chatboxai.app/。
设置模型提供方和模型:点击左下角的设置按钮,然后在模型选项卡中选择模型提供方为OLLAMA API,模型选择deepseek-r1:1.5b,然后点击保存,如下图所示:

3、API调用
1)查看API
通过 Ollama 安装的 AI 模型,默认是提供 API 的,你可以在 Ollama API Docs 中查看。

2)Apifox: 调试 Ollama 生成的本地 API
Apifox是一个非常好用的 API 调试、API 文档、API Mock、API 自动化测试工具。通过 Apifox来调试 Ollama 生成的本地 API,点击这里可以立即使用:

保存接口后,来到「运行」页,点击「发送」,你将收到来自 AI 模型返回的响应。

如果要启用流式输出,你可以将"stream": false改为"stream": true。

3)Cherry Studio: 调用本地API进行对话
Cherry Studio是一款集多模型对话、知识库管理、AI绘画、翻译等功能于一体的全能AI助手平台,提供高度自定义的设计、强大的扩展能力和友好的用户体验。

在模型服务总设置Ollama的API地址,即可回到聊天界面进行对话。

四、实战调用大模型(Java)
云端API-KEY与本地API
除了私有化的本地API,API-KEY是可以直接访问大模型服务商(OpenAI、百度、Google等)所提供云端大模型的一串密钥。API-KEY需要去对应服务商的官方进行注册、申请,优点是省时高效,且能够享受本地机器配置无法满足的大参数模型能力,缺点是数据无法保证隐私。本地API则相反,虽然可以保证隐私性,但对硬件要求比较高。在上面的Cherry-studio客户端中,我们就可以看到各种服务商提供的模型配置配置服务。在接下来的例子中,我们也会使用云端API-KEY参与示例。
后端项目初始化
1、环境准备
安装的JDK版本必须是17或21, 不能选择其他版本,因为项目使用最新版本的Spring Boot3和Spring Al开发框架。
2、新建项目
在IDEA中新建项目,选择Spring Initializr模板,注意需要确保Server URL为https://start.spring.io/,配置如图,Java版本选择21:

选择Spring Boot3.4.4版本,可以根据自己的需要添加一些依赖,比如Spring Web和Lombok:
<dependency>
<groupId>org.projectlombok</groupId>
<artifactId>lombok</artifactId>
<version>1.18.36</version>
<optional>true</optional>
</dependency>
3、整合依赖
可以根据自己的需要,整合一些开发项目常用的依赖。此处我们整合Hutool工具库和Knife4i接口文档即可。
1)Hutool.工具库
<dependency>
<groupId>cn.hutool</groupId>
<artifactId>hutool-all</artifactId>
<version>5.8.37</version>
</dependency>
2)Knife4ji接口文档
Knife4j是基于Swagger接口文档的增强工具,提供了更加友好的API文档界面和功能扩展,例如动态参数调试、分组文档等。它适合用于Spring Boot项目中,能够通过简单的配置自动生成接口文档,让开发者和前端快速了解和调试接口,提高开发效率。

再在Maven中添加依赖:
<dependency>
<groupId>com.github.xiaoymin</groupId>
<artifactId>knife4j-openapi3-jakarta-spring-boot-starter</artifactId>
<version>4.4.0</version>
</dependency>
新建controller包用于存放API接口,编写一个健康检查接口用于测试接口文档
@RestController
@RequestMapping("/health")
public class HealthController {
@GetMapping
public String healthCheck() {
return "ok";
}
}
// 然后在application.yml中追加接口文档配置,扫描controller包。这段配置可以从官
// 方文档中复制过来,然后微调即可:
启动项目,访问http://localhost:8123/api/doc.html能够看到接口文档,可以测试调用接口:

四大调用大模型方式
1.SDK接入:使用官方提供的软件开发工具包,最直接的集成方式
2.HTTP接入:通过REST API直接发送HTTP请求调用模型
3.Spring Al:基于Spring生态系统的Al框架,更方便地接入大模型
4.LangChain4j:专注于构建LLM应用的Java框架,提供丰富的Al调用组件
SDK调用
1、按照官方文档安装SDK:
我们使用阿里云百炼平台提供的云端大模型,先在阿里云百炼平台申请一个API-KEY:



2、在pom.xml中引入依赖
<!-- https://mvnrepository.com/artifact/com.alibaba/dashscope-sdk-java -->
<dependency>
<groupId>com.alibaba</groupId>
<artifactId>dashscope-sdk-java</artifactId>
<version>2.19.1</version>
</dependency>
添加API-KEY调用接口:

3、进行调用

HTTP调用
1、按照官方文档查看调用方式
同样使用阿里云百炼平台,选择“curl”:

2、本地调用

Spring Al调用
1、什么是spring AI
Spring Al是Spring生态系统的新成员,旨在简化Al功能与Spring应用的集成。Spring Al通过提供统一接口、支持集成多种AI服务提供商和模型类型、各种AI开发常用的特性(比如RAG知识库、Tools工具调用和MCP模型上下文协议),简化了AI应用开发代码,使开发者能够专注于业务逻辑,提高了开发效率。
官方文档:https://spring.io/projects/spring-ai

2、引入依赖
<dependency> <groupId>com.alibaba.cloud.ai</groupId> <artifactId>spring-ai-alibaba-starter</artifactId> <version>1.0.0-M6.1</version></dependency>
3、编写配置
spring:
application:
name: spring-ai-alibaba-qwq-chat-client-example
ai:
dashscope:
api-key: ${AI_DASHSCOPE_API_KEY}
chat:
options:
model: qwen-plus
4、编写示例代码
// 取消注释即可在 SpringBoot 项目启动时执行
@Component
public class SpringAiAiInvoke implements CommandLineRunner {
@Resource
private ChatModel dashscopeChatModel;
@Override
public void run(String... args) throws Exception {
AssistantMessage output = dashscopeChatModel.call(new Prompt("你好,我是周杰伦"))
.getResult()
.getOutput();
System.out.println(output.getText());
}
}


LangChain4j调用
1、什么是Langchain4j
和Spring Al作用一样,LangChain4是一个专注于构建基于大语言模型(LLM)应用的Java框架,作为知名Al框架LangChain的Java版本,它提供了丰富的工具和抽象层,简化了与LLM的交互和应用开发。

注意:LangChain4j官方是没有支持阿里系大模型的,只能用社区版本的整合大模型包。

2、引入依赖
<dependency>
<groupId>dev.langchain4j</groupId>
<artifactId>langchain4j-community-dashscope</artifactId>
<version>1.0.0-beta2</version>
</dependency>
3、编写配置
创建了一个ChatModel并调用,和Spring Al很像:

4、启动项目

spring AI调用ollama
1、ollama查看模型名称

2、参考官网手册
https://java2ai.com/docs/1.0.0-M6.1/models/ollama/
3、编写示例代码
1)引入依赖
spring:
ai:
ollama:
base-url: http://localhost:11434
chat:
model: llam3.2latest
2)填写配置
// 取消注释即可在 SpringBoot 项目启动时执行
//@Component
public class OllamaAiInvoke implements CommandLineRunner {
@Resource
private ChatModel ollamaChatModel;
@Override
public void run(String... args) throws Exception {
AssistantMessage output = ollamaChatModel.call(new Prompt("你好,我是鱼皮"))
.getResult()
.getOutput();
System.out.println(output.getText());
}
}
3)测试代码
// 取消注释即可在 SpringBoot 项目启动时执行
//@Component
public class OllamaAiInvoke implements CommandLineRunner {
@Resource
private ChatModel ollamaChatModel;
@Override
public void run(String... args) throws Exception {
AssistantMessage output = ollamaChatModel.call(new Prompt("你好,我是周杰伦"))
.getResult()
.getOutput();
System.out.println(output.getText());
}
}
4)启动项目

调用方式对比

五、总结
大模型作为生成式人工智能的核心引擎,正在快速从“云端垄断”走向“开源普惠”和“场景落地”两大方向。一方面,API 即服务(SaaS)的模式让开发者以最低门槛获得强大算力和最新模型更新,适合快速上线原型与商用服务;另一方面,随着模型开源、轻量化、量化技术成熟,本地部署也成为中小企业和个人开发者保护隐私、降低长期成本的可行选择。
不论是语言模型还是多模态模型,其本质都是依赖高质量训练数据 + 大规模参数 + 推理环境三位一体。对于应用开发者来说,真正的门槛从“训练”转移到“如何调用”,重点在于:
- 如何设计清晰、可控的 Prompt(提示词工程)
- 如何结合自己场景做上下文管理(包括对话记忆、知识库检索)
- 如何做到 安全、合规、成本可控(例如 API Key 管理、本地部署选型)
未来,随着行业从“百模大战”走向“高效闭环”,大模型的形态也可能从通用大脑逐步演化为针对不同行业、不同客户需求的“专用智能体(Agent)”。企业与开发者需要根据实际算力、业务需求与隐私要求,在云端即用与本地自托管之间灵活权衡,合理搭配混合架构,才能最大化发挥大模型带来的生产力价值。
六、如何学习大模型 AI ?
由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。
但是具体到个人,只能说是:
“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。
这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。
我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。
我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】


第一阶段(10天):初阶应用
该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。
- 大模型 AI 能干什么?
- 大模型是怎样获得「智能」的?
- 用好 AI 的核心心法
- 大模型应用业务架构
- 大模型应用技术架构
- 代码示例:向 GPT-3.5 灌入新知识
- 提示工程的意义和核心思想
- Prompt 典型构成
- 指令调优方法论
- 思维链和思维树
- Prompt 攻击和防范
- …
第二阶段(30天):高阶应用
该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。
- 为什么要做 RAG
- 搭建一个简单的 ChatPDF
- 检索的基础概念
- 什么是向量表示(Embeddings)
- 向量数据库与向量检索
- 基于向量检索的 RAG
- 搭建 RAG 系统的扩展知识
- 混合检索与 RAG-Fusion 简介
- 向量模型本地部署
- …
第三阶段(30天):模型训练
恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。
到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?
- 为什么要做 RAG
- 什么是模型
- 什么是模型训练
- 求解器 & 损失函数简介
- 小实验2:手写一个简单的神经网络并训练它
- 什么是训练/预训练/微调/轻量化微调
- Transformer结构简介
- 轻量化微调
- 实验数据集的构建
- …
第四阶段(20天):商业闭环
对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。
- 硬件选型
- 带你了解全球大模型
- 使用国产大模型服务
- 搭建 OpenAI 代理
- 热身:基于阿里云 PAI 部署 Stable Diffusion
- 在本地计算机运行大模型
- 大模型的私有化部署
- 基于 vLLM 部署大模型
- 案例:如何优雅地在阿里云私有部署开源大模型
- 部署一套开源 LLM 项目
- 内容安全
- 互联网信息服务算法备案
- …
学习是一个过程,只要学习就会有挑战。天道酬勤,你越努力,就会成为越优秀的自己。
如果你能在15天内完成所有的任务,那你堪称天才。然而,如果你能完成 60-70% 的内容,你就已经开始具备成为一名大模型 AI 的正确特征了。
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐
所有评论(0)