AI Agent白手起家15: 本地私有化AI对话助手部署实战
纲要
- 本地私有化部署的价值与适用场景
- 工具选型:
LM Studio+Cherry StudioLM Studio:模型托管与推理服务器Cherry Studio:全能型 AI 对话客户端
- 部署流程概览
- 步骤一:安装与配置
LM Studio- 下载与语言切换
- 开启 Hugging Face 代理加速
- 选择并下载模型(以 DeepSeek‑R1‑Distill‑Qwen‑14B 为例)
- 步骤二:启动本地推理 API 服务
- 进入开发者模式
- 加载模型并启动服务器
- 理解 OpenAI 兼容接口
- 步骤三:安装与配置
Cherry Studio- 添加
LM Studio作为模型服务 - 验证连接并设为默认模型
- 添加
- 步骤四:享受本地私有化对话
- 普通问答与思维链展示
- 翻译等辅助功能
- 代码实战:通过 Python 调用本地 API
- 直接调用
LM Studio的chat/completions端点 - 完整可运行脚本
- 直接调用
- 总结与进阶建议
本地私有化部署的价值与适用场景
对于注重数据隐私、需要频繁调用模型或希望在无网络环境下使用 AI 的开发者,本地私有化部署是最佳选择。通过将大模型运行在个人电脑或内网服务器上,所有对话数据完全留存在本地,无需担心第三方平台的数据收集,也不必支付 token 费用。
本文将以 DeepSeek 模型为例,使用两款免费、跨平台的工具——LM Studio 和 Cherry Studio,手把手带你搭建一套完全运行在本地的 AI 对话助手。即使你是新手,也能在 30 分钟内完成部署。
工具选型
LM Studio:一个开源的模型托管与推理工具,支持从 Hugging Face 下载模型,并提供兼容 OpenAI 格式的本地 API 服务。支持 Windows / macOS / Linux。Cherry Studio:一个多功能的 AI 对话客户端,支持接入各种本地或云端模型,内置智能体、知识库、翻译、绘图等能力,界面友好。
二者的组合相当于:LM Studio 是“引擎”,Cherry Studio 是“方向盘”,让你在本地流畅驾驶大模型。
部署流程概览
步骤一:安装与配置 LM Studio
访问 lmstudio.ai 下载对应平台的安装包,完成安装后打开软件。
- 切换语言:点击右下角齿轮图标进入设置,将语言切换为“简体中文”。
- 开启代理:在设置中勾选“使用 LM Studio 的内置 Hugging Face 代理”(国内用户务必开启,否则模型下载速度极慢或失败)。
- 切换用户模式:左下角选择“Power User”或“Developer”模式,以解锁模型下载和 API 服务功能。
下载 DeepSeek 模型
点击左侧“发现”选项卡,在搜索框输入 DeepSeek,即可看到社区上传的各类蒸馏版本。根据你的硬件配置选择合适的模型:
- 7B:适用于 8 GB 内存 + GTX 1660 以上显卡
- 14B:适用于 16 GB 内存 + RTX 3060 以上显卡
- 32B:需要 24 GB 显存以上
本文以 DeepSeek‑R1‑Distill‑Qwen‑14B‑Q4_K_M 为例,大小约 9 GB,量化级别 Q4,平衡速度与精度。点击“Download”等待下载完成。
步骤二:启动本地推理 API 服务
模型下载完毕后,切换到“开发者模式”,在顶部选择刚刚下载的模型,然后点击“Start Server”按钮。日志中会显示:
Server started on http://127.0.0.1:1234
这表示本地推理服务已启动,默认端口 1234。LM Studio 提供完全兼容 OpenAI 的接口端点:
POST /v1/chat/completionsPOST /v1/completionsPOST /v1/embeddingsGET /v1/models
你可以在设置中修改端口,或开启局域网访问,使其他设备也能调用该服务。
步骤三:安装与配置 Cherry Studio
访问 cherry-ai.com 下载并安装 Cherry Studio。打开后进入设置 → 模型服务 → 添加 → 选择“LM Studio”。
- API 地址:默认
http://127.0.0.1:1234/v1 - API Key:可填写任意内容(如
lm-studio),因为本地服务不验证密钥 - 模型列表:点击管理,选择你已在 LM Studio 中加载的模型
点击“检查”按钮,看到“连接成功”提示即表示配置无误。在“默认模型”中将对话、翻译等功能均设为该本地模型。
步骤四:享受本地私有化对话
返回 Cherry Studio 聊天界面,即可与本地部署的 DeepSeek 进行对话。由于是推理型模型,回答前会展示完整的思考过程(思维链),在本地 14B 模型上,延迟约 20 秒左右,体验与官方 API 几乎一致。
你还可以利用 Cherry Studio 内置的翻译、知识库、智能体等功能,全部依赖本地模型,实现真正的离线 AI 工作站。
代码实战:通过 Python 调用本地 API
除了图形化客户端,你也可以直接用代码与本地服务交互。下面提供一个完整的 Python 脚本,调用 LM Studio 提供的 OpenAI 兼容接口,实现一次推理对话。
环境准备:安装 openai 库。
pip install openai
import openai
# ================= 配置区 =================
BASE_URL = "http://127.0.0.1:1234/v1" # LM Studio 默认地址
API_KEY = "not-needed" # 本地服务随意填写
MODEL = "deepseek-r1-distill-qwen-14b" # 请改为你在 LM Studio 中加载的模型名
# ==========================================
client = openai.OpenAI(base_url=BASE_URL, api_key=API_KEY)
def chat(prompt: str) -> str:
response = client.chat.completions.create(
model=MODEL,
messages=[{"role": "user", "content": prompt}],
temperature=0.7,
max_tokens=512,
)
return response.choices[0].message.content
if __name__ == "__main__":
question = "请用一句话解释什么是机器学习"
print("用户:", question)
print("助手:", chat(question))
将脚本中的 MODEL 替换为你在 LM Studio 中实际加载的模型名称(可通过 GET /v1/models 查看)。运行后即可得到本地模型的回复。
若想查看思维链过程,可添加 stream=True 参数,逐块打印响应内容。
总结与进阶建议
通过 LM Studio + Cherry Studio 的组合,我们以零成本实现了完全私有化的 AI 对话助手。这套方案非常适合个人学习、敏感数据处理以及内网环境下的 AI 应用开发。
后续你可以进一步探索:
- 在
LM Studio中开启局域网服务,让手机或其他电脑访问同一个模型。 - 使用
Cherry Studio的知识库功能,结合本地RAG实现私有文档问答。 - 将本地 API 集成到自己开发的 Agent 框架中,构建完全自主可控的智能体。
更多推荐


所有评论(0)