纲要

  • 本地私有化部署的价值与适用场景
  • 工具选型:LM Studio + Cherry Studio
    • LM Studio:模型托管与推理服务器
    • Cherry Studio:全能型 AI 对话客户端
  • 部署流程概览
  • 步骤一:安装与配置 LM Studio
    • 下载与语言切换
    • 开启 Hugging Face 代理加速
    • 选择并下载模型(以 DeepSeek‑R1‑Distill‑Qwen‑14B 为例)
  • 步骤二:启动本地推理 API 服务
    • 进入开发者模式
    • 加载模型并启动服务器
    • 理解 OpenAI 兼容接口
  • 步骤三:安装与配置 Cherry Studio
    • 添加 LM Studio 作为模型服务
    • 验证连接并设为默认模型
  • 步骤四:享受本地私有化对话
    • 普通问答与思维链展示
    • 翻译等辅助功能
  • 代码实战:通过 Python 调用本地 API
    • 直接调用 LM Studiochat/completions 端点
    • 完整可运行脚本
  • 总结与进阶建议

本地私有化部署的价值与适用场景

对于注重数据隐私、需要频繁调用模型或希望在无网络环境下使用 AI 的开发者,本地私有化部署是最佳选择。通过将大模型运行在个人电脑或内网服务器上,所有对话数据完全留存在本地,无需担心第三方平台的数据收集,也不必支付 token 费用。

本文将以 DeepSeek 模型为例,使用两款免费、跨平台的工具——LM StudioCherry Studio,手把手带你搭建一套完全运行在本地的 AI 对话助手。即使你是新手,也能在 30 分钟内完成部署。

工具选型

  • LM Studio:一个开源的模型托管与推理工具,支持从 Hugging Face 下载模型,并提供兼容 OpenAI 格式的本地 API 服务。支持 Windows / macOS / Linux。
  • Cherry Studio:一个多功能的 AI 对话客户端,支持接入各种本地或云端模型,内置智能体、知识库、翻译、绘图等能力,界面友好。

二者的组合相当于:LM Studio 是“引擎”,Cherry Studio 是“方向盘”,让你在本地流畅驾驶大模型。

部署流程概览

下载并安装 LM Studio

切换中文 / 开启代理

搜索并下载 DeepSeek 模型

进入开发者模式 / 加载模型

启动本地 API 服务器

下载并安装 Cherry Studio

添加 LM Studio 服务 / 验证连接

开始本地对话

步骤一:安装与配置 LM Studio

访问 lmstudio.ai 下载对应平台的安装包,完成安装后打开软件。

  • 切换语言:点击右下角齿轮图标进入设置,将语言切换为“简体中文”。
  • 开启代理:在设置中勾选“使用 LM Studio 的内置 Hugging Face 代理”(国内用户务必开启,否则模型下载速度极慢或失败)。
  • 切换用户模式:左下角选择“Power User”或“Developer”模式,以解锁模型下载和 API 服务功能。

下载 DeepSeek 模型

点击左侧“发现”选项卡,在搜索框输入 DeepSeek,即可看到社区上传的各类蒸馏版本。根据你的硬件配置选择合适的模型:

  • 7B:适用于 8 GB 内存 + GTX 1660 以上显卡
  • 14B:适用于 16 GB 内存 + RTX 3060 以上显卡
  • 32B:需要 24 GB 显存以上

本文以 DeepSeek‑R1‑Distill‑Qwen‑14B‑Q4_K_M 为例,大小约 9 GB,量化级别 Q4,平衡速度与精度。点击“Download”等待下载完成。

步骤二:启动本地推理 API 服务

模型下载完毕后,切换到“开发者模式”,在顶部选择刚刚下载的模型,然后点击“Start Server”按钮。日志中会显示:

Server started on http://127.0.0.1:1234

这表示本地推理服务已启动,默认端口 1234LM Studio 提供完全兼容 OpenAI 的接口端点:

  • POST /v1/chat/completions
  • POST /v1/completions
  • POST /v1/embeddings
  • GET /v1/models

你可以在设置中修改端口,或开启局域网访问,使其他设备也能调用该服务。

步骤三:安装与配置 Cherry Studio

访问 cherry-ai.com 下载并安装 Cherry Studio。打开后进入设置 → 模型服务 → 添加 → 选择“LM Studio”。

  • API 地址:默认 http://127.0.0.1:1234/v1
  • API Key:可填写任意内容(如 lm-studio),因为本地服务不验证密钥
  • 模型列表:点击管理,选择你已在 LM Studio 中加载的模型

点击“检查”按钮,看到“连接成功”提示即表示配置无误。在“默认模型”中将对话、翻译等功能均设为该本地模型。

步骤四:享受本地私有化对话

返回 Cherry Studio 聊天界面,即可与本地部署的 DeepSeek 进行对话。由于是推理型模型,回答前会展示完整的思考过程(思维链),在本地 14B 模型上,延迟约 20 秒左右,体验与官方 API 几乎一致。

你还可以利用 Cherry Studio 内置的翻译、知识库、智能体等功能,全部依赖本地模型,实现真正的离线 AI 工作站。

代码实战:通过 Python 调用本地 API

除了图形化客户端,你也可以直接用代码与本地服务交互。下面提供一个完整的 Python 脚本,调用 LM Studio 提供的 OpenAI 兼容接口,实现一次推理对话。

环境准备:安装 openai 库。

pip install openai
import openai

# ================= 配置区 =================
BASE_URL = "http://127.0.0.1:1234/v1"   # LM Studio 默认地址
API_KEY = "not-needed"                  # 本地服务随意填写
MODEL = "deepseek-r1-distill-qwen-14b"  # 请改为你在 LM Studio 中加载的模型名
# ==========================================

client = openai.OpenAI(base_url=BASE_URL, api_key=API_KEY)

def chat(prompt: str) -> str:
    response = client.chat.completions.create(
        model=MODEL,
        messages=[{"role": "user", "content": prompt}],
        temperature=0.7,
        max_tokens=512,
    )
    return response.choices[0].message.content

if __name__ == "__main__":
    question = "请用一句话解释什么是机器学习"
    print("用户:", question)
    print("助手:", chat(question))

将脚本中的 MODEL 替换为你在 LM Studio 中实际加载的模型名称(可通过 GET /v1/models 查看)。运行后即可得到本地模型的回复。

若想查看思维链过程,可添加 stream=True 参数,逐块打印响应内容。

总结与进阶建议

通过 LM Studio + Cherry Studio 的组合,我们以零成本实现了完全私有化的 AI 对话助手。这套方案非常适合个人学习、敏感数据处理以及内网环境下的 AI 应用开发。

后续你可以进一步探索:

  • LM Studio 中开启局域网服务,让手机或其他电脑访问同一个模型。
  • 使用 Cherry Studio 的知识库功能,结合本地 RAG 实现私有文档问答。
  • 将本地 API 集成到自己开发的 Agent 框架中,构建完全自主可控的智能体。
Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐