一、模型选择

以deepseek所有模型为例

1.1 模型配置

模型分类

        目前来看,大语言模型区别于bert等预训练模型的地方在于是否能生成连贯、长篇的自然语言文本,并具备通用的语言理解和推理能力,而参数并不是决定量(Bert-large参数量为3.4亿)。此外,从transformer拆下来的三种模型架构中,仅编码器即bert只能负责一些以往机器学习的分类,预测任务,如命名实体识别,情感分类,意图识别,仅解码器则负责通过输入句子“预测”下一个字,并没有编码器理解的部分(如bert可通过mask任务和下一句预测任务,以及相关嵌入,来通过训练“理解”输入的相对位置,预测下一个字的最大概率),而编码器-解码器则两种兼具。

分类维度类别核心特点代表模型
参数量规模小型 (<1B)轻量、快速、低耗Phi-2, Gemma-2B
中型 (1B~10B)能力与效率的平衡Llama-8B, DeepSeek-V2-Lite
大型 (10B~100B)强大的通用与推理能力Llama-70B, DeepSeek-LLM-67B
超大型 (>100B)顶尖能力,常为MoEGPT-4, DeepSeek-V2/V3
模型架构仅编码器擅长文本理解BERT, RoBERTa
仅解码器擅长文本生成GPT, Llama, DeepSeek全系
编码器-解码器擅长理解后生成T5, Gemini
专家结构密集架构全参数激活,稳定Llama 2, DeepSeek-LLM
混合专家稀疏激活,高性价比Mixtral, DeepSeek-V2/V3
模态能力纯文本仅处理文本Llama 2, DeepSeek-LLM
多模态处理图文音视频GPT-4V, Gemini, Claude 3
文件解析从文件中提取文本处理DeepSeek-V2/V3(激活后)
开放程度封闭模型仅API,不透明GPT-4, Claude 3, 文心一言
开源模型权重公开,可自部署DeepSeek全系, Llama 2/3, Mistral

DeepSeek全家桶

模型系列代表型号参数规模核心架构主要特点应用场景工具链支持
DeepSeek-V1DeepSeek-LLM-7B/67B7B, 67B密集Transformer强大的中英双语基础能力通用对话、内容创作Hugging Face, vLLM
DeepSeek-V2DeepSeek-V2236B (MoE)混合专家架构超高性价比,128K上下文大规模部署、长文档处理官方推理库, vLLM
DeepSeek-V3DeepSeek-V3671B (MoE)升级版MoE顶尖综合能力,高效推理复杂AI应用、企业级部署官方推理库, 优化工具链
DeepSeek-LiteDeepSeek-V2-Lite16B密集Transformer轻量高效,平衡性能与成本资源受限环境、实时应用同V2系列
DeepSeek-CoderDeepSeek-Coder-V2236B (MoE)混合专家架构代码专精,多语言支持开发工具、编程辅助代码IDE插件兼容
DeepSeek-Multimodal集成在各模型中-文件解析+文本理解文档理解,图文信息提取文档处理、内容分析需特定参数激活

1.2 硬件配置

把LLM看作人的大脑,做工作前需要的能力或者环境,大概就有:智慧的大脑、学习工作所需的知识、工作为了让大脑运作起来的配置

大脑:形状(架构)、神经节连接(参数量)、思维模式(注意力机制)、天赋类型(模型类型,如仅解码器)

知识:书本量(输入数据量)、学习方法(训练手段)、学习时长(训练时长)、名师指点(优化算法与损失函数)

配置:心脏(电力)、血液循环(冷却系统)、工作记忆(内存与显存)、感官与四肢(输入输出设备与网络)、后勤保障(存储硬盘)

现实

我现在用的是DeepSeek-R1 (1.5B),大概回答“你好”,需要24秒,回答一个较复杂的问题需要44秒,回答一个Python的加法代码需要105秒

而我使用的电脑配置为 i5-7300HQ / 8G / GTX 1050 Ti 4G / SATA SSD+HDD,大概有以下局限:

GPU (GTX 1050 Ti 4G):核心算力单元。4GB显存是主要瓶颈,加载模型后剩余空间不足,难以高效处理长上下文和复杂计算任务。

系统内存 (8G):关键数据通道。容量紧张导致显存不足时系统被迫使用硬盘交换,造成响应速度急剧下降。

CPU (i5-7300HQ):任务调度中心。负责协调数据在存储、内存和显存间的流动,确保计算流水线持续运转。

存储 (SATA SSD+HDD):模型仓库基地。SSD负责快速加载模型文件,HDD在内存不足时参与数据交换,成为性能瓶颈。

对比

维度DeepSeek-R1 (1.5B)DeepSeek-V1 (6.7B)DeepSeek母公司 (现实服务)
🧠 大脑:形状Transformer仅解码器Transformer仅解码器庞大的云端模型集群,可能集成多种先进架构(如MoE)
🧠 大脑:神经节连接15亿 个参数67亿 个参数提供从数十亿到数千亿参数的不同模型服务
🧠 大脑:思维模式动态稀疏注意力机制经典的多头自注意力机制可能采用创新的MLA注意力等机制,优化长文本处理
🧠 大脑:天赋类型纯文本模型,专为实时交互优化纯文本模型提供通用对话、代码、多模态、深度推理等多种专长模型
📚 知识:书本量基于共享的2.3TB多模态训练集的一部分在超过2万亿词元的数据上训练使用海量、多领域、高质量数据进行训练,规模远超公开数据
📚 知识:学习方法大规模预训练与指令微调海量无监督预训练与指令微调采用包括大规模强化学习在内的前沿训练方法
⚙️ 配置:心脏功耗极低,在CPU上也可运行需要稳定电力,通常在服务器GPU上运行依赖庞大的数据中心,消耗巨额电力
⚙️ 配置:血液循环基础风冷即可满足需要高效的散热系统整个数据中心需要强大的冷却系统,可能采用液冷
⚙️ 配置:工作记忆3GB 内存/显存13GB 显存 (FP16)将整个大模型加载到多张高端GPU的显存
⚙️ 配置:感官与四肢本地设备的输入输出,延迟极低通过服务器网卡和互联网传输通过高速互联网,接收和处理全球用户的海量并发请求

全家桶配置

模型名称特点应用场景CPU要求GPU要求内存要求存储要求其他依赖
DeepSeek-V3最新版本,支持复杂推理、多轮对话、代码生成、多语言处理科研、开发、教育、创意写作、多语言任务至少8核NVIDIA V100或更高32GB以上100GB以上 SSDCUDA 11+,PyTorch 1.10+
DeepSeek-V2支持多轮对话、文本生成、基础代码生成、中等复杂度推理客服、内容创作、基础编程、数据分析至少4核NVIDIA T4或更高16GB以上50GB以上 SSDCUDA 10+,PyTorch 1.8+
DeepSeek-V1基础文本生成、问答、简单推理、低资源需求基础问答、文本生成、简单任务至少2核无GPU或低端GPU8GB以上20GB以上 HDD无特殊依赖
DeepSeek-Lite轻量级模型,适合移动端或嵌入式设备,支持基础文本生成和问答移动应用、嵌入式设备、低功耗场景1-2核无GPU4GB以上10GB以上 HDD无特殊依赖
DeepSeek-Multimodal支持多模态输入(文本、图像、音频),适合跨模态任务多媒体分析、跨模态生成、智能助手至少8核NVIDIA A100或更高64GB以上200GB以上 SSDCUDA 11+,PyTorch 1.10+
DeepSeek-Code专为代码生成和编程任务优化,支持多种编程语言代码生成、编程辅助、自动化开发至少6核NVIDIA V100或更高32GB以上100GB以上 SSDCUDA 11+,PyTorch 1.10+

1.3 个人/企业部署

对比维度个人部署企业部署
核心目标个人使用、学习研究、原型验证对外/对内提供商业服务、集成到产品中
硬件基础单一服务器高端PC(如配备RTX 4090的工作站)GPU服务器集群(多台A100/H100服务器通过高速网络互联)
性能焦点低延迟:追求单个请求的响应速度高吞吐、高并发:追求同时处理成千上万个请求的能力
可用性要求偶尔中断可接受99.9%+ 的高可用性,需要冗余设计,避免单点故障
成本模型一次性硬件投入,电费成本较低巨大的持续投入(硬件采购/租赁、机房、电费、运维团队)
技术栈简单的推理框架(如Ollama, LM Studio)复杂的云原生技术栈(Kubernetes、Docker、模型调度、负载均衡)
安全与合规基础的数据隐私企业级安全(网络隔离、数据加密、访问审计、符合行业法规)
模型维护手动更新,频率低自动化流水线(CI/CD),持续集成、测试和部署新模型
可扩展性垂直升级(换更好的显卡)水平扩展(轻松增加更多服务器节点)
典型场景个人编程助手、离线文档分析智能客服系统、SaaS AI服务、大规模内容审核

二、部署步骤

【保姆级教程】DeepSeek 怎么本地化部署?含模型对比、硬件要求,及详细图文步骤 - 程序员小宇 - 博客园

三、使用

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐