2025年大模型推理框架全解析:从零开始的实用指南(必收藏)

大模型经过漫长的训练,最终需要推理评估,走向实际应用。就像人一样,经过多年的学习,最终需要通过面试,走向社会工作。
严格意义上,推理引擎和推理框架是不同的,推理引擎是实际执行大模型计算的代码库,提供了推理加速的功能,如PagedAttention、Continuous Batching等。推理框架集成了推理引擎,提供了更加完善的功能,背后实际提供计算的还是推理引擎。但目前业界似乎划分的没有那么明确。
大模型推理部署是大模型走向应用的关键一环,极致优化的推理框架能够缩短延迟、降低成本。
大模型推理技术发展的比较快,目前已有许多开源的大模型推理框架,很多大模型推理框架在2023年出现。
今天给大家介绍一些目前比较主流的大模型推理工具/引擎/框架。
LMStudio、llama.cpp、Ollama、vLLM、SGLang、LMDeploy、Hugging Face TGI、TensorRT-LLM、MLC-LLM、Xinference是比较有代表性的几个。
LM Studio、Ollama属于开箱即用的工具。
llama.cpp、vLLM、SGLang、LMDeploy、Hugging Face TGI、TensorRT-LLM、MLC-LLM、Xinference是推理引擎或者框架。
可以根据应用场景和使用难易程度简单的分为三类:
不会编程的普通用户:LM Studio、Ollama
个人开发者:llama.cpp、Ollama
企业用户:vLLM、SGLang、LMDeploy、TensorRT-LLM、MLC-LLM、Hugging Face TGI、Xinference。
其中使用起来最简单的是LMStudio,提供了图像化界面,即使不会编程也可以轻松使用。
Ollama使用也比较简单,对于普通用户提供了命令行,对于开发者,提供了API。
对于需要部署到生产环境中的企业用户,vLLM、SGLang、LMDeploy、TensorRT-LLM、MLC-LLM、Hugging Face TGI、Xinference这些框架提供了更灵活、可分布式部署的服务。
01 | LM Studio

LM Studio是本地部署大模型的工具,提供了可视化的图形界面,适合没有编程经验的人使用,极大降低了大模型在本地部署的门槛,支持Windows、macOS、Linux系统。LM Studio是一个桌面应用程序,下载安装包安装后即可使用。
官方文档:
https://lmstudio.ai/docs/
02 | llama.cpp

llama.cpp从其名字就能看出,它是一个使用C/C++进行开发的大模型推理引擎,最初是为了实现LLaMA系列模型的本地高效推理,现在也支持其他的大模型。针对CPU进行了优化,支持低性能硬件,如在笔记本电脑和手机上部署大模型。
核心特点:
- 通过 ARM NEON、Accelerate 和 Metal 框架进行了优化
- 支持x86架构AVX、AVX2、AVX512 和 AMX
- 支持1.5位、2 位、3 位、4 位、5 位、6 位和 8 位整数量化,以实现更快的推理和减少内存使用
- 支持英伟达、AMD、摩尔线程GPU
- 支持 Vulkan 和 SYCL 后端
- CPU 与 GPU 混合推理,以部分加速大于总显存容量的模型
开源时间:[2023.03]
最新版本:[b6838]
github star:[88.3k]
目前有1302位贡献者。

主要使用C/C++开发,所以推理速度很快。

github地址:
https://github.com/ggml-org/llama.cpp

03 | Ollama

Ollama是构建在llama.cpp上的大模型本地部署工具。支持maxOS/Windows/Linux系统。它支持通过下载软件安装包,以可视化的方式安装,使用起来比较简单,可以把它看作一个软件,安装后通过命令行的方式使用。也支持Docker、python包的方式安装。
开源时间:[2023.06]
最新版本:[v0.12.6]
github star:[155k]
目前有538位贡献者。

主要开发语言为Go。

github地址:
https://github.com/ollama/ollama
04 | vLLM

vLLM 是一个开源的大模型推理引擎,快速且易于使用。vLLM起源于论文(《Efficient Memory Management for Large Language Model Serving with PagedAttention》),论文中提出了PagedAttention。vLLM 最初由加州大学伯克利分校的Sky Computing Lab开发,如今已发展为一个由开源社区驱动的项目,吸引了来自学术界和工业界的贡献。

核心特点:
- PagedAttention
- Continuous Batching
- 通过CUDA/HIP graph实现快速模型执行
- GPTQ, AWQ, AutoRound, INT4, INT8, and FP8量化
- 优化的 CUDA 内核,包括与 FlashAttention 和 FlashInfer 的集成
- Speculative decoding
- Chunked prefill
开源时间:[2023.06]
最新版本:[v0.11.0]
github star:[60.9k]
贡献者非常多,已经有1728位贡献者。

主要开发语言为python。

github地址:
https://github.com/vllm-project/vllm
05 | SGLang

SGLang最初是由斯坦福大学和加州大学伯克利分校的团队开源的,是一个高性能的大语言模型和视觉语言模型推理引擎。它旨在在各种环境中提供低延迟和高吞吐量的推理,从单个 GPU 到大型分布式集群。SGLang起源于论文《SGLang: Efficient Execution of Structured Language Model Programs》),论文中提出了RadixAttention,带来了5倍推理速度提升。
SGLang提出的零开销CPU调度(zero-overhead CPU scheduler)降低了CPU的调度开销。

核心特点:
- RadixAttention
- zero-overhead CPU scheduler
- PD分离
- speculative decoding
- continuous batching
- paged attention
- tensor/pipeline/expert/data并行
- 结构化输出
- chunked prefill
- FP4/FP8/INT4/AWQ/GPTQ量化
- multi-LoRA batching
开源时间:[2024.01]
最新版本:[v0.5.3]
github star:[19.4k]
目前有797位贡献者。

主要开发语言为python,还使用了13.2%的Rust。

github地址:
https://github.com/sgl-project/sglang
06 | TensorRT-LLM
TensorRT LLM 是由英伟达开源的推理引擎,专门为英伟达GPU设计开发的,用于优化大语言模型(LLM)的推理。它提供了最先进的优化,包括自定义注意力内核、inflight batching、paged KV caching、量化(FP8、FP4、INT4 AWQ、INT8 SmoothQuant 等)、speculative decoding等功能,以高效地在 NVIDIA GPU 上执行推理。
核心特点:
- 自定义注意力内核(custom attention kernel)
- inflight batching
- paged KV caching
- 支持FP8,FP4,INT4 AWQ,INT8 SmoothQuant等量化
- speculative decoding
开源时间:[2023.09]
最新版本:[v1.0.0]
github star:[12k]
目前有349位贡献者。

主要开发语言为C++/python。

github地址:
https://github.com/NVIDIA/TensorRT-LLM
07 | LMDeploy

LMDeploy由上海人工智能实验室开源的大模型推理引擎,支持国产芯片。LMDeploy 通过引入关键功能,如continuous batching、blocked KV cache, dynamic split&fuse、张量并行等技术,实现了高吞吐。
LMDeploy中开发了两个推理引擎:TurboMind和PyTorch。这两个推理引擎的侧重点不同,前者具有极致优化的推理性能,而后者使用Python开发,旨在降低开发者的使用门槛。
核心特点:
- continuous batching
- blocked KV cache
- dynamic split&fuse
- 张量并行
- 高性能的CUDA内核
- 支持AWQ/GPTQ、SmoothQuant、KV Cache INT4/INT8量化
开源时间:[2023.06]
最新版本:[v0.10.1]
github star:[7.2k]
目前有136位贡献者。

主要开发语言为python,还使用了21.9%的C++和14.2%的Cuda。

github地址:
https://github.com/InternLM/lmdeploy
08 | Hugging Face TGI
TGI(Text Generation Inference )是Hugging Face开源的大模型推理引擎。
核心特点:
- 支持生产环境(Open Telemetry, Prometheus metrics)
- 张量并行
- 使用SSE实现token流式传输
- Continuous batching
- FlashAttention
- PagedAttention
- bitsandbytes、GPTQ、EETQ、AWQ、Marlin、FP8
- Safetensors 权重加载
- 大模型水印
- speculative decoding
- 支持指定输出格式
- 支持英伟达GPU、AMD GPU、Intel GPU,还支持亚马逊AI芯片Inferentia、Intel AI芯片Gaudi、谷歌TPU
- 支持微调
开源时间:[2022.10]
最新版本:[v3.3.6]
github star:[10.6k]
目前有165位贡献者。

主要开发语言为python,还使用了16.2%的Rust。

github地址:
https://github.com/huggingface/text-generation-inference
09 | MLC-LLM
开源时间:[2023.04]
最新版本:[v0.19.0]
github star:[21.5k]
MLC-LLM是AI大神陈天奇开源的,是一个面向大语言模型的机器学习编译器和高性能部署引擎。该项目的使命是使每个人都能在自己的平台上本地开发、优化和部署 AI 模型。

MLC-LLM工作流
MLC-LLM支持多种GPU和操作系统:

目前有148位贡献者。

主要开发语言为python,还使用了25.5%的C++。

github地址:
https://github.com/mlc-ai/mlc-llm
10 | Xinference

开源时间:[2023.07]
最新版本:[v1.11.0.post1]
github star:[8.7k]
Xorbits Inference(Xinference)是一个功能强大的分布式推理框架,支持语言、语音识别和多模态模型。
Xinference支持不同的推理引擎,用户选择模型后,Xinference 会自动选择合适的引擎。
可以通过多种方式使用Xinference:Web UI、命令行、python等。
核心特点:
- 多引擎架构设计,支持多种推理引擎,如vLLM、SGLang、llama.cpp等
- 推理时根据模型以及硬件资源自动选择最优的推理引擎
目前有148位贡献者。

主要开发语言为python,还使用了10.9%的JavaScript。

github地址:
https://github.com/xorbitsai/inference
总结
各个大模型推理框架也在不断的更新,一些新的推理技术会逐渐支持,只是开发的快慢而已,就看谁的开源生态更繁荣了。
目前很多大模型框架已支持PagedAttention、Continuous Batching、Speculative Decoding、Chunked Prefill等特性。
LM Sdudio不需要任何编程经验就可以使用,非常适合没有编程经验的人在本地快速部署大模型。
Ollama使用起来也非常简单,不懂编程也没关系,只需要了解命令行的使用就行,适合不会编程的人、个人开发者和研究者在本地部署大模型。
TensorRT-LLM适合在英伟达GPU上部署大模型的开发者和企业,本地部署和生产环境部署都可以。
LMDeploy适合需要在国产芯片部署大模型的开发者和企业,本地部署和生产环境部署都可以。
另外,vLLM和SGLang是目前使用较多的大模型推理框架,并且在github上有较多的开发者参与项目的更新,新特性支持更快。本地部署和生产环境部署都可以。
Xinference适合企业进行生产环境的分布式部署。
llama.cpp 针对 CPU 进行了深度优化,适合个人开发者在资源有限的设备(例如树莓派、笔记本电脑、手机等)上部署大模型。
MLC-LLM的适用场景与llama.cpp类似,也适合在各种设备上本地部署大模型。
普通人如何抓住AI大模型的风口?
领取方式在文末
为什么要学习大模型?
目前AI大模型的技术岗位与能力培养随着人工智能技术的迅速发展和应用 , 大模型作为其中的重要组成部分 , 正逐渐成为推动人工智能发展的重要引擎 。大模型以其强大的数据处理和模式识别能力, 广泛应用于自然语言处理 、计算机视觉 、 智能推荐等领域 ,为各行各业带来了革命性的改变和机遇 。
目前,开源人工智能大模型已应用于医疗、政务、法律、汽车、娱乐、金融、互联网、教育、制造业、企业服务等多个场景,其中,应用于金融、企业服务、制造业和法律领域的大模型在本次调研中占比超过 30%。
随着AI大模型技术的迅速发展,相关岗位的需求也日益增加。大模型产业链催生了一批高薪新职业:
人工智能大潮已来,不加入就可能被淘汰。如果你是技术人,尤其是互联网从业者,现在就开始学习AI大模型技术,真的是给你的人生一个重要建议!
最后
只要你真心想学习AI大模型技术,这份精心整理的学习资料我愿意无偿分享给你,但是想学技术去乱搞的人别来找我!
在当前这个人工智能高速发展的时代,AI大模型正在深刻改变各行各业。我国对高水平AI人才的需求也日益增长,真正懂技术、能落地的人才依旧紧缺。我也希望通过这份资料,能够帮助更多有志于AI领域的朋友入门并深入学习。
真诚无偿分享!!!
vx扫描下方二维码即可
加上后会一个个给大家发
大模型全套学习资料展示
自我们与MoPaaS魔泊云合作以来,我们不断打磨课程体系与技术内容,在细节上精益求精,同时在技术层面也新增了许多前沿且实用的内容,力求为大家带来更系统、更实战、更落地的大模型学习体验。

希望这份系统、实用的大模型学习路径,能够帮助你从零入门,进阶到实战,真正掌握AI时代的核心技能!
01 教学内容

-
从零到精通完整闭环:【基础理论 →RAG开发 → Agent设计 → 模型微调与私有化部署调→热门技术】5大模块,内容比传统教材更贴近企业实战!
-
大量真实项目案例: 带你亲自上手搞数据清洗、模型调优这些硬核操作,把课本知识变成真本事!
02适学人群
应届毕业生: 无工作经验但想要系统学习AI大模型技术,期待通过实战项目掌握核心技术。
零基础转型: 非技术背景但关注AI应用场景,计划通过低代码工具实现“AI+行业”跨界。
业务赋能突破瓶颈: 传统开发者(Java/前端等)学习Transformer架构与LangChain框架,向AI全栈工程师转型。

vx扫描下方二维码即可
本教程比较珍贵,仅限大家自行学习,不要传播!更严禁商用!
03 入门到进阶学习路线图
大模型学习路线图,整体分为5个大的阶段:
04 视频和书籍PDF合集

从0到掌握主流大模型技术视频教程(涵盖模型训练、微调、RAG、LangChain、Agent开发等实战方向)

新手必备的大模型学习PDF书单来了!全是硬核知识,帮你少走弯路(不吹牛,真有用)
05 行业报告+白皮书合集
收集70+报告与白皮书,了解行业最新动态!
06 90+份面试题/经验
AI大模型岗位面试经验总结(谁学技术不是为了赚$呢,找个好的岗位很重要)

07 deepseek部署包+技巧大全

由于篇幅有限
只展示部分资料
并且还在持续更新中…
真诚无偿分享!!!
vx扫描下方二维码即可
加上后会一个个给大家发
更多推荐


所有评论(0)