Whisper 模型本地化部署指南

一、模型版本与下载

Whisper 提供多种规模版本,可通过以下官方渠道获取:

  1. GitHub 仓库
    https://github.com/openai/whisper
    包含最新代码、预训练权重和文档

  2. Hugging Face 模型库
    所有版本下载路径:

    https://huggingface.co/openai/whisper-{version}/tree/main
    

    替换 {version} 为具体型号:

    • tiny.en / tiny
    • base.en / base
    • small.en / small
    • medium.en / medium
    • large-v2 (最新大模型)

二、离线环境搭建教程
准备工作
  1. 硬件要求

    • GPU 推荐:NVIDIA GTX 1080 或更高
    • 显存要求:
      • 小模型:≥ 2GB
      • 大模型:≥ 10GB
  2. 基础环境

    # 安装 Python 3.8+
    sudo apt install python3.8 python3-pip
    
    # 创建虚拟环境
    python3 -m venv whisper-env
    source whisper-env/bin/activate
    

离线依赖安装
  1. 下载依赖包(在联网设备操作):

    pip download -r requirements.txt --platform manylinux2014_x86_64 \
    --only-binary=:all: --python-version 3.8
    

    将生成的 *.whl 文件复制到离线设备

  2. 离线安装

    pip install --no-index --find-links=/path/to/wheels -r requirements.txt
    

模型部署
  1. 手动下载模型

    • 从 Hugging Face 下载 .pt 权重文件
    • 保存路径:~/.cache/whisper/
  2. 验证安装

    import whisper
    model = whisper.load_model("base")
    result = model.transcribe("audio_sample.mp3")
    print(result["text"])
    


三、关键配置说明
  1. 音频处理

    • 必需组件:ffmpeg
    • 离线安装:
      # 下载静态编译版本
      wget https://johnvansickle.com/ffmpeg/releases/ffmpeg-release-amd64-static.tar.xz
      tar xvf ffmpeg-release-amd64-static.tar.xz
      export PATH=$PATH:/path/to/ffmpeg
      

  2. 内存优化

    # 启用 GPU 加速
    model = whisper.load_model("large", device="cuda")
    
    # 低内存模式
    options = whisper.DecodingOptions(fp16=False, beam_size=3)
    


四、常见问题解决
  1. 依赖缺失错误

    • 解决方案:手动下载缺失 .whl 文件补充
  2. CUDA 不兼容

    # 检查 CUDA 版本
    nvcc --version
    # 安装匹配的 PyTorch 离线包
    

  3. 长音频处理

    # 分段处理
    result = model.transcribe("long_audio.wav", chunk_length=30)
    

提示:完整离线包(含依赖+模型)约需 15GB 存储空间,建议使用 rsync 进行设备间传输。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐