F5-TTS是一款基于扩散Transformer和ConvNeXt V2的文本转语音 (TTS) 模型。F5-TTS旨在生成流畅且忠实的语音,其训练速度和推理速度都得到了提升。 项目还提供了一个名为E2 TTS的模型,它是论文中模型的更接近的复现版本,基于Flat-UNet Transformer。 预训练模型已发布在Hugging Face和Model Scope上。

GitHub地址:https://github.com/SWivid/F5-TTS

# Docker 部署

下载/复制GitHub中的Dockerfile文件

docker build -t f5tts:v1 .

docker run -d -t --name f5-tts -p 7860:7860 --gpus=all f5tts:v1

f5-tts_infer-gradio --port 7860 --host 0.0.0.0

修改Dockerfile文件,加入自启脚本:

COPY start.sh /workspace/F5-TTS/start.sh

CMD ["/bin/bash", "-c", "/workspace/F5-TTS/start.sh && tail -f /dev/null"]

start.sh:

#!/bin/bash

# Gradio web Management

CUDA_VISIBLE_DEVICES=1 f5-tts_infer-gradio --port 7860 --host 0.0.0.0

修改GPU占用:CUDA_VISIBLE_DEVICES=0 保存退出并重启容器即可

docker build -t f5tts-v1 .

docker run -d -t --name f5-tts -p 7860:7860 --gpus=all f5-tts-v1-202505

使用:http://10.11.0.76:7860/

# 示例:

  上传音频:Tmp_audio.mp3(蔡徐坤)

  输入文字:

  海域云成立于二零一零年,是中国优秀的出口企业云服务商,为中国出口企业提供品牌保护,知识产权,网络运维等云服务,助力中国出口企业数字化转型升级。总部在深圳,在香港、英国、澳洲、加拿大设有分支机构。海域云通过大数据,云计算等技术,为出口企业搭建品牌域名全球监测、知产智能管理、全球网络智能管理等系统,提供全球知识产权、全球网络专线、全球域名保护、海外数据中心、外贸管理软件等一站式解决方案,帮助出口企业商业决策提供数字依据。目前已为超过十万家中国企业提供服务,其中,服务上市公司超过两百家,服务千亿级上市公司超过了二十家。

  点击Synthesize进行模型推理,并输出,而后点击下载按钮,可保存为.wav或.mp3格式音频文件。

# 其他操作

查看日志:docker logs -f -t f5-tts

模型重启:docker restart f5-tts

进入容器:docker exec -it f5-tts bash

GPU占用:该模型默认占用1号GPU,占用显存2G

容器内模型自启文件(可修改):/workspace/F5-TTS/start.sh

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐