本文是对B站五道口纳什[动手写bert系列] 01 huggingface tokenizer (vocab,encode,decode)的一个学习复现总结。

前提得安装配置好Jupyterbook使用环境。

我是安装配置的Aaconda环境,里面也安装配置了Jupyterbook。我是小白之前也没咋用过,在这个基础上摸索进行的。

首先在Aaconda里面新建一个虚拟环境,然后我们安装配置基本需要的python transformers torch这些库。我是nlp38这个环境下,python3.8。

conda activate nlp38

因为不想Jupyter里面有过多冗余的文件,新建了一个文件夹,进入到文件夹里面启动Jupyterbook。

cd /d D:\program\Jupyter

/d 参数可以在不同驱动器间切换。

然后启动Jupyterbook。

jupyter notebook

然后可以在up视频介绍的地方去代码仓库下载代码:

up原代码

下载到刚刚新建文件及里面

然后记得内核选择我们刚刚新建的虚拟环境:

然后就可以参考up主的代码跟着视频学习了。

在这一步的时候加载模型可能会遇到网络问题,我们在前面配置一下代理和镜像即可解决:

import warnings
warnings.filterwarnings('ignore')  # 忽略警告

# ========== 关键:设置国内镜像 ==========
import os
os.environ['HF_ENDPOINT'] = 'https://hf-mirror.com'  # 主要镜像
os.environ['HF_HUB_ENABLE_HF_TRANSFER'] = '1'  # 启用快速传输
os.environ['HF_HUB_DISABLE_TELEMETRY'] = '1'   # 禁用遥测
os.environ['HF_HUB_OFFLINE'] = '0'             # 确保在线模式

os.environ["HTTP_PROXY"] = "http://127.0.0.1:10808"
os.environ["HTTPS_PROXY"] = "http://127.0.0.1:10808"

os.environ["HTTP_PROXY"] = "http://127.0.0.1:10808"
os.environ["HTTPS_PROXY"] = "http://127.0.0.1:10808"

这里的10808是根据你自己使用的确定的,小猫咪默认的是7890,我是使用v2的是在设置-参数设置-core基础设置查看

然后就能正常加载模型运行成功了。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐