问题:
tokenizer就是分词器吗?和embedding有什么关系?为什么有的embedding不用分词器,有的用?embedding可以等同于tokenizer吗?

背景:
为什么会有这个问题呢?我学习的过程中,发现有的研究者写的代码有歧义,比如用qwen3的embedding模型对文本序列进行操作,但给自己封装的类却叫qwen3_tokenizer。

并且有的embedding模型,我们只输入文本就可以获得向量。有的却需要先jieba分词器,再调用embedding模型。为什么会这样?

回答:
tokenizer = 分词器,从功能上来说,文本要转化为向量,都需要先分词,再转化,分成token的数量,即为我们平常调用模型的消耗(xxx tokens)。
那为什么有的embedding模型,如qwen3_embedding, 好像不需要分词呢?这是因为这种模型都内置了分词器。所以实现了端到端的转化。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐