【0基础LLM】Tokenizer和embedding的关系
·
问题:
tokenizer就是分词器吗?和embedding有什么关系?为什么有的embedding不用分词器,有的用?embedding可以等同于tokenizer吗?
背景:
为什么会有这个问题呢?我学习的过程中,发现有的研究者写的代码有歧义,比如用qwen3的embedding模型对文本序列进行操作,但给自己封装的类却叫qwen3_tokenizer。
并且有的embedding模型,我们只输入文本就可以获得向量。有的却需要先jieba分词器,再调用embedding模型。为什么会这样?
回答:
tokenizer = 分词器,从功能上来说,文本要转化为向量,都需要先分词,再转化,分成token的数量,即为我们平常调用模型的消耗(xxx tokens)。
那为什么有的embedding模型,如qwen3_embedding, 好像不需要分词呢?这是因为这种模型都内置了分词器。所以实现了端到端的转化。
更多推荐



所有评论(0)