Qwen3-Embedding
·
模型训练

- Embedding:以一个instruction+query+document作为输入,在最后拼接一个end of text,并最终取最后一层end of text的hidden states作为这个文本的向量表示;(instruction可以支持用户自定义来实现不同的任务,例如寻找相似的文档,分类任务,聚类任务等)
- Reranker:以一个instruction+query,document对作为输入,根据下一个token的hidden state输入分类头,根据输出的yes no的概率进行softmax来给出相似度分数;
- 此外,Embedding还支持使用中间维度进行向量计算,可以根据实际场景选取合适的向量维度;

训练数据



为了提升合成问题对的多样性,通过角色特性的角度生成多样性的prompt doc对
- 针对每条文档,先从角色库中搜索哪些角色是最符合这个文档的
- 其次针对这个文档这个角色更可能提出什么问题
- 根据大模型基于文档生成的角色、提问配置,再次输入大模型生成合成Query+doc对
训练策略

Stage1对Reranker提升不明显,因此Reranker模型只采用两阶段训练;
对比学习往往需要较大的batchsize来保证充分的正负样本以保证性能,这里通过采用其他问题的query,以及doc来作为负样本来提升batchsize大小;
embedding采用对比学习,reranker采用SFT训练
模型融合

训练配置

更多推荐



所有评论(0)