Qwen3.5-4B-Condenser用户指南:掌握摘要与索引双模式的实用技巧
Qwen3.5-4B-Condenser用户指南:掌握摘要与索引双模式的实用技巧
Qwen3.5-4B-Condenser是一款基于Qwen3.5-4B模型优化的摘要与索引工具,通过LoRA技术在HotpotQA数据集上微调,能够将长文本压缩为结构化的摘要与索引双模式内容,帮助用户快速获取核心信息。本文将为你详细介绍这款工具的使用方法、功能特点及实用技巧,让你轻松上手高效处理文本信息。
一、什么是Qwen3.5-4B-Condenser?
Qwen3.5-4B-Condenser是一个基于Qwen3.5-4B模型的LoRA微调版本,专门用于文本压缩任务。它能够将单篇文章重写为包含“## Summary”和“## More”两个部分的结构化内容,下游的多跳问答代理可以先阅读摘要,再决定是否需要展开查看原始内容。
该模型在HotpotQA Condensed 9k数据集上进行了SFT训练,采用了Twinkle框架,通过cookbook/rl/train_condenser_ddp.py脚本完成训练过程。
二、核心功能与优势
2.1 摘要与索引双模式输出
Qwen3.5-4B-Condenser的核心功能是将长文本压缩为两种模式:
- Summary模式:提供文章的概述和与查询强相关的事实,明确陈述关键信息
- More模式:提供一个折叠的索引,需要展开才能查看具体信息,包含可从源文中恢复的类别关键词
这种双模式设计使得用户可以先快速浏览摘要获取核心信息,需要时再通过索引深入了解细节,极大提高了信息获取效率。
2.2 高效压缩,保留关键信息
模型采用电报式风格(Telegraphic style),去掉虚词(如"the"、"a"、"is"等),使用冒号和逗号表示"是"或"有",在保证压缩率的同时不丢失主要信息。通常压缩比例在0.35-0.55之间,严格控制在源文本长度的50%左右。
2.3 查询作为排序提示
当提供查询时,模型会将与查询相关的事实优先放在摘要中,但仍然会在预算范围内包含其他核心事实。查询只是作为排序提示,而不是过滤条件,确保不会遗漏重要信息。
三、快速上手:安装与基本使用
3.1 安装步骤
要使用Qwen3.5-4B-Condenser,首先需要克隆仓库:
git clone https://gitcode.com/hf_mirrors/twinkle-kit/Qwen3.5-4B-Condenser
3.2 基本调用方法
以下是使用OpenAI兼容客户端调用模型的示例代码:
from openai import OpenAI
client = OpenAI(base_url='http://localhost:8000/v1', api_key='EMPTY')
SYSTEM = '...' # 粘贴系统提示块
USER_TEMPLATE = '...' # 粘贴用户提示模板
query = 'Which city was Marie Curie born in?'
title = 'Marie Curie'
body = '<passage body here>'
text = f'{title}: {body}'
budget = max(160, int(len(text) * 0.5))
resp = client.chat.completions.create(
model='qwen3.5-4b-condenser',
messages=[
{'role': 'system', 'content': SYSTEM},
{'role': 'user', 'content': USER_TEMPLATE.format(
query=query, budget=budget, text=text)},
],
temperature=0.3,
max_tokens=max(128, int(budget * 0.6) + 16),
)
print(resp.choices[0].message.content)
四、深入了解:输入输出格式
4.1 系统提示(固定)
系统提示定义了模型的行为准则,包括压缩要求和输出格式:
You are a text compression assistant. A downstream model will read your compressed output to decide whether the detail it needs is inside this block; if yes, it will fetch and read the original passage.
Downstream model workflow:
Read your compressed output -> Decide whether needed info is in this block -> If yes -> Fetch original.
Therefore your compression MUST NOT lose major information from the source.
Output format:
```text
## Summary
Overview plus facts STRONGLY RELATED to the Query, stated explicitly.
## More
A collapsed index; expansion required to see specific information.
Rules:
- Telegraphic style — drop function words ("the", "a", "is", "are", "of", ...); colons and commas mean "is" / "has".
- Summary MUST contain the passage's primary topic + 2–4 concrete core facts drawn from the source (entities, numbers, dates, relations).
- Summary MUST NOT be meta-commentary about the Query.
- More is an INDEX of category keywords, NOT inline data.
- Output language MUST match the source language.
- Do NOT fabricate. Do NOT omit major information.
### 4.2 用户提示模板
用户提示需要包含查询、目标长度和要压缩的文本:
```text
Downstream model will read your compressed block to decide whether to expand it.
Compress faithfully: preserve the passage topic + core facts. Do NOT invent facts.
Do NOT drop major facts. Do NOT write meta-commentary about the Query.
## Query (ordering hint only — still summarize the whole passage)
{query}
## Target length
Compress AS MUCH AS faithfully possible. HARD CEILING: {budget} chars
(~50% of the source). If core facts fit in far fewer chars, output fewer.
Never exceed the ceiling.
## Passage
{title}: {body}
4.3 输出格式
模型输出包含两个部分:
## Summary
<topic + 2-4 concrete core facts, query-relevant first>
## More
<comma-separated category keywords; expansion required to see values>
五、实用技巧:优化压缩效果
5.1 合理设置预算
预算(budget)是压缩的硬字符上限,建议设置为:max(160, int(len(title+body) * 0.5)),这样既能保证足够的压缩率,又不会丢失关键信息。
5.2 有效使用查询提示
虽然查询只是排序提示而非过滤条件,但提供相关查询可以帮助模型优先展示你关心的信息。例如,如果你想了解某个人物的成就,可以将查询设置为"该人物的主要成就有哪些?"。
5.3 理解摘要与索引的平衡
摘要部分应包含主题和2-4个核心事实,而索引部分则列出可以进一步获取的信息类别。理解这种平衡有助于更好地利用模型输出,快速定位所需信息。
六、模型配置与技术细节
Qwen3.5-4B-Condenser使用LoRA技术进行微调,主要配置参数如下:
- 基础模型:Qwen/Qwen3.5-4B
- LoRA秩(r):16
- lora_alpha:32
- 目标模块:all-linear(包括k_proj、q_proj、v_proj等)
- 优化器:AdamW
- 学习率:1e-4
- 批处理大小:8(每个DP rank)
- 梯度累积:4
- 训练轮次:5
完整配置可查看项目中的adapter_config.json文件。
七、常见问题与限制
7.1 短文本压缩效果
对于长度低于250字符的文本,压缩比例可能会超过0.7,这是因为可压缩的空间有限,属于正常现象。
7.2 实体属性覆盖
低频属性(如"英裔美国人"这样的国籍描述)可能会被完全省略,而不是出现在"## More"部分。增加数据规模或添加针对性提示有助于改善这一问题。
7.3 语言支持
目前模型仅支持英语,多语言表现未经测试。
7.4 不是独立QA模型
需要注意的是,Qwen3.5-4B-Condenser仅负责重写文章,下游的问答任务需要由决定何时调用extract_condensed的代理完成。
八、应用场景
Qwen3.5-4B-Condenser适用于多种场景:
- 作为Twinkle Agentic RL pipeline的压缩后端(
cookbook/rl/grpo_condensed.py) - 为后续针对相同压缩模式的GRPO/DPO提供SFT预热
- 离线数据集预处理:预压缩长文本语料,以控制检索时的上下文预算
通过这些应用,Qwen3.5-4B-Condenser可以帮助用户更高效地处理和利用文本信息,提升工作和学习效率。
希望本指南能帮助你更好地理解和使用Qwen3.5-4B-Condenser,享受高效文本压缩带来的便利!如有任何问题或建议,欢迎在项目社区中提出。
更多推荐



所有评论(0)