Qwen3.5-4B-Condenser用户指南:掌握摘要与索引双模式的实用技巧

【免费下载链接】Qwen3.5-4B-Condenser 【免费下载链接】Qwen3.5-4B-Condenser 项目地址: https://ai.gitcode.com/hf_mirrors/twinkle-kit/Qwen3.5-4B-Condenser

Qwen3.5-4B-Condenser是一款基于Qwen3.5-4B模型优化的摘要与索引工具,通过LoRA技术在HotpotQA数据集上微调,能够将长文本压缩为结构化的摘要与索引双模式内容,帮助用户快速获取核心信息。本文将为你详细介绍这款工具的使用方法、功能特点及实用技巧,让你轻松上手高效处理文本信息。

一、什么是Qwen3.5-4B-Condenser?

Qwen3.5-4B-Condenser是一个基于Qwen3.5-4B模型的LoRA微调版本,专门用于文本压缩任务。它能够将单篇文章重写为包含“## Summary”和“## More”两个部分的结构化内容,下游的多跳问答代理可以先阅读摘要,再决定是否需要展开查看原始内容。

该模型在HotpotQA Condensed 9k数据集上进行了SFT训练,采用了Twinkle框架,通过cookbook/rl/train_condenser_ddp.py脚本完成训练过程。

二、核心功能与优势

2.1 摘要与索引双模式输出

Qwen3.5-4B-Condenser的核心功能是将长文本压缩为两种模式:

  • Summary模式:提供文章的概述和与查询强相关的事实,明确陈述关键信息
  • More模式:提供一个折叠的索引,需要展开才能查看具体信息,包含可从源文中恢复的类别关键词

这种双模式设计使得用户可以先快速浏览摘要获取核心信息,需要时再通过索引深入了解细节,极大提高了信息获取效率。

2.2 高效压缩,保留关键信息

模型采用电报式风格(Telegraphic style),去掉虚词(如"the"、"a"、"is"等),使用冒号和逗号表示"是"或"有",在保证压缩率的同时不丢失主要信息。通常压缩比例在0.35-0.55之间,严格控制在源文本长度的50%左右。

2.3 查询作为排序提示

当提供查询时,模型会将与查询相关的事实优先放在摘要中,但仍然会在预算范围内包含其他核心事实。查询只是作为排序提示,而不是过滤条件,确保不会遗漏重要信息。

三、快速上手:安装与基本使用

3.1 安装步骤

要使用Qwen3.5-4B-Condenser,首先需要克隆仓库:

git clone https://gitcode.com/hf_mirrors/twinkle-kit/Qwen3.5-4B-Condenser

3.2 基本调用方法

以下是使用OpenAI兼容客户端调用模型的示例代码:

from openai import OpenAI

client = OpenAI(base_url='http://localhost:8000/v1', api_key='EMPTY')

SYSTEM = '...'  # 粘贴系统提示块
USER_TEMPLATE = '...'  # 粘贴用户提示模板

query = 'Which city was Marie Curie born in?'
title = 'Marie Curie'
body = '<passage body here>'
text = f'{title}: {body}'
budget = max(160, int(len(text) * 0.5))

resp = client.chat.completions.create(
    model='qwen3.5-4b-condenser',
    messages=[
        {'role': 'system', 'content': SYSTEM},
        {'role': 'user', 'content': USER_TEMPLATE.format(
            query=query, budget=budget, text=text)},
    ],
    temperature=0.3,
    max_tokens=max(128, int(budget * 0.6) + 16),
)
print(resp.choices[0].message.content)

四、深入了解:输入输出格式

4.1 系统提示(固定)

系统提示定义了模型的行为准则,包括压缩要求和输出格式:

You are a text compression assistant. A downstream model will read your compressed output to decide whether the detail it needs is inside this block; if yes, it will fetch and read the original passage.

Downstream model workflow:
Read your compressed output -> Decide whether needed info is in this block -> If yes -> Fetch original.

Therefore your compression MUST NOT lose major information from the source.

Output format:

```text
## Summary
Overview plus facts STRONGLY RELATED to the Query, stated explicitly.

## More
A collapsed index; expansion required to see specific information.

Rules:

  1. Telegraphic style — drop function words ("the", "a", "is", "are", "of", ...); colons and commas mean "is" / "has".
  2. Summary MUST contain the passage's primary topic + 2–4 concrete core facts drawn from the source (entities, numbers, dates, relations).
  3. Summary MUST NOT be meta-commentary about the Query.
  4. More is an INDEX of category keywords, NOT inline data.
  5. Output language MUST match the source language.
  6. Do NOT fabricate. Do NOT omit major information.

### 4.2 用户提示模板

用户提示需要包含查询、目标长度和要压缩的文本:

```text
Downstream model will read your compressed block to decide whether to expand it.
Compress faithfully: preserve the passage topic + core facts. Do NOT invent facts.
Do NOT drop major facts. Do NOT write meta-commentary about the Query.

## Query (ordering hint only — still summarize the whole passage)
{query}

## Target length
Compress AS MUCH AS faithfully possible. HARD CEILING: {budget} chars
(~50% of the source). If core facts fit in far fewer chars, output fewer.
Never exceed the ceiling.

## Passage
{title}: {body}

4.3 输出格式

模型输出包含两个部分:

## Summary
<topic + 2-4 concrete core facts, query-relevant first>

## More
<comma-separated category keywords; expansion required to see values>

五、实用技巧:优化压缩效果

5.1 合理设置预算

预算(budget)是压缩的硬字符上限,建议设置为:max(160, int(len(title+body) * 0.5)),这样既能保证足够的压缩率,又不会丢失关键信息。

5.2 有效使用查询提示

虽然查询只是排序提示而非过滤条件,但提供相关查询可以帮助模型优先展示你关心的信息。例如,如果你想了解某个人物的成就,可以将查询设置为"该人物的主要成就有哪些?"。

5.3 理解摘要与索引的平衡

摘要部分应包含主题和2-4个核心事实,而索引部分则列出可以进一步获取的信息类别。理解这种平衡有助于更好地利用模型输出,快速定位所需信息。

六、模型配置与技术细节

Qwen3.5-4B-Condenser使用LoRA技术进行微调,主要配置参数如下:

  • 基础模型:Qwen/Qwen3.5-4B
  • LoRA秩(r):16
  • lora_alpha:32
  • 目标模块:all-linear(包括k_proj、q_proj、v_proj等)
  • 优化器:AdamW
  • 学习率:1e-4
  • 批处理大小:8(每个DP rank)
  • 梯度累积:4
  • 训练轮次:5

完整配置可查看项目中的adapter_config.json文件。

七、常见问题与限制

7.1 短文本压缩效果

对于长度低于250字符的文本,压缩比例可能会超过0.7,这是因为可压缩的空间有限,属于正常现象。

7.2 实体属性覆盖

低频属性(如"英裔美国人"这样的国籍描述)可能会被完全省略,而不是出现在"## More"部分。增加数据规模或添加针对性提示有助于改善这一问题。

7.3 语言支持

目前模型仅支持英语,多语言表现未经测试。

7.4 不是独立QA模型

需要注意的是,Qwen3.5-4B-Condenser仅负责重写文章,下游的问答任务需要由决定何时调用extract_condensed的代理完成。

八、应用场景

Qwen3.5-4B-Condenser适用于多种场景:

  • 作为Twinkle Agentic RL pipeline的压缩后端(cookbook/rl/grpo_condensed.py
  • 为后续针对相同压缩模式的GRPO/DPO提供SFT预热
  • 离线数据集预处理:预压缩长文本语料,以控制检索时的上下文预算

通过这些应用,Qwen3.5-4B-Condenser可以帮助用户更高效地处理和利用文本信息,提升工作和学习效率。

希望本指南能帮助你更好地理解和使用Qwen3.5-4B-Condenser,享受高效文本压缩带来的便利!如有任何问题或建议,欢迎在项目社区中提出。

【免费下载链接】Qwen3.5-4B-Condenser 【免费下载链接】Qwen3.5-4B-Condenser 项目地址: https://ai.gitcode.com/hf_mirrors/twinkle-kit/Qwen3.5-4B-Condenser

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐