长文档分段总结:几万字PDF怎么不丢重点地压成一页
老板甩给我一份七万多字的行业报告,让我下班前给他一页纸的要点。我第一反应是搭个助手干这活儿,结果一上来就撞墙:文档太长,一股脑塞进模型直接超出上下文窗口,根本读不完。后来用分段总结的法子解决了,记一下。
为什么不能直接塞
模型一次能读的字数有上限(上下文窗口)。七万字远超这个限。硬塞进去,要么报错,要么它只读了前面一部分,后面的内容直接被截断,总结出来缺一大半。我第一版就是这毛病,总结里只有报告前三章,后面四章它压根没看到。
分段总结的思路:先分后合
正经做法是把长文档拆开,分段处理,再汇总。业内管这叫 map-reduce,说人话就是:
-
分段(map):把七万字按章节切成十几段,每段单独总结成一小段要点。
-
汇总(reduce):把这十几段小要点拼起来,再让模型基于这堆要点,提炼成最终一页纸。
这样每一步喂给模型的内容都在窗口范围内,谁也不会被截断。
切的时候别乱切
我一开始按固定字数切,结果把一个完整的论点从中间切成两段,前半段在第三块、后半段在第四块,总结的时候两边都没说清楚那个论点。后来改成按章节、按小标题切,尽量让一个完整的意思待在同一段里,总结质量立马上去。文档有结构的,顺着结构切。
一个绕不开的取舍:信息会损耗
分段总结有个天生的代价:每总结一层,就丢一层细节。七万字压到一页,中间过了两道,具体的数字、案例必然被砍掉一部分。我后来在汇总那步特意叮嘱它"关键数据原样保留",才把最重要的几个百分比留住,但更细的还是没了。
要那种"一个细节都不能漏"的场合,分段总结不合适,它本质就是抓大放小。老板要的是一页纸看大局,这法子刚好。
效果
七万字的报告,十几分钟压成了一页要点,老板下班前拿到了。我用的那个能拖拽配智能体的工具,分段和汇总这套流程能可视化地连起来,每段总结完自动流到下一步,不用我自己写循环调度,这点挺顺手。
长文档总结的核心就八个字:先分后合,顺着结构。记住这个,几万字也不慌。
(每段总结和最后汇总用的模型我都走的讯飞 MaaS,调现成 API,十几段并行处理也不用担心自己的机器扛不扛得住。)
更多推荐



所有评论(0)