在人工智能浪潮席卷全球的今天,大语言模型(LLMs)如GPT-4、Gemini等,已在教育、法律、科研乃至西医临床等多个领域展现出巨大潜力。然而,当我们试图将这一尖端技术应用于拥有两千多年历史的传统中医药(TCM)领域时,却面临着独特的挑战。

中医药强调整体观念和辨证论治,其推理过程依赖于晦涩的古文经典、隐含的逻辑链条,以及舌象、脉象等多模态信息。这好比一位老中医的"只可意会,不可言传"的经验,如何让一台机器学会?现有的一些中医药大模型虽在文本理解上有所进展,但在多模态融合、临床可解释性和实际应用性方面仍存在明显短板。

为了攻克这些难题,密苏里大学研究团队开发出了 “BenCao”------一个基于ChatGPT构建的多模态中医药智能助手。这项研究并非简单地重复训练一个模型,而是巧妙地通过自然语言指令微调,将浩瀚的中医药知识、专业的诊断逻辑与严格的伦理规范"注入"到一个通用大模型中,使其能够像一位经验丰富的中医师一样进行思考和对话。

一、 引言

传统中医药作为世界医学宝库的重要组成部分,至今仍在全球健康保健中扮演着关键角色。据世界卫生组织统计,已有百余个国家制定了与传统医学相关的法规框架。仅在中国,2023年中医药机构的诊疗人次就高达12.8亿,其服务规模与需求可见一斑。

与此同时,大语言模型的崛起为各行各业带来了革命性变化。在医疗领域,它们已能够辅助生成诊断、完成临床文档整理和回答医学问题,预示着智能医疗系统的到来。

然而,将LLMs应用于中医药却步履维艰。与建立在解剖学和分子生物学基础上的西方医学不同,中医药的基石是"阴阳五行"、“气血津液”、"脏腑经络"等一套独特的理论体系。其诊断过程------即"望、闻、问、切"四诊合参,是一个融合了视觉(舌象、面色)、听觉(声音)、嗅觉(体味)、触觉(脉象)和问诊(症状)的复杂多模态信息处理过程。

现有的中医药大模型,如BianCang、JingFang和TCMChat,在文本理解和问答上取得了可喜的进步,但它们普遍存在以下局限:

·缺乏多模态能力:无法处理和分析舌象、脉象等对诊断至关重要的视觉或信号数据。

·可解释性不足:其回答往往直接给出结论,缺乏像中医师那样一步步分析病因病机的推理过程。

·临床适用性差:多为研究原型,参数庞大,部署成本高,且输出结果的准确性和可靠性难以满足真实临床场景的需求。

·伦理安全边界模糊:在提供建议时,可能未能严格区分健康指导与医疗诊断,存在潜在风险。

基于此,研究团队开发了BenCao,它围绕四个核心贡献构建:

1.多模态能力:打造能同时处理文本和视觉信息(如舌象分析)的中医药大模型;

2.知识与场景驱动:集成超千部典籍,并设计了覆盖学习、咨询、体质评估和养生四大现实场景的交互框架;

3.专业与可信保障:通过专家反馈和链式思维模拟,确保其推理符合中医逻辑、过程透明且恪守安全底线;

4.实证评估:通过在多类任务上的对比测试,验证了其卓越的领域适应性。

二、 方法

构建BenCao并非从零开始训练一个新模型,而是采用了一种更高效、更灵活的"指令微调"策略。其核心在于通过精心设计的提示词、知识库和反馈机制,引导一个强大的通用模型(ChatGPT)在中医药领域内专业化。整个过程如同一位资深导师在培养一名医学实习生,通过言传身教、案例实践和不断纠偏,使其成长为合格的医师。

  1. 数据收集与知识库构建

任何一个专家的养成,都离不开海量知识的学习。研究团队为BenCao构建了一个极其庞大的知识库,涵盖了超过1000部中医药经典古籍与现代教材。这些资料被系统地分为以下几类:

·古典医籍:如《黄帝内经》、《伤寒论》等。

·标准教材:如《中医诊断学》、《中药学》等,提供了系统化、规范化的现代医学知识。

·临床与经验记录:收录了真实的医案和诊疗经验。

·多模态资源:包括舌诊图谱等诊断图像,为视觉推理打下基础。

在技术处理上,团队将所有PDF文件转换为可编辑文本,并进行了人工校对,以确保OCR过程中的信息保真。同时,他们还对图像进行了压缩优化,并将相关文档合并,以适配知识接口的上传限制。最终,通过结构化的提示设计,BenCao被训练成能够根据用户问题类型,自动检索相应知识模块的"学者"。例如,问到基础理论时,它会参考《黄帝内经》;涉及舌诊时,则会调用《中医舌诊图谱》。

  1. 角色定义

为了让BenCao的言行更具专业性和可信度,研究团队为其设定了一个清晰的"人设":一位拥有数十年临床和教学经验的资深中医师。这一人格设定包含以下特质:

·精通核心理论:深刻理解阴阳五行、气血津液、脏腑经络等理论及其生理病理联系。

·熟读典籍:对古今权威著作如数家珍。

·临床经验丰富:擅长在不同临床情境下进行辨证论治和组方调整。

·沟通能力出众:能用清晰易懂的语言,向医学生和普通大众阐释复杂的中医概念。

这个角色的设定,是BenCao所有行为逻辑的基石,确保它从"思维"到"言谈"都符合一名优秀中医师的规范。

  1. 场景指令设计

基于上述“人设”,团队进一步开发了一套场景化的指令系统,使BenCao能根据用户的不同意图,动态调整对话风格和知识检索策略。这套系统涵盖了四个核心应用场景:

场景名称 目标用户 核心功能 关键约束
中医药理论学习 中医学生、爱好者 解释概念,引经据典,教学互动 严禁提供医疗或处方建议
轻度健康不适调理 有轻微症状人群 初步辨证,提供生活、饮食建议 必须包含安全免责声明,建议症状持续时就医
体质评估与舌象诊断 希望了解自身体质者 交互问答,舌象分析,体质判定 明确声明结果仅供参考,不替代专业诊断
日常养生与季节保健 健康及亚健康人群 根据四季变化提供个性化养生指导 附带免责声明,禁止输出诊断或处方

图1:BenCao场景化指令设计框架。

  1. 思维链模拟

为了模仿资深中医师的思考路径,团队为其集成了思维链模拟机制。该机制将推理过程分解为四个连续的步骤:

1.症状识别:从用户的主诉、伴随症状、舌象特征和生活模式中提取关键信息。

2.证候辨析:根据阴阳、五行、脏腑、气血津液等中医理论维度进行诊断分析。

3.治则推理:基于辨出的证型,推导出治疗方向,如疏肝解郁、健脾补气、滋阴清热等。

4.建议生成:产生非处方性的生活与饮食调整建议,并考虑个体体质和季节因素。

在此过程中,系统会进行证据充分性检查。如果关键信息缺失(例如,无法判断病性的寒热虚实),模型会进入"信息寻求"模式,主动提出3-5个高信息增益的问题,如"您平时怕冷吗?手脚冰凉吗?"“您偏好冷饮还是热饮?”“最近大便偏干还是偏溏?”"情绪有无显著波动?"等。

这种交互式推理将持续进行,直到满足以下任一终止条件:
(a)核心诊断要素的覆盖率超过80%,表明已获得足够信息进行可靠推理;
(b)连续两轮询问的新增信息增益低于10%,意味着继续提问收益甚微;
(c)用户明确拒绝提供更多信息。

一旦满足条件,BenCao会自动转入保守合规模式,仅提供初步的体质分析和一般性生活方式建议,同时严格避免任何诊断或处方相关输出。

对于孕期、儿科、慢性病或急性重症等高不确定性或伦理敏感场景,系统会启动不确定性感知保护机制。在此模式下,BenCao会生成概率性的谨慎陈述,并附带明确的免责声明与医疗建议,提醒用户若症状加重,应及时前往认证医疗机构寻求专业评估。

  1. 人工反馈引导的指令优化

为使BenCao的输出更贴合中医临床思维与专业标准,研究团队引入了一个由三名执业超过十年的中医师组成的专家小组,开展迭代式人工反馈优化。

与依赖参数重训练的传统方法不同,此优化过程聚焦于语义层面。专家通过自然语言反馈,逐步塑造模型的推理结构、语言精确度及伦理合规性,旨在使BenCao的回答契合中医的逻辑、术语与专业标准。

在四大核心交互场景中,团队对模型输出进行系统评估。当回答未达要求时------如缺乏权威文献引用、辨证逻辑不完整或遗漏安全提醒------评估者会提供批评性反馈,明确指出错误并提出针对性改进建议。反之,当输出在准确性、逻辑完整性和伦理一致性上符合预期时,则给予积极反馈,以强化良好行为。

这三位具备诊断、方剂与体质理论专长的专家,同时承担实践者与评审者双重角色:既在模拟临床咨询中评估其实用性与可靠性,又通过持续的正负反馈循环,不断校准模型的行为边界与知识精度。

这种以反馈驱动的优化机制,使BenCao逐步掌握了与专家级实践相一致的推理风格与沟通模式,从而在事实准确性、可解释性及伦理遵循方面实现了持续提升。

  1. 外部API集成

为了弥补纯文本模型的局限,BenCao与团队此前开发的舌象分类模型和一个多模态中医药知识数据库进行了API集成。这意味着,当用户上传舌象图片时,BenCao可以调用外部分类模型进行分析,并结合数据库中的结构化知识,生成更精准、更有依据的综合评价,大大增强了其在真实临床推理场景中的能力。

三、 结果

研究团队对BenCao进行了全面的性能评估,将其与多个通用大模型(如GPT-4o, Gemini 2.5 Pro, Claude 3等)以及中医药领域模型进行了对比。

·单选题基准测试:在涵盖诊断学、生药学、外科学、方剂学、内科学等七个中医药学科的单选题测试中,BenCao在多数科目中均取得了具有竞争力或更优的准确率,尤其在诊断学和方剂学上表现突出。这表明其对中医药领域特有的推理模式有了更好的把握。

图2:中医单项选择题各类别模型性能。不同逻辑线性模型(LLM)在中医七个类别(包括诊断学、生药学、外科、中药方剂和内科学)单项选择题上的准确率。x轴表示题型,y 轴表示各模型对应的准确率。

·草药识别与体质分类任务:在这两项更具中医药特色的任务中,BenCao的表现全面超越了所有通用模型,草药识别准确率达到82.18%,体质分类准确率达到63.42%,显示出其出色的领域适应性。

图3:草药识别和中医体质分类任务的跨任务表现。每个点代表单个 LLM 在两项中医任务上的准确率:草药识别(x 轴)和中医体质分类(y 轴)。虚线对角线表示两项任务表现相同;点越靠近右上角,则表示跨任务表现越强。

四、 使用

完成开发和验证后,BenCao被部署在OpenAI的GPTs商店中,成为一个可供全球用户访问的交互式智能体。用户无需安装额外软件或具备专业医学知识,只需在商店中搜索“BenCao”,即可开启实时对话,体验其全部功能。截至2025年10月,BenCao已完成了近千次用户交互会话,初步证明了其在真实世界中的实用性和可接受度。

图4:BenCao使用界面

五、 讨论

BenCao的研究展示了通过指令微调与多模态融合,即使不进行昂贵的参数重训练,也能实现大语言模型与专家推理逻辑的对齐。它为中医药的智能化提供了一个兼具知识性、推理性和安全性的平台原型。

然而,作者团队也清醒地指出,BenCao目前仍是一个研究原型,而非临床决策支持系统。其诊断准确性和处方能力被人为限制,以防止临床误用。其主要依赖文本和有限视觉信息,在处理脉象等更复杂的诊断信息方面仍有不足。此外,人类反馈优化虽好,但尚无法替代基于强化学习或大规模标准基准测试的严谨性。

尽管BenCao取得了显著进展,它目前仍是一个研究原型而非临床决策支持系统。模型的诊断准确性和处方能力被刻意限制,以防止临床误用。系统对文本数据和有限视觉模态的依赖,也限制了其在脉诊、综合治疗方案制定等复杂诊断场景中的应用。此外,人类反馈优化虽提升了模型的行为稳定性与伦理遵循度,但尚不能替代强化学习或系统化基准评估的严谨性。

未来工作将聚焦于以下方向:扩展多模态集成,纳入生理信号、电子病历等多源数据,构建更全面的中医诊疗推理模型;通过与多机构合作开展大规模临床验证,加强真实世界应用评估;建立包含标准化评估协议与伦理框架的开放式中医大模型基准,确保安全性、透明性与可复现性;长期目标是将专家反馈与基于临床数据的强化学习相结合,开发能够持续自我优化的自适应中医智能体,为教育、科研和患者服务提供更深入的支持。

六、 结论

本研究提出了BenCao------一个基于ChatGPT的中医药多模态助手。通过整合结构化知识、多模态推理和专家反馈,BenCao实现了与中医诊疗推理框架相契合的可靠、可解释且具备情境感知的交互能力。该系统在教育、咨询和健康指导场景中展现出巨大潜力,为如何将大语言模型适配于文化根基深厚且专家驱动的医学领域提供了早期范例。

更重要的是,这项工作证明了仅通过基于自然语言的指令微调即可开发中医药大语言模型的可行性,无需进行参数重训练。这一方法为其他专业领域基础模型的现实应用提供了实用且可推广的参考框架。

原文链接: https://arxiv.org/abs/2510.17415

精选问题与回答:

提问:1. BenCao的英文输出中是如何翻译阴阳五行,气血津液这些相对而言比较抽象的词汇的。例如中医的肾脏并不完全是现代医学中的肾脏,BenCao如何处理这一语言偏差呢?2. 草药识别并没有在方法中注明,是如何进行的,所用来测试的草药图片是从哪里获取的呢?

答:论文通过“中医理论学习”场景要求BenCao使用系统性解释、权威文献引用和通俗表达来讲解“阴阳五行、气血津液、脏腑系统”等概念,但并未进一步说明在英文输出中如何具体处理这些术语与现代医学概念之间的差异,也没有给出固定的术语映射或专门算法设计。
结合作者团队的另一项相关工作TCM-Ladder数据集,草药识别评测依托的是该多模态中医基准数据中的草药图像部分。TCM-Ladder中草药图像的主要来源包括:专著《The Pharmacology of Chinese Herbs》中收录的中药材图片与名称和在中药生产、加工与相关场景中实拍采集的图片。

Xie, Jiacheng, et al. TCM-Ladder: A Benchmark for Multimodal Question Answering on Traditional Chinese Medicine. arXiv preprint arXiv:2505.24063 (2025).

提问:除了单选题以及分类任务外,本草有没有对实际的问答、问诊情景以及思维链与其他LLM进行比较,要用什么指标来衡量本草在实际的任务中能够做的更好,相比其他LLM

答:除了单选题与分类任务外,在作者团队的另一项相关工作TCM-Ladder中,对BenCao与其他大模型在更贴近真实问诊与推理场景下的表现进行了对比评估。在诊断对话任务中,研究团队主要采用了多种自然语言生成类指标来衡量模型回答的质量与医学逻辑的契合度,包括:BLEU-4与ROUGE-L衡量生成回答与参考答案之间的词汇与句法相似度;METEOR与BERTScore衡量语义相似性与表达流畅度;Ladder-Score一种结合语义准确性与中医辨证逻辑一致性的综合指标。结果显示,BenCao在该任务中取得了最高的BERTScore(0.9663),说明其生成的回答与标准参考答案在语义层面最为接近,也表现出较好的逻辑对齐。总体来看,BenCao的语义理解与专业术语准确性表现突出。此外,在填空任务中,BenCao的表现更为明显:以0.9034的精确匹配率显著超越了所有通用模型。这说明BenCao在涉及专业名词与结构化知识调用的任务上,具有更强的事实记忆与术语精确性。这些结果表明,BenCao在结构化对话与知识填充类任务中表现出更好的语义对齐和专业知识掌握能力,尤其在需要准确检索中医知识和使用专业术语的场景下,明显优于通用大模型。

提问:1.文里提到通过“指令微调”而非“参数重训练”来实现,这两种方式的区别是什么?2.“体质分类准确率达到63.42%”,这个水平很高吗,相当于人类中医师的什么级别?

答:“指令微调”指的是通过系统prompt设计和中医师的自然语言反馈,在对话层面约束和优化 ChatGPT 的行为,而不是去更新底层模型参数,因此不需要重新训练或微调权重,优点是成本低、迭代快、易于在现有大模型之上构建领域助手,但同时也受限于底层模型本身的能力与偏差,难以像参数重训练那样从根本上重塑模型的知识结构和推理边界。

文中没有给出人类中医师在同一任务上的准确率,因此无法直接将63.42%对应到某个具体的“人类医生等级”,只能说这是“相对其他模型更好”的结果。

提问:本草具体是怎么判断“关键信息缺失”从而进入信息寻求模式的?当用户回答较模糊如回答“有时怕冷有时怕热”时,是否会继续追问以得到明确结果或者优先采信其他信息?

答:BenCao在信息不足或不确定性较高的情况下,更倾向于通过适度追问尽量补全信息,如仍无法获得明确结论,则转入保守模式,仅给出初步体质与生活方式建议,并避免过度自信的诊断性表述,在向BenCao提问“感觉到头晕发烧该怎么办”,并继续提供信息时怕冷有时怕热”回答如下图所示:

提问:1. “对于孕期、儿科、慢性病或急性重症等高不确定性或伦理敏感场景,系统会启动不确定性感知保护机制。”,慢性病和急性重症排除在外,剩余的就不多了吧?可用性不会大打折扣吗?2. 用户提供的照片亮度/对比度等不同会影响舌象结果吗?如何排除这个无关因素?

答:首先,论文在讨论部分明确指出,BenCao的定位并不是“临床决策支持系统”,而是一个研究型原型和中医领域助理。作者特意强调:BenCao的诊断、处方相关能力是“刻意受限”的,目的就是避免被误用为真正的临床诊断工具,而不是去替代中医师做高风险医疗决策。其次,从应用场景设计来看,即使将孕期、儿科、慢性病和急性重症等高不确定性或伦理敏感场景置于严格保护之下,可用性并没有被“砍到所剩无几”,因为论文本身就把主要应用集中在四大场景上:中医理论学习、轻度健康不适调理、体质评估与舌象相关分析、日常养生与季节保健。这些场景本身就偏向于教育、科普、健康管理与轻度不适调理,而不是急、重症治疗或复杂慢性病管理。

针对“用户提供的舌象照片在亮度、对比度等方面的差异是否会影响分析结果,这一部分属于未在BenCao论文中详细披露的实现层面问题,只能说作者确认使用了既有舌象分类模型与多模态数据库,但具体的图像标准化与抗干扰机制并未在文中展开。

提问:问题:1.BenCao基于ChatGPT进行构建,是GPT-4o吗? 2.图2中deepseek在部分学科上表现优于BenCao,但图3“在这两项更具中医药特色的任务中,BenCao的表现全面超越了所有通用模型”似乎没有看到Deepseek的跨任务表现显示?

答:根据在OpenAI GPTs Store中提供的信息,BenCao的基座模型采用的是GPT-5;在前面的单选题基准测试中,作者将DeepSeek作为通用大模型之一纳入了对比,在部分学科上DeepSeek的确在局部指标上优于BenCao,但也的确在当前论文版本并未给出DeepSeek在“草药识别+体质分类”这两项任务上的具体成绩。

那么,如何系统的去学习大模型LLM?

作为一名深耕行业的资深大模型算法工程师,我经常会收到一些评论和私信,我是小白,学习大模型该从哪里入手呢?我自学没有方向怎么办?这个地方我不会啊。如果你也有类似的经历,一定要继续看下去!这些问题啊,也不是三言两语啊就能讲明白的。

所以我综合了大模型的所有知识点,给大家带来一套全网最全最细的大模型零基础教程。在做这套教程之前呢,我就曾放空大脑,以一个大模型小白的角度去重新解析它,采用基础知识和实战项目相结合的教学方式,历时3个月,终于完成了这样的课程,让你真正体会到什么是每一秒都在疯狂输出知识点。

由于篇幅有限,⚡️ 朋友们如果有需要全套 《2025全新制作的大模型全套资料》,扫码获取~
在这里插入图片描述

👉大模型学习指南+路线汇总👈

我们这套大模型资料呢,会从基础篇、进阶篇和项目实战篇等三大方面来讲解。
在这里插入图片描述
在这里插入图片描述

👉①.基础篇👈

基础篇里面包括了Python快速入门、AI开发环境搭建及提示词工程,带你学习大模型核心原理、prompt使用技巧、Transformer架构和预训练、SFT、RLHF等一些基础概念,用最易懂的方式带你入门大模型。
在这里插入图片描述

👉②.进阶篇👈

接下来是进阶篇,你将掌握RAG、Agent、Langchain、大模型微调和私有化部署,学习如何构建外挂知识库并和自己的企业相结合,学习如何使用langchain框架提高开发效率和代码质量、学习如何选择合适的基座模型并进行数据集的收集预处理以及具体的模型微调等等。
在这里插入图片描述

👉③.实战篇👈

实战篇会手把手带着大家练习企业级的落地项目(已脱敏),比如RAG医疗问答系统、Agent智能电商客服系统、数字人项目实战、教育行业智能助教等等,从而帮助大家更好的应对大模型时代的挑战。
在这里插入图片描述

👉④.福利篇👈

最后呢,会给大家一个小福利,课程视频中的所有素材,有搭建AI开发环境资料包,还有学习计划表,几十上百G素材、电子书和课件等等,只要你能想到的素材,我这里几乎都有。我已经全部上传到CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
在这里插入图片描述
相信我,这套大模型系统教程将会是全网最齐全 最易懂的小白专用课!!

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐