首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Nat. Protoc. | 大型语言模型在医学研究中的应用指南

Nat. Protoc. | 大型语言模型在医学研究中的应用指南

作者头像
DrugAI
发布2026-07-28 15:00:06
发布2026-07-28 15:00:06
2060
举报

近年来,以GPT-5、Claude、Gemini、Llama和DeepSeek等为代表的大型语言模型快速发展,正在深刻改变医学研究和医疗健康领域的工作模式。研究人员指出,这类模型不仅能够理解和生成自然语言,还能够依据用户指令完成复杂推理,并逐渐具备跨模态信息处理能力,因此已经在医学问答、临床文书生成、患者与临床试验匹配、医学教育以及科研辅助等多个方向展现出广阔应用前景。然而,目前医学领域对于大型语言模型的使用仍然缺乏统一、规范且可操作的实践指南,许多使用方式仍停留在简单的人机对话层面,难以充分发挥模型能力,也容易引发幻觉、偏倚、隐私泄露等问题。

为此,研究人员提出了一套完整的大型语言模型医学应用流程,从任务定义开始,依次经历模型选择、提示工程、模型微调以及最终部署五个阶段,并针对每一阶段总结了相应的最佳实践,为医学研究人员和临床工作者提供系统性的指导框架。研究人员强调,只有充分结合具体医学任务特点、数据类型、安全规范以及持续评估机制,才能真正实现大型语言模型在医疗实践中的安全、高效和可靠应用。

随着生成式人工智能的发展,大型语言模型已经成为近年来医学人工智能领域最重要的技术突破之一。相比传统机器学习模型只能完成某一种固定任务,大型语言模型能够依靠预训练获得丰富的医学知识,并通过自然语言交互快速适应新的任务,因此具有明显的通用性优势。

研究人员指出,目前大型语言模型已经能够支持医学知识问答、临床决策辅助、医学影像分析、病历摘要生成、医学文献总结、患者沟通以及临床试验匹配等众多应用。与此同时,新一代多模态模型还能够同时处理文本、医学影像、语音以及部分组学数据,为构建真正意义上的通用医学人工智能奠定了基础。

尽管如此,大型语言模型在医学中的应用仍然存在明显挑战。一方面,不同医学任务对于模型能力的要求差异巨大,例如医学知识问答强调推理能力,而病历结构化则更关注信息抽取准确率;另一方面,医学数据具有高度敏感性,模型部署还必须满足患者隐私保护、伦理监管以及法规要求。此外,模型还可能产生事实错误、引用不存在文献、输出带有偏见的建议等问题,因此不能简单依赖聊天机器人完成医疗任务。

研究人员认为,目前最缺乏的并不是新的模型,而是一套完整的方法学框架,用于指导医学工作者如何正确选择模型、构建任务、设计提示、评估性能以及安全部署。因此,本教程提出了一个贯穿整个开发流程的标准框架,希望帮助医学研究人员建立规范的大模型应用流程,而不是停留在简单的Prompt尝试阶段。

方法

研究人员提出的大型语言模型医学应用框架由五个连续阶段组成,包括任务定义、模型选择、提示工程、模型微调以及部署实施。整个流程强调首先明确医学问题,再根据任务特点选择合适的大模型,通过不断优化提示或微调模型提升性能,最后结合监管、安全、公平性和成本等因素完成实际部署。

整个流程并非线性不可逆,而是形成持续优化的闭环。当模型效果不能满足需求时,可以重新调整任务定义、重新选择模型或者继续进行提示优化与微调,直到达到实际应用要求。这一框架覆盖了医学研究从实验室到临床实践的大部分应用场景,为不同背景的研究人员提供了一套可重复实施的方法体系。

结果

任务定义(Task Formulation)

研究人员认为,一个医学需求并不能直接交给大型语言模型处理,而应首先转化为模型能够理解的具体任务。根据目前大型语言模型的核心能力,医学任务可归纳为五类:知识与推理、文本摘要、文本翻译、结构化信息提取以及多模态分析。

知识与推理是目前应用最广泛的方向。大型语言模型可以利用预训练过程中获得的大量医学知识完成医学问答、疾病分析、临床辅助决策以及患者与临床试验匹配等任务。这类任务通常包括问题输入、模型推理过程以及最终答案三个部分。研究人员建议,对于需要推理的医学任务,应同时保留模型给出的解释过程,以便研究人员进一步判断其推理是否合理,而不仅仅关注最终答案。

第二类任务是文本摘要。临床工作每天都会产生大量病历、住院记录和科研文献,传统人工整理耗时耗力。大型语言模型能够自动将长篇病历浓缩为出院小结、病程记录,也能够对大量医学论文进行归纳总结,从而提高科研和临床工作的效率。不过,研究人员提醒,仅依赖自动评价指标并不能完全反映摘要质量,最终仍需要医学专家进行人工审核。

第三类任务是医学翻译。大型语言模型不仅能够实现不同语言之间的转换,还能够完成专业医学语言与大众科普语言之间的转换。例如,可将复杂的诊断报告转化为患者能够理解的语言,也能够支持不同国家和地区医学知识共享,对于医学教育和患者沟通具有重要意义。

第四类任务是结构化处理。医疗数据大量以自由文本形式存在,例如电子病历、检查报告以及科研论文。大型语言模型能够自动提取疾病名称、药物、基因变异及其相互关系,并进一步生成结构化数据库,为医学知识图谱、临床编码以及电子病历标准化提供支持。

第五类则是近年来快速发展的多模态分析。随着多模态大型语言模型的发展,模型能够同时理解医学影像、电子病历、实验室检查结果乃至基因组数据,从而实现更加全面的医学分析。例如,模型可以结合患者既往病史和当前CT影像自动生成放射学报告,也能够辅助医生完成综合诊断,为未来构建真正意义上的通用医学人工智能提供了可能。

图1: 大型语言模型医学应用总体流程。

研究人员提出的大模型医学应用框架包括任务定义、模型选择、提示工程、模型微调和部署五个阶段,各阶段形成可持续迭代优化的完整工作流程。

图2: 医学研究中五类大型语言模型任务类型。

包括知识推理、文本摘要、医学翻译、结构化信息提取和多模态分析五种典型任务,以及其对应的医学应用场景。

模型选择(LLM Selection)

完成任务定义之后,第二步便是选择合适的大型语言模型。研究人员指出,目前医学领域既有GPT、Claude、Gemini等商业闭源模型,也有Llama、Qwen、Mistral、DeepSeek等开源模型,不同模型在推理能力、上下文长度、多模态支持以及部署方式方面存在明显差异,因此不存在适用于所有任务的“最佳模型”。

研究人员认为,模型选择首先需要考虑任务本身的数据类型。如果处理的是普通医学文本,大多数语言模型都能够胜任;但如果涉及医学影像、病理图片、语音、电子病历或组学数据,则必须选择支持相应数据模态的模型。与此同时,对于需要分析大量医学文献或长篇病历的任务,还应重点关注模型支持的上下文窗口长度,以避免输入内容超出模型处理能力。

此外,模型性能也需要结合真实医学任务进行评价,而不能仅依赖公开排行榜。研究人员指出,医学考试数据集能够初步反映模型知识水平,但考试成绩高并不意味着实际临床应用能力更强。因此,更可靠的方法是在真实医学场景中开展人工评估,结合临床专家意见综合判断模型是否满足实际需求。

图3: 大型语言模型选择策略。

提示工程(Prompt Engineering)

研究人员指出,选择性能优异的大型语言模型只是成功应用的第一步,更关键的是如何通过合理设计提示(Prompt)充分激发模型能力。对于绝大多数医学任务而言,仅仅输入一句简单的问题往往难以获得稳定可靠的结果,因此提示工程成为连接模型能力与医学应用之间的重要桥梁。

研究人员将目前医学领域最常见的提示优化方法归纳为少样本学习、思维链提示、检索增强生成、工具调用以及温度参数控制等几类。

少样本学习(Few-shot Learning)是目前最容易实施的方法之一。其基本思想是在正式输入待处理任务之前,先向模型提供若干具有代表性的示例,使模型能够学习期望的回答方式。例如,在患者与临床试验匹配任务中,每个示例同时包含患者信息、试验纳入标准以及正确答案,使模型能够理解医学判断逻辑,而不仅仅依赖自身已有知识。研究人员强调,这些示例应覆盖尽可能丰富的医学情景,包括不同疾病类型、不同标签以及边界病例,从而提高模型面对复杂病例时的泛化能力。实践中通常建议首先尝试零样本提示,当效果不足时,再逐步增加一到五个具有代表性的示例即可,不必无限增加示例数量。

另一项重要技术是思维链提示(Chain-of-Thought Prompting)。相比直接给出答案,研究人员建议要求模型首先输出完整的推理过程,再给出最终结论。例如,在判断患者是否符合临床试验入组标准时,模型会首先分析患者病史、检查结果以及各项纳入条件之间的对应关系,再最终判断是否满足要求。这种逐步推理不仅能够提高模型准确率,还能够让医生快速检查模型推理是否合理,从而增强医学应用的可解释性。因此,研究人员建议在绝大多数医学推理任务中默认启用思维链提示,而不是直接要求模型输出最终答案。

对于知识密集型任务,研究人员重点推荐检索增强生成(Retrieval-Augmented Generation,RAG)。由于大型语言模型的知识来源于训练数据,其内部知识具有时间限制,而且可能产生事实错误。RAG通过首先检索PubMed、医学教材、临床指南以及系统综述等权威资料,再将检索内容连同问题一起输入模型,使模型依据真实文献回答问题,从而显著降低幻觉现象,提高答案的可信度。例如,在医学问答、循证医学总结以及疾病诊疗建议生成等任务中,RAG能够保证回答建立在最新证据基础之上,而不是完全依赖模型自身记忆。研究人员建议优先选择高质量医学知识库,而非普通互联网网页作为检索来源,以保证回答质量。

除检索外,大型语言模型还能够调用外部工具完成复杂医学任务。例如,模型可以调用电子病历数据库、基因数据库、药物数据库或医学计算器,在需要时自动获取额外信息,再结合语言模型完成综合分析。这种工具学习(Tool Learning)进一步突破了传统语言模型只能依赖文本知识的限制,使模型能够逐渐向智能医学代理方向发展。例如,在患者筛选过程中,模型可以直接读取完整电子病历,而不仅仅依赖人工整理后的摘要,从而提高临床信息利用效率。

研究人员还讨论了温度参数的重要性。温度决定模型输出结果的随机程度。较低温度能够获得更加稳定且可重复的回答,适合医学研究和临床决策;较高温度则能够生成更加多样化的答案,更适用于头脑风暴、假设生成或多答案集成等任务。因此,对于需要可重复实验结果的医学研究,研究人员建议将温度设置为0,并采用JSON等结构化格式输出结果,方便后续程序自动解析和分析。此外,对于单细胞测序、可穿戴设备信号以及多模态输入,研究人员建议首先将复杂数据转换为清晰、规范的文本描述,再交由大型语言模型处理,以进一步提升模型理解能力。

图4: 提示工程与模型微调策略。

模型微调(Fine-tuning)

虽然提示工程能够解决大量医学任务,但研究人员指出,当模型性能始终无法满足要求时,便需要进一步进行模型微调。通常有三种情况适合考虑微调:第一,经过多轮提示优化后模型性能仍然不足;第二,已经积累了大量高质量医学标注数据;第三,提示过长导致推理成本过高,希望将知识直接学习到模型内部。

目前常见的微调方式包括全参数微调以及参数高效微调两类。全参数微调能够更新整个模型,因此适合拥有大量计算资源和大规模训练数据的研究机构;参数高效微调则仅调整模型中极少部分参数,例如LoRA等方法,在保持模型主体不变的情况下完成特定医学任务学习。这类方法不仅显著降低显存需求,而且在中小规模医学数据集上往往能够取得接近甚至超过全参数微调的效果,因此越来越受到医学研究人员欢迎。

研究人员认为,究竟采用哪一种微调方式,应综合考虑训练数据规模、计算资源以及目标任务特点。无论采用何种方式,完成训练之后都必须使用独立测试集重新评估模型性能,确保模型真正获得性能提升,而不是仅仅记忆训练数据。

部署实施与临床应用

模型完成开发之后,并不意味着可以直接进入临床使用。研究人员强调,大型语言模型部署阶段涉及法规、安全、公平性以及运行成本等多个方面,需要建立完善的治理体系。

首先是监管与隐私保护。医学数据属于高度敏感信息,因此所有涉及患者数据的大模型系统都必须满足相应法规要求。例如,在处理真实患者数据时,应选择符合医疗数据安全规范的平台,或者直接在医院本地服务器部署开源模型,以避免患者隐私泄露。对于公共聊天平台,研究人员并不建议直接上传包含身份信息的电子病历,因为部分服务可能会利用用户输入继续训练模型,从而带来潜在风险。

其次是模型公平性。研究人员指出,目前大型语言模型仍可能存在种族、性别以及社会经济背景等方面的偏倚。如果模型面对完全相同的病例,仅因患者种族不同而产生不同治疗建议,就可能导致医疗资源分配不公平。因此,在正式部署之前,应利用公开公平性测试集或真实临床数据对模型进行系统评估,并持续监测模型在实际运行中的表现。

成本同样是部署过程中必须考虑的重要因素。闭源商业模型通常按照输入和输出Token数量收费,随着调用规模增加,运行费用也会不断提高;相比之下,开源模型虽然需要采购GPU等硬件设备,但长期运行成本相对较低,同时具有更高的可定制性和数据自主控制能力。因此,研究人员建议根据机构规模、数据敏感程度以及长期维护成本综合选择部署方案,而不是单纯追求性能最强的模型。

最后,研究人员强调,大型语言模型部署后仍需持续监测。模型输出应始终作为医生辅助工具,而不能替代临床医生最终判断。同时,应建立持续培训机制,使医务人员充分理解模型优势与局限,并结合患者和社区反馈不断优化模型表现。此外,随着基础模型不断升级,医疗机构还需要重新验证提示策略、安全性及法规符合性,保证整个系统始终满足临床要求。

讨论

研究人员认为,大型语言模型正在推动医学人工智能由单一任务模型向通用智能平台转变,其价值不仅体现在提升科研效率,更体现在改善临床决策、优化医疗流程以及促进循证医学实践。然而,大型语言模型并不是可以直接应用于医疗工作的“万能工具”,真正发挥价值仍然依赖于规范的方法学体系。

本教程提出的五阶段框架,将任务定义、模型选择、提示工程、模型微调以及部署管理整合为完整工作流程,使医学研究人员能够依据具体应用需求选择合适模型,并通过持续优化不断提高系统性能。与此同时,教程特别强调隐私保护、公平性评估、法规遵循以及持续监测的重要性,体现出医学人工智能不仅是技术问题,更涉及伦理、监管和社会责任。

研究人员最后指出,未来随着推理模型、多模态模型以及智能代理技术不断发展,大型语言模型将在医学研究、临床实践和精准医疗中承担越来越重要的角色。但无论模型能力如何提升,医学专家始终应处于决策核心位置,大型语言模型应作为增强医生能力的智能助手,而非替代医生进行最终医疗判断。

研究人员总结了医学大模型选择流程,重点考虑数据类型、上下文长度、模型能力、自动评测结果、临床评测结果以及部署方式等多个因素,帮助用户依据具体任务选择最合适的大型语言模型。

展示了少样本学习、思维链提示、检索增强生成、工具调用、温度控制以及模型微调等关键技术,并以患者—临床试验匹配任务为例说明不同策略如何共同提升大型语言模型在医学任务中的性能。

整理 | DrugOne团队

参考资料

Jin, Q., Wan, N., Leaman, R. et al. Tutorial: guidance on the use of large language models for medical research. Nat Protoc (2026).

https://doi.org/10.1038/s41596-026-01408-z

内容为【DrugOne】公众号原创|转载请注明来源

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-27,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档