想象一下这样的场景:一位患者在网上焦急地提问"吃了抗生素后多久不再传染?",底下热心网友回复了一大段话,有个人经历、有医学事实、有建议、还有一句"祝早日康复"的祝福。这些内容混杂在一起,机器该怎么自动分辨哪句是事实、哪句是建议、哪句只是寒暄?这就是社区问答(Community Question-Answering,简称CQA)平台面临的真实困境。像雅虎问答、知乎、百度知道这样的平台上,每天都有海量的健康类提问和回复,这些用户生成内容里面藏着宝藏,但也充满了语言模糊性、语义重叠和表达方式的千奇百怪。传统的一次性分类系统,往往把一段回复当做一个整体塞给模型,结果就是:模型要么漏掉了关键片段,要么把"看起来像建议的事实陈述"给分错了类。在医疗健康这个领域,分类错误可不是闹着玩的,轻则误导患者,重则影响后续的诊断和建议走向。 健康问答中的"视角分类"难题:为什么单次分类总翻车?
要理解这个问题,先得弄明白"视角分类"到底在分什么。在PerAnsSumm共享任务中,研究者把健康问答里的用户回复切分成一个个语义完整的片段,然后给每个片段打上五种视角标签中的一个:信息(Information,表达事实或知识)、原因(Cause,解释为什么会出现某种症状)、建议(Suggestion,提供意见或推荐)、问题(Question,直接提问寻求澄清)、经验(Experience,分享个人经历或感受)。 听起来不复杂对吧?但真正做起来,问题就来了。举个论文中的例子:"如果你按照推荐的方式服用了抗生素,你就不再具有传染性了。"这句话到底算信息还是建议?表面上看,它是在陈述一个医学事实,但它同时也暗含了"你应该按推荐方式服药"的指导意味。再比如,"祝你好运"这种简短的祝福语,到底是信息、建议还是经验?人类一眼就能看出这是善意的鼓励,可机器却容易把它归类为"信息"。 传统的单次分类(Single-Pass)方法,就是让模型一口气把整段用户回复读完,然后直接给出分类结果。这种方式快是快,但有两个致命缺陷。第一,一段回复往往包含多个不同视角的内容,整段打一个标签必然丢信息;第二,模型的"第一判断"未必可靠,对于那些处于类别边界、语义模糊的片段,一次分类没有纠错机会,错了就是错了。 乔治梅森大学(George Mason University)的研究团队,在PerAnsSumm 2025共享任务的Task A(视角片段抽取与分类)中,就针对这个问题提出了一个非常朴实的解决方案——CRA两阶段架构(Classifier-Refiner Architecture,分类器-精炼器架构)。思路一句话就能讲清楚:让AI先答一遍,如果它自己都不确定,就去翻翻资料再答一遍。就是这么简单的一个想法,让这支团队在高手如云的PerAnsSumm任务中拿到了综合得分0.6090,跻身排行榜前五。 两阶段CRA架构:让AI先答再查,不确定就翻书
CRA架构的设计思路非常符合直觉,它模拟了人类回答难题时的行为模式:先凭第一印象给出判断,如果不确定,就查一下参考资料再做决定。整个框架分为两个阶段——分类器(Classifier)和精炼器(Refiner)。下图展示了完整的流程。 ![]()
图1:分类器-精炼器架构(Classifier-Refiner Architecture)。黄色高亮表示从数据集中提取的输入值,包括问题(Q)、上下文(C)和用户回复(A)。蓝色文本表示分类器的输出,随后作为精炼器的输入。粉色高亮表示通过RAG进行示例检索的输出,之后被纳入精炼器的输入。 第一阶段,分类器负责把用户回复切分成"可以独立存在"的片段(Snippet),并为每个片段分配一个初始视角标签。关键在于,分类器还要输出一个二值置信度:CONFIDENT(自信)或者NOT_CONFIDENT(不自信)。如果分类器觉得这个片段很模糊、把握不准,就会把"reason_not_confident"字段填上原因,同时触发第二阶段。分类器输出的JSON格式长这样: [ { "text": "如果你按推荐方式服用了抗生素,你就不再具有传染性。", "confidence": "NOT_CONFIDENT", "reason_not_confident": "可能属于信息或建议,因为它既暗示了诊断也暗示了进一步调查的建议", "category": "CAUSE" } ]第二阶段,精炼器登场。它的核心武器是检索增强生成(Retrieval-Augmented Generation,简称RAG)。触发精炼器时,系统先用一个轻量级的句子相似度模型all-MiniLM-L6-v2,从训练集中检索出与当前模糊片段最相似的两个句子,作为few-shot示例(少样本示例)拼进提示词中,再让大模型参考这些已经标注过的案例,重新决定这个片段的最终标签。精炼器的输出同样走JSON格式,包含之前的类别、置信度、精炼推理过程和最终修正后的类别。 ![]()
表1:示例输出。展示了分类器对一个模糊片段的处理结果,以及精炼器如何通过参考相似示例将类别从CAUSE(原因)修正为INFORMATION(信息)的全过程。 上面这个表格里的例子特别能说明问题。分类器最初认为"如果你按推荐方式服用了抗生素,你就不再具有传染性"这句话属于CAUSE(原因),但同时也坦诚自己不太确定,理由是这句话既像信息又像建议。精炼器检索到的相似示例是"开始服用抗生素后的24到48小时内,你仍然具有传染性"——这是个明确的事实陈述。参考这个例子,精炼器就把之前的误判纠正了过来,重新归类为INFORMATION(信息)。这种"先回答、再核对"的机制,正是CRA架构的核心价值所在。 此外,研究团队在提示词设计上还引入了两个重要的辅助技巧。第一个是语气定义(Tone Definition),也就是在提示词中明确告诉模型每个类别的"语气特征",比如信息类对应"告知性、教育性",原因类对应"解释性、因果性",建议类对应"咨询性、推荐性"。第二个是思维链提示(Chain-of-Thought,简称CoT),让模型在给出标签之前先输出一段推理过程,把"为什么这么分类"的逻辑讲清楚。这两个技巧单独用效果有限,但叠加在CRA的两阶段框架上,就能产生1+1>2的效果。 三大LLM同台竞技:GPT-4o、Claude 3与o1-preview谁更懂健康回复?
光有一个好架构还不够,还得看大模型"底盘"给不给力。研究团队在实验中对三款主流大语言模型进行了横向对比:GPT-4o、Claude 3和o1-preview。这三款模型的定位差异非常明显:GPT-4o擅长多模态理解和快速响应,Claude 3强调安全对齐和长上下文处理,o1-preview则主打复杂推理,在数学、编程等需要深度思考的任务上表现突出。 实验设计也很有讲究。团队对GPT-4o做了五种配置的对比:单次提示(Single Prompt)、单次提示去掉问题(Single Prompt without Question)、CRA加指令和语气定义、CRA加思维链、CRA加思维链再加语气定义。Claude 3和o1-preview则主要测试了CRA加语气定义的配置。评估指标采用PerAnsSumm官方指定的七项:宏平均F1(C-MF1)、加权F1(C-WF1)、严格模式下的精确率/召回率/F1(S-P/S-R/S-F1)以及比例模式下的精确率/召回率/F1(P-P/P-R/P-F1)。 ![]()
表2:Task A实验结果。展示了GPT-4o在五种配置下的表现,以及Claude 3和o1-preview在CRA+指令+语气定义配置下的表现。o1-preview综合得分最高,达到0.6090。 从表2可以读出几个关键信息。第一,CRA两阶段架构全面碾压单次分类。GPT-4o的单次提示综合得分只有0.5142,而套上CRA框架后,最差的配置也能到0.5494,最好甚至到0.5507。别小看这几分提升,在分类任务里,综合得分提升0.03已经算是很显著的进步了。第二,思维链和语气定义各有侧重。加了CoT的配置(0.5507)比只加指令和语气定义的配置(0.5494)略高一点点,说明GPT-4o本身就有一定的结构化推理能力,外部思维链的边际收益有限。第三,o1-preview的推理能力确实鹤立鸡群。同样是CRA加指令加语气定义,Claude 3的综合得分只有0.4822,o1-preview却直接拉到0.6090,比例模式下的召回率(P-R)高达0.8406。 ![]()
表3:Task A前五名队伍结果。MNLP(乔治梅森大学团队)以综合得分0.6090排名第二。 放到整个PerAnsSumm共享任务的大盘子里看,MNLP团队的0.6090综合得分排在所有参赛队伍的第二位,仅次于队伍"yxyx"的0.6213。有意思的是,MNLP在最能反映分类精细度的比例F1(P-F1)指标上拿到0.7382,是前五名里最高的,说明CRA架构对于处理"模糊片段"确实有一套。 为什么o1-preview表现这么猛?论文给出了一个很有意思的分析角度——内部思维链与外部思维链的博弈。o1-preview这款模型在架构层面就把思维链内化了,它不允许用户在提示词里手动指定CoT步骤,因为模型自己就会在内部完成推理。而GPT-4o需要用户显式地给出CoT提示才能发挥出最佳水平,一旦给出清晰的步骤指引,它的表现(0.5507)就能逼近自己加指令加语气定义的水平(0.5494)。换句话说,GPT-4o是个"需要脚手架"的选手,而o1-preview自带脚手架。 ![]()
图2:桑基图,展示了片段标签从分类器到精炼器的流向。每个节点代表一个分类标签,左侧节点对应分类器的初始标签,右侧节点代表精炼器的最终标签。链接的粗细与类别间转移的片段数量成正比。 错误分析揭秘:AI如何区分"祝福语"和"医学建议"?
CRA架构在评测中总共触发了21次精炼器(全部1039个片段中),占比只有2%左右,但正是这2%的"疑难杂症",最能看出两阶段设计的价值。研究团队对这21个案例做了系统的错误分析,发现精炼器集中修正了三类典型问题。 第一类是简短或礼貌性表达被误判。比如"祝你好运""保重身体"这种简短的祝福语,分类器很容易默认归类为INFORMATION(信息),因为它们看起来就是在陈述一个"和你有关"的事实。但精炼器在检索了训练集中的相似例子后发现,这类表达在语义功能上更接近鼓励和建议,应该归为SUGGESTION(建议)。读者可以试想一下,当一位患者看到"good luck"这样的话语时,感受到的是温暖和支持,而不是在接收一条医学知识——这就是语用层面的微妙差别。 第二类是修辞性问句被误判为真问题。比如"这难道不是抗生素的功劳吗?"这种反问句,形式上是个问句,但实际功能是表达观点、传递信息。分类器在这种片段上特别容易翻车,而精炼器通过参考上下文和训练集中的类似案例,能够识别出这种"话里有话"的修辞意图。 第三类是个人叙述与客观信息的混淆。比如"这个问题问得真好"这样带有主观评价色彩的评论,分类器容易归为INFORMATION,但精炼器认为这更像是个人的情感表达和关系维护,应该归为EXPERIENCE(经验)。从图2的桑基图可以直观看到,精炼器最常做的修正就是把INFORMATION改成SUGGESTION,同时也会把部分QUESTION和EXPERIENCE的错分片段纠正过来。 ![]()
表4:精炼器修改分类标签的示例。展示了四类典型错误修正:EXPERIENCE(经验)改为SUGGESTION(建议)、INFORMATION(信息)改为SUGGESTION(建议)、QUESTION(问题)改为INFORMATION(信息)、以及未分类改为SUGGESTION(建议)。 这些修正看起来简单,背后却反映了一个深刻的洞察:文本分类不仅仅是词汇层面的匹配,更是语用功能的判断。短句"祝你好运"从字面看确实在传递一个"信息",但它在对话中的功能是表达善意和支持。这种语用层面的理解,单靠一次分类很难做对,必须结合参考示例和上下文进行二次判断。CRA架构的巧妙之处就在于,它没有试图让单个分类器变得更聪明,而是通过"不确定就翻书"的机制,给了模型一次纠错的机会。 从PerAnsSumm到未来:CRA架构的局限与医疗AI的下一步
看完成绩和亮点,再来泼泼冷水。CRA架构虽然有效,但它的局限性也非常明显。首先,这个架构高度依赖训练集的质量。精炼器是靠检索训练集中的相似示例来做判断的,如果训练集本身就缺乏与模糊片段相近的例子,精炼器就可能检索出"风马牛不相及"的参考,反而把分类带偏。 其次,CoT提示和语气定义虽然增强了可解释性,但并不能保证模型输出的事实准确性。在医疗健康场景中,如果一个错误观点碰巧和训练集中的某些模式一致,CRA框架也无法识别出这是虚假信息。论文明确承认,这套系统不是为了验证医学主张或检测错误信息而设计的。 第三,泛化能力尚未得到验证。目前所有实验都是在PUMA这一个数据集上完成的,模型只在英语环境、健康问答这一种任务类型上测试过。换到其他语言、其他医学科目、或者其他类型的用户生成内容上,效果如何还是未知数。 至于未来的方向,论文也给出了一些值得关注的想法。一是引入外部的医学知识库来做更深入的验证,让系统在分类之外还能对内容的准确性进行把关。二是做跨语言的适配,让CRA架构能服务不同语言的用户群体。三是探索更多模态的支持,毕竟在视频问诊、语音问诊越来越普及的今天,只处理纯文本可能不够用了。此外,多轮对话场景中的视角分类也是一个潜在的研究方向。 ![]()
封面 龙迷三问
下面是龙哥对于大家可能的一些问题的解答: 这篇论文到底在解决什么问题?乔治梅森大学提出CRA两阶段架构,先用分类器初判健康回复的视角类别,不确定时再利用检索增强的精炼器二次分类。在PerAnsSumm共享任务上,该方法排名前五,总体得分0.6090,有效提升宏F1和加权F1。 这篇工作最值得看的点是什么?o1-preview配合CRA+指令+语气定义取得最佳综合得分0.6090,在比例精确率(0.8406)和比例F1(0.7382)上显著优于其他配置;CRA方法相比单次提示方法在各项指标上均有提升;在PerAnsSumm共享任务中排名第二(前五名队伍中)。 这篇工作的边界或风险在哪里?优点:(1)两阶段架构设计合理,通过置信度触发机制有效控制计算开销;(2)RAG引入训练示例增强上下文理解,有效解决模糊分类问题;(3)系统比较了多种LLM和提示策略,实验全面;(4)错误分析详细,提供了可解释性。缺点:(1)依赖高质量标注数据作为检索库,训练集缺乏相似示例时精炼器效果受限;(2)仅在单一数据集和英语上验证,泛化性有待验证;(3)不验证医疗信息的事实正确性,存在传播错误信息的风险;(4)触发精炼器的样本数量较少(21/1039),改进幅度有限。 如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~ 龙哥点评
论文创新性分数:★★★★☆
提出一种两阶段分类器-精炼器架构(CRA),第一阶段用LLM进行片段分割和初始分类并输出置信度,第二阶段对低置信度样本通过检索增强生成(RAG)引入训练集中相似示例进行二次精炼分类,结合指令驱动分类、语气定义和思维链提示提升健康用户回复的视。实验合理度:★★★★☆
宏平均F1(C-MF1)、加权F1(C-WF1)、严格精确率/召回率/F1(S-P, S-R, S-F1)、比例精确率/召回率/F1(P-P, P-R, P-F1)以及综合得分(Overall)学术研究价值:★★★★☆
提出一种两阶段分类器-精炼器架构(CRA),第一阶段用LLM进行片段分割和初始分类并输出置信度,第二阶段对低置信度样本通过检索增强生成(RAG)引入训练集中相似示例进行二次精炼分类,结合指令驱动分类。稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。硬件需求及成本:★★★☆☆
未明确报告具体FLOPs;采用两阶段推理,仅对低置信度样本触发精炼器,相比始终运行两阶段的方法降低了计算开销;GPT-4o相比GPT-4 Turbo具有更高计算效率和更低成本。复现难度:★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。可能的问题:;(3)系统比较了多种LLM和提示策略,实验全面;(4)错误分析详细,提供了可解释性。缺点:(1)依赖高质量标注数据作为检索库,训练集缺乏相似示例时精炼器效果受限;(2)仅在单一数据集和英语上验证,泛化性有待验证;
主要参考文献
[1] Lee J, Pham L H, Uzuner Ö. MNLP at PerAnsSumm: A Classifier-Refiner Architecture for Improving the Classification of Consumer Health User Responses[C]//Proceedings of CL4Health@NAACL 2025. [2] Agarwal S, Akhtar M S, Yadav S. Overview of the PerAnsSumm 2025 Shared Task on Perspective-Aware Healthcare Answer Summarization[C]//Proceedings of CL4Health@NAACL 2025. [3] Naik G, Chandakacherla S, Yadav S, et al. No Perspective, No Perception!! Perspective-Aware Healthcare Answer Summarization[C]//Findings of ACL 2024. [4] Wei J, Wang X, Schuurmans D, et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models[C]//NeurIPS 2022. [5] Lewis P, Perez E, Piktus A, et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks[C]//NeurIPS 2020. [6] Wang W, Wei F, Dong L, et al. MiniLM: Deep Self-Attention Distillation for Task-Agnostic Compression of Pre-Trained Transformers[C]//NeurIPS 2020.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
![]()
健康问答分类难题多,看完这篇CRA还不过瘾?来群里继续聊!扫描下方二维码或添加龙哥助手微信号加群:kangjinlonghelper,记得备注:研究方向+地点+学校/公司+昵称。『龙哥读论文』微信群涵盖图像、大模型、自动驾驶、AI医疗等5大方向,等你来撩!
![]()
![]()
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!