临床放射学杂志

北大核心,JST

国内刊号:42-1187/R

国际刊号:1001-9324

临床放射学杂志2026年第2期:医学专用大型语言模型在放射报告文本错误检测中的应用探索

发布日期:

作者:赵凯, 马吉权, 孙中琪, 姜昊, 赵洁, 董云娇, 李诗雅, 李倩, 刘相如, 姜慧杰

单位:150086 哈尔滨医科大学附属第二医院赵 凯、孙中琪、姜 昊、赵 洁、董云娇、李诗雅、李 倩、刘相如、姜慧杰;150080 哈尔滨,黑龙江大学计算机科学技术学院马吉权

关键词:大型语言模型,放射报告,报告审核

基金:本研究系黑龙江省自然科学基金项目(编号:ZD2022H003、PL2024H127):黑龙江省博后课题项目(编号:LBH-Z23225)

<b>目的</b> 评估医学专用大型语言模型(LLM)在检测放射报告文本错误检测方面的效能。<b>方法</b> 回顾性搜集2024年12月至2025年1月200份标准的放射报告文本,随机抽取100份报告,由住院医师按照5种错误类别人工嵌入150处文本错误,并对其进行临床风险分级。医学专用LLM(MedGemma)、通用LLM(Qwen3)及三位不同年资的放射科医师模拟真实临床工作中的报告审核流程,在限定的2 h内审阅全部报告。以错误检出率和F1值作为主要评价指标,采用<em>Wald</em> &#x003c7;&#x000b2;方法比较不同模型与放射科医师在文本错误检测中的性能,并使用<em>Wilson</em>方法计算95%置信区间(CI)。审阅效率以平均阅读时间衡量,采用配对样本<em>t</em>检验分析组间差异,应用<em>Cohen's d</em>计算效应量以衡量差异的实际意义。<b>结果</b> 医学专用LLM(MedGemma)的错误检出率为91.33%(95%CI:85.74%~94.87%),与副主任医师检测结果[92.00%(95%CI:86.54%~95.36%)]相当(<em>P</em>=0.83),优于主治医师的80.67%(95%CI:73.61%~86.19%)、住院医师的76.67%(95%CI:69.28%~82.72%)及Qwen3的84.67%(95%CI:78.04%~89.56%),且在高危错误检出中表现优异[92.7%(95%CI:80.6%~97.5%)]。此外,MedGemma平均阅读时间为(17.54&#x000b1;3.47)s,审阅效率高于医师及Qwen3模型(<em>P</em>&#x0003C;0.001),<em>Cohen's d</em>值范围|1.33~2.40|。<b>结论</b> 医学专用LLM(MedGemma)在放射报告文本纠错中表现出高检出率、良好的高危错误识别能力及显著时间效率优势,具有作为临床辅助检测工具的潜力。

来源:2026年第2期

《临床放射学》期刊编辑部

查看临床放射学杂志2026年第2期

联系我们

  • 地址:湖北省黄石市下陆区广会路10号黄石广电大楼三楼
  • 电话:0714-6222015
  • E-mail:lcfsxzzsbjb@163.com

咨询工作人员