国内刊号:42-1187/R
国际刊号:1001-9324
发布日期:
作者:赵凯, 马吉权, 孙中琪, 姜昊, 赵洁, 董云娇, 李诗雅, 李倩, 刘相如, 姜慧杰
单位:150086 哈尔滨医科大学附属第二医院赵 凯、孙中琪、姜 昊、赵 洁、董云娇、李诗雅、李 倩、刘相如、姜慧杰;150080 哈尔滨,黑龙江大学计算机科学技术学院马吉权
关键词:大型语言模型,放射报告,报告审核
基金:本研究系黑龙江省自然科学基金项目(编号:ZD2022H003、PL2024H127):黑龙江省博后课题项目(编号:LBH-Z23225)
<b>目的</b> 评估医学专用大型语言模型(LLM)在检测放射报告文本错误检测方面的效能。<b>方法</b> 回顾性搜集2024年12月至2025年1月200份标准的放射报告文本,随机抽取100份报告,由住院医师按照5种错误类别人工嵌入150处文本错误,并对其进行临床风险分级。医学专用LLM(MedGemma)、通用LLM(Qwen3)及三位不同年资的放射科医师模拟真实临床工作中的报告审核流程,在限定的2 h内审阅全部报告。以错误检出率和F1值作为主要评价指标,采用<em>Wald</em> χ²方法比较不同模型与放射科医师在文本错误检测中的性能,并使用<em>Wilson</em>方法计算95%置信区间(CI)。审阅效率以平均阅读时间衡量,采用配对样本<em>t</em>检验分析组间差异,应用<em>Cohen's d</em>计算效应量以衡量差异的实际意义。<b>结果</b> 医学专用LLM(MedGemma)的错误检出率为91.33%(95%CI:85.74%~94.87%),与副主任医师检测结果[92.00%(95%CI:86.54%~95.36%)]相当(<em>P</em>=0.83),优于主治医师的80.67%(95%CI:73.61%~86.19%)、住院医师的76.67%(95%CI:69.28%~82.72%)及Qwen3的84.67%(95%CI:78.04%~89.56%),且在高危错误检出中表现优异[92.7%(95%CI:80.6%~97.5%)]。此外,MedGemma平均阅读时间为(17.54±3.47)s,审阅效率高于医师及Qwen3模型(<em>P</em><0.001),<em>Cohen's d</em>值范围|1.33~2.40|。<b>结论</b> 医学专用LLM(MedGemma)在放射报告文本纠错中表现出高检出率、良好的高危错误识别能力及显著时间效率优势,具有作为临床辅助检测工具的潜力。
来源:2026年第2期
《临床放射学》期刊编辑部