MedEvidence Bench正式发布:以循证医学打造医疗AI可信评价新标尺

大众新闻·海报新闻    2026-09-05 14:21:34

大众网记者 季静静 刘睿 济南报道

9月5日,首届黄河医学人工智能大会在山东济南召开。会上,一项旨在为医疗人工智能树立可信评价“新标尺”的重要成果——医疗人工智能循证可信测评系统“MedEvidence Bench”(简称MEB)正式发布。

本次大会由山东省医学会主办,山东省医学会医学人工智能分会、山东健康医疗大数据管理中心承办,汇聚了国内医学AI领域的顶尖专家与行业代表,共同探讨人工智能赋能医疗卫生高质量发展的新路径。

MEB由国家超级计算济南中心联合山东健康医疗大数据管理中心、山东大学高等医学研究院、山东第一医科大学附属省立医院、山东大学齐鲁医院等高校、医疗机构及临床专家团队共同建设。

让AI的每一个判断,都有据可循

当前,以大模型为代表的生成式人工智能正加速进入医疗领域,应用从知识问答向辅助诊疗、医学影像等真实临床场景延伸。但随着医疗 AI 深度走向临床,一道行业难题摆在面前:如何科学评判模型的真实专业能力,厘清其适用范围与安全边界?

“医疗AI的评价,首先需要一套可靠的医学标准。”山东省医学会医学人工智能分会副主任委员、山东省计算中心(国家超级计算济南中心)主任吴晓明表示,MEB的破题方式,是把医学证据作为评判核心,将临床指南、专家共识、权威医学证据嵌入整套评价体系。具体操作上,由医学专家先确定考核重点,再对照临床指南和权威证据制定评分标准,同时明确每个判断的适用边界。模型作答后,不只判断答案对错,还要追溯其依据是否可靠、结论是否越界,践行“每一分,都有医学证据”的建设理念。

“1+4+N”体系,让评测不止于总分

围绕这一评价思路,MEB构建了“1+4+N”综合评价体系——以医学证据为基石,覆盖四项核心能力,持续向各类真实医疗场景延伸拓展。

据吴晓明介绍,这一设计的核心逻辑是把“医学证据”置于首要核心位置。而医学基础能力、临床推理能力、循证决策能力和安全可信能力,最终都需要有明确的医学标准来判断什么是对、什么是错、什么情况下成立。“把医学证据放在‘1’的位置,就是强调:无论评测哪一种能力,都要尽可能以指南、共识和权威证据作为评价依据。”

国产模型表现亮眼,医学专用大模型优势初显

目前,MEB已对首批国内外主流通用大模型和医学专用大模型开展评测。初步结果显示,国产大模型整体表现亮眼,在医学专业能力、临床推理和循证可信等方面展现出较强实力。

进一步分析发现,当评价从一般医学知识深入到临床推理、循证医学和安全可信等高阶能力后,不同类型模型之间的差异更加明显。“医学专用大模型在部分专业医学能力上展现出更加突出的优势。”吴晓明表示,“这说明针对性训练的价值正在显现。”

开放平台,服务全链条

MEB秉持开放平台、开放测评的原则,面向各类医疗机构、科研团队及AI开发者开放使用。据了解,平台后续还将持续拓展专家力量、临床场景,评测内容也会随指南更新和模型迭代动态调整。

“医疗AI要真正在临床落地,不能‘一测了之’,后续在真实场景中的表现需要持续跟踪和验证。”吴晓明表示,“MEB要做的,就是把医疗AI从‘能不能用’进一步转向‘什么场景能用、能力边界在哪、用了以后怎么持续管’——上线前有评价,使用中有边界,升级后有复测,全过程可追踪。”

据悉,作为山东省医疗人工智能服务平台的重要组成部分,MEB将面向模型研发机构支持能力诊断与模型优化,面向医疗机构探索AI选型、场景匹配与持续质量监测,面向行业治理建立与模型版本、医学证据、应用场景和风险等级相适应的动态评价机制。

未来,MEB将持续汇聚多方力量,迭代评测体系、拓展临床场景,推动医疗人工智能形成从研发、评测、应用到持续监测的完整服务链条,为医疗AI安全、规范、可信发展提供更加有力的技术支撑。

责任编辑:刘睿