多智能体诊断系统:重塑医疗大模型的性能边界!
现有多数医疗智能体的性能提升常被简单归因为提示词工程,但一项针对医疗大模型评估与智能体架构的研究提出了不同解释。该研究提出"多智能体诊断智能系统"(MDIA),依靠非微调的基础大模型,通过七层有向无环图的智能体编排架构,在OpenAI"健康基准专业版"上完成完整评测,揭示底层编排引擎与系统架构对医疗任务性能的巨大影响。健康基准专业版包含525条来自真实临床医师对话的评测样例,覆盖21个医学专科,其中22%为多轮接续提问,是当前权威的临床大模型评测数据集。
MDIA的七层节点分别为接收编排器、专科分类路由、三个专科推理智能体(消化、眼科、神经科)、通用推理智能体、输出合成器与最终校验器。接收编排器集成14套医学工具,包含文献检索、药品安全校验、ICD10编码等;路由模块识别病例所属专科并分发至对应专科推理节点,专科节点内置专科锚点临床指南与评分标准;最后由合成器整合输出,校验器完成安全性与格式复核。研究没有为全部20余个专科均设置独立智能体,仅选取增益最高的三个专科分支,避免分支过多带来收益递减问题。
研究发现评测框架本身会显著改变最终得分:传统评测仅传入用户最后一轮提问,会丢失历史上下文。将模式切换为完整多轮上下文传递后,整体分数直接提升约6个百分点,这说明大量医疗智能体的公开得分被低估,文章呼吁后续公开报告必须明确披露对话扁平化处理策略。系统还引入药物安全门控机制,针对药物患者状态禁忌做检查,同时设置豁免逻辑,避免在学术讨论类问题中过度拒绝回答;做站点过滤检索,限定检索来源为PubMed、NICE等权威医学站点,过滤论坛、商业推广类噪声内容;在合成器增加长度感知约束,把输出控制在2000至3000字符,在保留全部临床关键信息的前提下,降低基准的长度惩罚扣分。同时修复引擎底层缺陷,包括JSON代码围栏清理、空输出重试、模型访问地址重载、推理过程留存等,把空回复率从3.8%下降至0.2%,消除基础设施不稳定带来的分数波动。
验证以GPT-5.4作为评判器,MDIA v1.0.53取得0.6272的得分,较GPT-5.4单智能体基线提升14.62个百分点,较医师撰写回答基线提升19.02个百分点,较ChatGPT-临床医生版高出3.72个百分点,但该差值处于自举法标准差范围内,仅作为方向性结论。当更换Gemini2.5Pro作为评判模型时,模型得分变为0.6585,证明评判大模型本身会带来显著结果差异,单一评判器不足以完成可靠评估,应当采用多评判器联合评测。
作者表示,未来工作将引入检索增强生成,接入临床指南知识库,弥补知识短板;测试更多推理基座;建立闭环提示迭代工具;呼吁行业公开样例、评判转录文本,实现跨系统复现比对。本文核心启示在于:医疗智能体能力不只取决于基础大模型,编排架构、评测工具、引擎鲁棒性对最终表现影响巨大,不能单纯依靠提示词调优,为后续临床多智能体系统开发与基准评测提供重要参考。热门微博 医学新闻 ai医疗 哈勃观察员


