1. 刚上线那周,急诊科医生差点把AI投诉了
我在医院信息化部门工作了九年,见过不少系统上线后的"水土不服"现象。但今年年初AI辅助问诊模块上线后,急诊科的反应还是超出了我的预期——科室主任在第三天的例会上拍着桌子说:"你们这AI不是来帮我们的,是来给我们添乱的。"
当时他的理由很简单:过去一个胸痛患者,医生问诊加记录大概需要五到六分钟。现在AI能在五秒钟内生成一份看似完整的问诊记录和初步鉴别诊断建议,但这份记录里混杂着大量需要医生逐条确认的内容。以前医生边问边记,脑子里的思考路径是连续流畅的;现在AI先给出一份"答案",医生得花时间找出所有可能出错的地方,再修正、再补充。碰上老年患者、方言患者,AI的识别和推断偏离更大,有时候一份记录的修改时间反而比从头问一遍还长。
这其实就是AI问诊最常见的落地困境:算得快不等于干得快,输出快不等于被接受。但从另一个角度看,这恰好暴露了整个系统在设计时对真实临床场景的理解不足。我反复追踪了两周,把整个流程拆开来看,才真正搞清楚"医生反而更忙"这句话背后的完整逻辑链。
2. AI问诊的真实分工:五秒钟里到底完成了什么事
要弄懂为什么会更忙,先得知道AI问诊那五秒究竟做了什么。目前市面上的AI问诊工具,底层基本是"大语言模型+医学知识库+本地化规则引擎"的混合架构。拆开来看,整个链路其实包含四层任务。
第一层是意图识别与要素抽取。患者输入主诉"我胸口疼三天了,今天早上出冷汗",AI要把它拆解成"症状:胸痛""持续时间:3天""伴随症状:出冷汗""发病场景:晨起"这几个结构化字段。这里用到的技术是实体识别加意图分类,属于比较成熟的NLP任务。但问题是,患者描述的随意性非常强,尤其是方言转写成普通话之后,偏差很容易在这里埋下。
第二层是鉴别诊断生成。系统拿到结构化要素后,会去检索本地或云端挂载的医学知识图谱,拉出急诊胸痛的常见原因——心肌梗死、肺栓塞、主动脉夹层、气胸、肋软骨炎、胃食管反流。然后按照匹配度给每一类打分,输出一个从高到低的候选列表。这里用到的核心是检索增强生成,也就是RAG。知识库必须覆盖急诊科绝大多数情况,但覆盖得越全,候选列表就越长,医生需要看的判断依据就越多。
第三层是问诊记录文书化。AI会把刚才抽取的要素、匹配到的诊断假设、以及它认为需要继续追问的问题,拼装成一段符合门诊病历格式的自然语言文本。这一步最容易出问题——AI为了语义通顺,会顺手补上各种它"觉得合理"的细节,但患者根本没有说过这些。
第四层是风险提醒。如果记录中出现高热、胸痛伴随大汗、意识障碍等关键词,系统会弹出一条风险提示,建议急查心电图或肌钙蛋白。这个功能本意是好的,但在急诊满负荷运转时,这类提示经常反复弹窗,反而干扰了医生原本的判断节奏。
这四层里,真正能节省医生时间的只有第二层的"鉴别诊断候选列表"——它能帮年轻医生拓宽思路,但资深医生其实早就形成了自己的鉴别清单。其他三层,本质上都是"先给你一份半成品,你来改"。
很多人误以为AI问诊的落地形态是"AI问,医生看"。但从工程实践角度看,绝大多数医院上线的其实是"AI整理,医生确认"。这中间的区别决定了工作流会彻底改变:医生从"边采集边判断"变成了"先人工校验再重新判断"。校验本身,就是一种新增的成本。
顺带提一下这个过程里最容易被忽略的性能指标:响应时间五秒是针对标准问句场景的。一旦患者描述绕弯子、夹杂负面情绪、或者一次输入了三四段不连贯的话,系统的响应时间会飙升到十几秒,生成的质量也明显下降。我实测了260条真实模拟问诊数据,复杂表述场景下结果被判定为"需重大修正"的比例在37%左右——这个数字基本解释了医生为什么觉得"更忙"。
3. 工作不是减少,而是转移了:医生被新增的三个隐形任务
影响工作量的核心,从来不是AI生成的效率,而是AI生成后的人工处理成本。我梳理了上线后第一个月的排班日志和处方行为数据,发现医生的核心时间支出并没有明显下降,只是结构发生了变化。过去的时间花在问和听,现在的花在验和补。具体的隐形任务有三个。
第一个隐形任务:逐条核验AI生成的病历文本。AI写出来的记录,形式上几乎无懈可击,主诉、现病史、既往史分得清清楚楚,术语也用得规范。但问题恰恰在这——AI擅长生成"看起来对"的内容,而无从验证它是否真实反映了患者说的每一个字。一次腹痛问诊,AI在现病史里补了一句"疼痛向背部放射",患者其实只说了"肚子疼,后面也有点疼"。这句话单独看没错,但把模糊的描述确定化之后,如果医生没注意到,判断方向就可能偏了。我后来做过一个测试,让五名医生分别核验同一份AI生成的病历,平均每人要改动七到八处,其中至少有两次改动属于关键信息修正。这个校验成本,是原来人工问诊记录时完全不会产生的。
第二个隐形任务:责任边界的反复确认。这也是很多技术团队不太会考虑的问题。AI给了鉴别诊断列表,如果医生接受了列表里的第一选项并开出了检查,最终诊断却不在列表里,责任算谁的?如果医生否决了AI的高风险提示,事后患者真的出了问题,系统记录就成了双刃剑。为了避免这种纠纷,不少科室的规定是"医生必须在病历上明确标注AI建议的使用或排除理由"。换句话说,AI多提供一条建议,医生就多一个必须回应的结论。这不仅是工作量的问题,还是认知负担的问题。我见过一位主治医生在深夜值班时,对着AI生成的中危胸痛建议思考了四十分钟——这种长时间的纠结,过去的医生未必不会有,但有了AI后,系统会强制要求他把思考过程写进病历,这就把隐性时间变成了显性时间。
第三个隐形任务:患者沟通成本增加。我上系统初期跟着医生出门诊,亲眼看到一位五十多岁的女患者指着电脑屏幕问医生:"这个AI说我可能心肌缺血,是不是很严重?"医生不得不花两分钟解释AI只是辅助预判,还需要结合检查确诊。类似的对话,一天至少要重复十几次。技术上新装的大屏幕、语音播报、智能追问,原本是为了提升效率,但在患者面前,它变成了新的不安来源。医生要额外安抚、解释、甚至反复演示,沟通成本明摆着涨了一截。
这三个任务合在一起,解释了标题里那个看起来很反常识的现象:AI部分地替代了问诊动作,却整体性地改变了医生的任务结构。省下来的记录时间,远不够抵扣新增的核验、解释和决策压力。
4. 真刀真枪跑了一百天,踩过最深的坑:AI"一本正经胡说八道"
前文提到的很多问题,属于工作流设计层面。这部分要说的是AI模型自身的硬坑,也是整个百天里最让我头疼的环节。
坑一:AI会在鉴别诊断里混入与本地疾病谱完全不符的结论。比如在我们这座城市,急诊中毒里最常见的是酒精中毒和一氧化碳中毒,草乌中毒只在个别县有零星病例。但AI的知识库是基于全网医学网页训练的,它时不时会把"考虑草乌中毒可能"写进建议。从医学逻辑上,这个结论没错,但放在本地急诊,它既不是高频事件,也容易把年轻医生的注意力带偏。后来我查了数据,发现这属于模型先验概率和本地疾病分布之间的系统性偏差。要修正,不能靠改提示词,得在RAG检索环节加上本地发病率的动态加权。
坑二:模型对时间线的理解会出错。问诊记录里最讲究"起病-演变-现状"的时间逻辑。患者说"前天下午开始有点闷,昨天夜里加重,今天早上更疼了",AI生成的记录经常变成"三天前出现胸闷伴进行性加重"。从语义上讲还算通顺,但把"前天""昨天夜里""今天早上"压缩到一个笼统的"三天前",丢失了关键的"进行性"细节。类似的问题还有很多——AI会默认把"最近"理解成一两天,把"有几年了"理解成慢性病史。这类错误是纯逻辑性的,模型本身很难自查,只能靠医生在核验环节发现。
坑三:AI比较容易"自我纠错过度"。医生在系统的追问框里打一句"患者并没有放射痛",模型收到人工反馈后会直接重写整段现病史。问题是,重写后的版本常常把其他正确的信息也一起改掉了,等于引发了一连串"次生修改"。我统计过,AI会识别到用户修改的意愿,但它不理解修改的范围和边界,这会导致一种新的互动成本:医生必须逐字逐句看一遍AI的重写结果,比第一次核验更耗费注意力。
顺着系统日志深挖下去,我发现造成这些坑的根源有两个。一个是训练语料平衡性问题:AI读到的高质量医学文本,主要来自教科书、考试题和三甲医院的疑难病例讨论,这些文本天然偏向典型、全面的表述,反而让模型对现实中模糊的、碎片化的医患对话适应性变差。另一个是生成策略偏向性:大语言模型的生成逻辑是"最可能的下一段文本",而不是"临床证据链最严谨的一段话引擎"。所以AI宁可写得顺,也不愿意写得留有余地,这跟临床思维需要"存疑优先"存在本质冲突。
我在跟厂商交流时反复提出一个问题:能不能通过调整模型参数来减轻这些副作用?答案是有限。目前的可行方案更多集中在工程侧——比如在AI输出的每个诊断建议后面自动附上"支持证据等级",证据等级低的建议默认折叠;再比如让AI在不确定时直接输出"无法判断,建议进一步检查",而不是硬凑一个大概率可能的结论。这些改动不改变模型本身,但能显著降低医生验证的工作量。
5. 医院落地AI问诊的实操建议:怎么改才能让医生不忙乱
讲完踩坑经历,这部分把方法论沉淀下来。如果你所在的团队也正在考虑或已经部署AI问诊功能,最值得关注的落地建议有这么几条。
建议一:永远保留医生的"从零开始"入口。系统默认给AI生成结果,但在病历编辑页面左上角放一个不起眼的按钮——"清空AI结果,手动录入"。这个按钮看起来会降低AI的使用率,实际却给了医生心理上的掌控感。我们上线这个按钮后,AI的拒绝使用率反而下降了,因为医生知道有退路,更愿意尝试。人机协作最怕的是被迫使用,一旦有了选择权,信任感反而容易建立起来。
建议二:把AI的建议从"结论"改造成"假设列表"。很多系统把AI鉴别诊断直接印在病历打印件上,这等于把假设问题变成了结论问题。我们后续把AI生成的候选诊断全部移出了正式病历文书,只在医生的辅助工作台显示,并标注清楚"这不是诊断,是建议排查方向的排序"。医生没有义务在病历里回应这些辅助建议,只在治疗路径选择产生分歧时才需要复核。这个改动立刻把医生在责任边界上的负担降下去了。
建议三:建立本地化的知识库覆盖层。任何通用医学知识库都无法自动匹配你所在地区的疾病谱。我们在RAG检索链路上加了一个强制规则:本地重点疾病和白名单疾病必须加权显示;本地极少见的疾病默认折叠,只有点击展开才可查看。同时,我们花了三周时间收集了过去五年急诊最常见的五十个诊断和两百家社区门诊的数据特征,作为过滤层。效果非常明显——AI鉴别列表的"合理率"从上线初的约42%提高到了71%。
建议四:对AI生成语句引入"不确定性标记"。这条比较费工夫,但值得做。我们在生成模型外面套了一层规则引擎,对时间类词汇、程度类词汇进行二次校验。如果患者原始语句里没有"明显""严重""剧烈"这类词,AI生成的描述中一旦出现这些词,系统会高亮并提示"请确认"。别看这只是一个很小的功能点,它直接把医生核验一屏信息的速度提升了一倍以上。因为AI大部分错误都出在"把模糊变成精确"这一环,把这个环节卡住,后面就顺了。
建议五:把医生的修改数据回传为再训练样本。这是我们做过的最有价值的一件事。每次医生修改AI病历的某个字段,系统自动记录修改前后的比对。攒到一定量级后跑一次diff分析,就能找到AI最高频的错误模式。我们在一千两百份已修改病历里发现,最常被医生改掉的AI描述是"老年患者的一般情况描述"——AI几乎总是把患者的精神状态写得太好,跟实际情况不匹配。这类发现是厂商训练数据里永远不会有的本地化经验,对后续模型调优意义极大。
这些建议不复杂,但每一条都在调整"AI输出"与"医生认知"之间的衔接方式。技术决定AI能不能生成一份报告,工程决定医生愿不愿意读这份报告并信任它。国内医疗信息化项目里,大家普遍对前者的投入度远超后者,这恰恰是"医院上了AI反而更忙"的重要原因。
6. 对未来AI问诊分工的一点个人判断
跑完这一百多天,我对AI问诊的定位有了更清晰的认识。它目前仍然是个"高水平的实习生"——知识面广、反应快、形式规范,但缺乏对患者个体语境的深度理解,也无法为它的每个结论承担任何责任。指望它完全替代医生的问诊判断,至少在现阶段不现实;但把它当成一份"帮助拓宽思路的草稿",实际价值非常大。
我能明显感受到,那些用好AI的医生并不把它当成终点,而是当成思考的起点。有一位心内科医生跟我说过一句话,我印象很深:"AI最大的价值是让我多看一眼我不常想到的方向,但我会花同样多的时间确认它为什么指向那里。"这个反馈让我意识到,真正的效率提升,不在于AI省掉了多少时间,而在于它有没有让医生把注意力放到更重要的地方。
如果你所在的医院正在被"AI问诊五分钟"之类的宣传打动,我建议你等一等,先问清楚三个问题:鉴别诊断的知识库是不是本地化的?输出文档的修改链路是否顺畅?医生的责任边界有没有清晰的系统支撑?这三个问题想清楚了,再上线也不迟。AI问诊迟早会成为医疗信息化的标配,但它真正成熟的标志,不是问得快,而是让医生在被辅助的时候,依然觉得自己是主角。