🔧 AI 知识库

AI医生测评复盘:Claude Opus满分,豆包千问零分,以及循证之外还有人文

原文链接

AI医生测评复盘:Claude Opus满分,豆包千问零分,以及循证之外还有人文

原文链接:https://mp.weixin.qq.com/s/0O9-hOTjA80IBdTsKzfVYw 作者:吕坤,公众号"稳定的坤"(山甲实验室) 发布时间:2026年5月31日

摘要

山甲实验室第三个月 AI 医疗测评,首次同时跑临床/技术/患者三个维度。患者端 15 款产品人人及格;医生端第一名 ChatGPT 5.5 Thinking 90 分,垫底豆包 2.0 和千问 3.5 零分。核心发现:垂直医疗模型被深度微调牺牲了通用模型的综合判断力和"留白"能力;Claude Opus 4.7 的共情力不是锦上添花,直接决定了医学建议的依从性。

测评规模

  • 患者端 + 医生端各 15 款产品,每款 3 次采样,共 90 轮对话
  • 技术量化:6 项指标、20 份变体病历、11 款产品、1320 个测试用例
  • 测试病例:63 岁心内科首诊患者,胸闷不适 1 月余,冠心病/高血压/糖尿病病史

患者端发现:不出错只是底线,不是优势

患者端聚焦三方面——安全、责任、可执行。所有产品基本守住红线,得分差异不大。

但竺玉指出一个问题:量表测不出差异,恰恰说明真正拉开好坏的东西不在现有维度里。

多款垂直产品"科普化/论文化"严重——告诉患者"40% 可能是 A 病、50% 可能是 B 病",却始终不告诉他下一步该干什么。把"解释清楚"误当成了"帮上忙"。

Claude Opus 4.7 让人眼前一亮:不是说"立刻去医院",而是先说"我明白你现在很焦虑,但焦虑本身解决不了问题,最好的办法是去医院"——共情在前,循证在后。人文直接决定了医学建议的依从性

医生端发现:通用模型反而更稳

安全红线触犯率

  • Step1A(最直接错误,一票否决零分):24.44% 触犯——把患者说的"闷、不痛"写成"闷痛",或编造没做过的检查结果
  • Step1B(高风险推理越界):93.33% 触发

根因:模型分不清三个层次——

层次含义模型的问题
事实层患者亲口确认的✅ 正确
推理层医生可以合理推断的❌ 悄悄写进事实层
待补充层必须继续追问的❌ 提前写成既定事实

"我还不知道"本身就是一条重要的临床信息,而垂直模型最不愿意承认这一点。

注意力机制的解释

俊杰的解释:模型的 Attention 是有限资源。当注意力大量分配给"让病历结构完整、字段不缺",留给"分清患者真说过和没说过"的注意力就被挤占了——一边填模板一边把患者没说的信息编造成事实补写进去。

保守回退率——Prompt 敏感性

用同一批病历,换成施压语气追问"你真的确定吗?",只有 Kimi 顶住拿满分,其余 10 款全部从满分掉到 50 分

这叫Prompt 敏感性:同样的病例,换个追问口气结论就动摇——诊断没有定力。

OpenEvidence 的记忆能力

OpenEvidence 工作一轮后切换对话窗口,依然记得用户偏好——接近通用模型的 memory 机制。把极致的文献循证和"记住用户"结合了起来。推翻了"循证专业必须以上下文失忆为代价"的假设。

技术洞察

通用模型 vs 垂直模型

反直觉结论:在最需要专业的医生端,反而是通用模型更稳

根因在微调(fine-tuning):垂直产品从通用模型微调而来,换来对指南的服从,代价是丢掉了通用模型靠海量数据"涌现"的综合性判断力。克制和留白,被深度微调最先丢掉。

少即是多

决定模型上限的从来不是数据量,而是数据质量。15% 经过专家标注的高质量样本,价值远大于 99.8% 未经处理的噪声。

未来方向

  1. 患者画像结构化:科室本身就能框定人群画像(心内科偏大龄焦虑,骨科偏年轻直奔症状)
  2. 仿真虚拟环境:把科室/认知程度/社会学背景设为变量,大规模造样本,突破真人医生采样瓶颈(类似 Cursor 早期范式)
  3. 患者端量表升级:把"语气、共情、自然度"变成一个真正能打分的维度
  4. 评分流程做成 Agent 工作流:临床医生复核前置到样本生成之前

三条最有价值的金句

"循证决定它对不对,人文决定患者听不听。"

"在医学里,'我还不知道'本身就是一条重要的临床信息,而这恰恰是垂直模型最不愿意承认的。"

"让 AI 看见病例不难,难的是让它理解病例背后那个具体的人。"