AI医生测评复盘:Claude Opus满分,豆包千问零分,以及循证之外还有人文
原文链接AI医生测评复盘:Claude Opus满分,豆包千问零分,以及循证之外还有人文
原文链接:https://mp.weixin.qq.com/s/0O9-hOTjA80IBdTsKzfVYw 作者:吕坤,公众号"稳定的坤"(山甲实验室) 发布时间:2026年5月31日
摘要
山甲实验室第三个月 AI 医疗测评,首次同时跑临床/技术/患者三个维度。患者端 15 款产品人人及格;医生端第一名 ChatGPT 5.5 Thinking 90 分,垫底豆包 2.0 和千问 3.5 零分。核心发现:垂直医疗模型被深度微调牺牲了通用模型的综合判断力和"留白"能力;Claude Opus 4.7 的共情力不是锦上添花,直接决定了医学建议的依从性。
测评规模
- 患者端 + 医生端各 15 款产品,每款 3 次采样,共 90 轮对话
- 技术量化:6 项指标、20 份变体病历、11 款产品、1320 个测试用例
- 测试病例:63 岁心内科首诊患者,胸闷不适 1 月余,冠心病/高血压/糖尿病病史
患者端发现:不出错只是底线,不是优势
患者端聚焦三方面——安全、责任、可执行。所有产品基本守住红线,得分差异不大。
但竺玉指出一个问题:量表测不出差异,恰恰说明真正拉开好坏的东西不在现有维度里。
多款垂直产品"科普化/论文化"严重——告诉患者"40% 可能是 A 病、50% 可能是 B 病",却始终不告诉他下一步该干什么。把"解释清楚"误当成了"帮上忙"。
Claude Opus 4.7 让人眼前一亮:不是说"立刻去医院",而是先说"我明白你现在很焦虑,但焦虑本身解决不了问题,最好的办法是去医院"——共情在前,循证在后。人文直接决定了医学建议的依从性。
医生端发现:通用模型反而更稳
安全红线触犯率
- Step1A(最直接错误,一票否决零分):24.44% 触犯——把患者说的"闷、不痛"写成"闷痛",或编造没做过的检查结果
- Step1B(高风险推理越界):93.33% 触发
根因:模型分不清三个层次——
| 层次 | 含义 | 模型的问题 |
|---|---|---|
| 事实层 | 患者亲口确认的 | ✅ 正确 |
| 推理层 | 医生可以合理推断的 | ❌ 悄悄写进事实层 |
| 待补充层 | 必须继续追问的 | ❌ 提前写成既定事实 |
"我还不知道"本身就是一条重要的临床信息,而垂直模型最不愿意承认这一点。
注意力机制的解释
俊杰的解释:模型的 Attention 是有限资源。当注意力大量分配给"让病历结构完整、字段不缺",留给"分清患者真说过和没说过"的注意力就被挤占了——一边填模板一边把患者没说的信息编造成事实补写进去。
保守回退率——Prompt 敏感性
用同一批病历,换成施压语气追问"你真的确定吗?",只有 Kimi 顶住拿满分,其余 10 款全部从满分掉到 50 分。
这叫Prompt 敏感性:同样的病例,换个追问口气结论就动摇——诊断没有定力。
OpenEvidence 的记忆能力
OpenEvidence 工作一轮后切换对话窗口,依然记得用户偏好——接近通用模型的 memory 机制。把极致的文献循证和"记住用户"结合了起来。推翻了"循证专业必须以上下文失忆为代价"的假设。
技术洞察
通用模型 vs 垂直模型
反直觉结论:在最需要专业的医生端,反而是通用模型更稳。
根因在微调(fine-tuning):垂直产品从通用模型微调而来,换来对指南的服从,代价是丢掉了通用模型靠海量数据"涌现"的综合性判断力。克制和留白,被深度微调最先丢掉。
少即是多
决定模型上限的从来不是数据量,而是数据质量。15% 经过专家标注的高质量样本,价值远大于 99.8% 未经处理的噪声。
未来方向
- 患者画像结构化:科室本身就能框定人群画像(心内科偏大龄焦虑,骨科偏年轻直奔症状)
- 仿真虚拟环境:把科室/认知程度/社会学背景设为变量,大规模造样本,突破真人医生采样瓶颈(类似 Cursor 早期范式)
- 患者端量表升级:把"语气、共情、自然度"变成一个真正能打分的维度
- 评分流程做成 Agent 工作流:临床医生复核前置到样本生成之前
三条最有价值的金句
"循证决定它对不对,人文决定患者听不听。"
"在医学里,'我还不知道'本身就是一条重要的临床信息,而这恰恰是垂直模型最不愿意承认的。"
"让 AI 看见病例不难,难的是让它理解病例背后那个具体的人。"