Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

RaDaR: a 32B reasoning LLM for rare disease diagnosis (randomized AI physician-assistance trial)

罕见病在全球影响数以百万计的人,但及时确诊一直是公共卫生难题——不是因为没有诊断手段,而是有能力识别这些病的专科医生太少,病人常常辗转多家医院、拖很久才被想到正确的方向。大模型被寄予厚望,但作者点出此前方案的三个现实障碍:临床上不好部署、缺乏扎根临床的证据、训练数据稀缺。RaDaR(Rare Disease navigatoR)就是冲着这三点来的。 它的第一个特点是"小而开源"。这是一个 320 亿参数(32B)的推理型 LLM,相对动辄几千亿参数的旗舰模型属于紧凑级别,作者把可部署性放在了显眼位置——参数小意味着医院或研究机构更可能在自己可控的环境里真正跑起来,而不是只能调远端 API。同时它是开源的,这对临床场景尤其重要,因为涉及病历数据的环节往往不允许把数据送出本地。 第二个特点是训练数据的来路。RaDaR 用了 49170 例公开的自由文本病例,加上 104666 例合成病例,并采用了"推理增强"的训练方式——也就是不只让模型学"输入症状、输出病名",而是让它学会中间的推理链路。作者在合成数据的消融实验里给出一个有意思的观察:以表型(phenotype)为锚的叙述化病例,对长尾罕见病提供了有用的训练信号,并且在他们测试的数据量范围内呈现单调的规模增长趋势——即合成数据越多、效果越好(注意这个结论限定在"测试范围内")。这部分解释了为什么一个 32B 的模型能在这个细分领域打出超规格的表现。 效果上,最直观的对比是它在公开基准和四家外部验证中心上,表现强于所有受测的开源模型,其中包括参数量是它二十倍的 6710 亿参数(671B)DeepSeek-R1。换句话说,在罕见病诊断这个垂直任务上,专门训练的小模型赢过了通用的大模型——这是垂域模型相对通用大模型的一个典型论据。 比基准分数更有说服力的是两组贴近临床的验证。一是回顾性队列:RaDaR 在 61.06% 的病例中,比病历里记录的临床怀疑时点更早把最终诊断排到了前面,对应平均约 1.87 个月的潜在提前量,相当于院内诊断间隔的 50.18%。对罕见病来说,提前近两个月可能就是少走很多弯路。二是随机对照的医生辅助试验:相比只用网络检索,有 RaDaR 辅助的医生,罕见病诊断准确率提高了 21.44 个百分点。随机对照加上"和现实基线(网络检索)比较"这两点,让这个提升比单纯刷榜更可信。 对从业者的意义分几类人看:做医疗 AI 落地的,这是一个把"可部署、开源、有临床证据"三件事凑齐的样本;做模型蒸馏/小模型的,它给了一个垂域小模型靠数据和推理训练超越大通用模型的案例;关心数据稀缺问题的,它的合成数据(尤其表型锚定叙述)方法和单调 scaling 观察值得参考。作者也强调 RaDaR 连同其开发与验证框架,本身就是一套在数据稀缺条件下做诊断 AI 的可复现框架。 诚实的保留:摘要给出的是结论性数字,具体到每个公开基准的分项成绩、四家验证中心各自的数据、随机试验的样本量与统计显著性等细节,本文素材未给出,需看原文正文。合成数据的"单调 scaling"也被作者限定在"测试的数据量范围内",不宜外推。此外这是 arXiv v1 预印本,尚未经同行评审,临床部署还需进一步的前瞻性验证。