
我的一位中学数学老师绰号叫“根号2”,因为他给每届学生都讲过√2是无理数这个结论是怎么推断出来的。这是“反证法”的经典例子:首先√2假设是有理数,那它就一定能被写成一个最简分数a/b。根据推导,我们可以证明a和b都必然是偶数,所以a/b是最简分数的原假设不成立,因此√2只能是无理数。这么多年后,我还清晰地记得当时听到后感到的震撼,像是在走廊里随便推开一扇通往储藏室的门,却突然看到了整个浩瀚的星空。
在临床试验的统计分析中,我们也运用反证法的逻辑框架:如果要证明药物A和安慰剂的疗效有显著差异,需要先建立一个相反的原假设(H0), 即A与安慰剂没有区别,然后收集数据,看看这两组数据的差异有多大概率是纯属巧合。如果这个概率非常小,比如说小于5%,那我们就可以说原假设多半不成立,而A与安慰剂之间的差异应该是真实存在的。
这个方法听起来挺别扭,但是很有效,因为证伪比证实容易多了。所有佐证最初假设的依据都有可能是完全出于偶然,但一旦举出反例,我们就没有解释和转圜的余地,必须推翻原有的假设。
但在现实里,药物开发的过程中,小到一位专家,大至整个公司,往往是千方百计试图证明自己的假设是正确的、分子是会比竞品更好的、未满足的临床需求是存在的、商业前景是光明的。
数学里我们需要证明假设完全不可能,量子物理中的标准是5σ,但在药物研发中,我们往往不能设计出完美的证伪试验(killer experiment)。即便这个试验的结果是负面的,在拿到数据之后,团队也总能有各式各样的解释,或是提出新的假设,从而继续推进项目。
不同的组织做重大决策时也有不同的考量方式:有的是在只有得到积极数据的情况下才继续开发,有的是默认一个分子的开发进程应该继续,直到产生负面数据而终止。前者逼着团队尽早证明项目的价值,但有可能把本来有希望的项目过早砍掉,而产生“假阴性”事件;而后者潜意识里鼓励项目团队尽可能把最重要的试验留到最后做,为“假阳性”付出的代价会较高。
我来举两个例子。
两家MNC都曾经用超过11亿美金的高价买了当时被视为Dupixent潜在接班人的分子。从战略和商业的角度不难想象,他们当时的目标产品画像(Target Product Profile)应该都是把“在特应性皮炎里比Dupixent疗效更好”作为最基本的假设。
NM26是一款IL4/IL31的双抗。强生把它买回来后,立即开展了一项三臂的II期试验,把双抗、安慰剂和Dupixent做头对头的比较[1]。2025年底,在买入一年之后,公司就宣布,根据中期分析结果,分子没达到事先设定的高标准(重点在于这个标准是在拿到数据之前就设定好的,而不是朝令夕改),所以终止开发[2]。强生完全没有给自己找台阶下,也没有抛出另一个假设,整篇新闻稿极其干脆利落。
今年七月底,赛诺菲宣布终止OX40L单抗amlitelimab在特应性皮炎上的开发[3]。但从收购到最终叫停,赛诺菲用了五年半。结局虽然不出乎意外,但整个过程却令人唏嘘。
赛诺菲决心全力推动amlitelimab的开发,是在2023年IIb试验结果公布之后。回头看看当时的数据,该产品疗效不如Dupixent的苗头已经很明显了。如果把amlitelimab的IIb期(STREAM-AD)[4]和Dupixent的III期(SOLO-1)[5]做个间接比较,我们可以看出SOLO-1中患者的病症基线更严重,而经过16周治疗后的效果反而更好(见下图)。如果单从这个FDA接受的主要终点来看,amlitelimab疗效不逊于Dupixent的可能性非常小。

来源|作者根据资料[4, 5]制作
另外,把amlitelimab的IIb和Dupixent的III期数据做比较,还需要考虑到向均值回归(regression to the mean)这个常见现象。打个比方,如果你摇骰子摇出了六个一,除非你是赌神,否则下一把很可能表现出真实的水平;同样道理,仲永他爸的教育方法也许没什么问题,而“泯然众人”才是正常现象。事实上,这两个分子都表现出向均值回归的趋势,IIb期数据比III期好不少。
赛诺菲高层2023年公开的说法[6]是:amlitelimab有成为同类最佳的潜力(潜台词是比不过Dupixent了,只能针对其它OX40/OX40L的分子), 给药方式更佳(方便患者当然是好事,但前提是疗效要好啊,要不然不治疗岂非更方便),而且强调IIb中IGA0/1的患者比例从16周的22.1%提高到了24周的44.5%(cherry picking, 是个典型的挑好听的说,报喜不报忧的案例)。
MNC研发人员的技术一般是过硬的。如果我根据公开的资料都能看出amlitelimab的效果差强人意,赛诺菲内部团队焉有不知之理?但是因为没有任何与Dupixent直接比较的数据,类似上述的推断都是基于间接比较,并不严谨。不同试验中患者基线、以往接受的治疗、终点的定义及安慰剂的效用都有可能影响最终的结论。所以最可能的情况是公司高层为了不承认买分子时押错了注,抱着“万一III期数据特别好呢”的一线希望,而调整了最初尽调时衡量这个分子的标准及假设(moving the goalposts), 硬着头皮继续开发,直到董事会都看出来了,然后项目终于被继任者叫停。
所以说,赛诺菲项目领导及公司高层犯的两个错误是:一没有尽早做证伪试验,不敢或是不愿意挑战自家的明星产品;二在数据不如Dupixent时,盲目乐观,自己给自己找借口。
我更赞同强生的策略,事先定好GO/NO GO的标准,然后根据证伪试验的数据做出客观判断,也佩服其及时止损的勇气。
也许有人要问,那辉瑞在开发IL4/IL13/TSLP的三抗tilrekimig中用的是哪种策略呢?这里我们要看两点:首先,II期是只和安慰剂比较的,没有把和Dupixent的差异化程度作为GO/NO GO决定的主要考虑[7];其次,III期的试验是把比安慰剂更好作为主要终点。三臂的设计则是出于侥幸心理,看见II期数据还不错,就加上现有的标准疗法,如果III期数据比Dupixent略好一点,在今后宣传的时候就可以大书特书[8]。作为试验申办方,辉瑞有太多办法让一种疗法的数据比另一种的略好一些,所以从这一系列举动看,它走的还是赛诺菲的路子。
辉瑞的CEO Albert Boula今年初在接受《财富》采访时说了一段话,大意是悲观主义者通常是正确的,但是大家更会追随乐观主义者,因为他们更有“远见卓识”(会画大饼)。鉴于药物研发极低的成功率,做我们这一行的,大都是乐观主义者;但是如果所有的人都盲目乐观,在开发中不断降低标准,修改原来的假设,不到万不得已不做killer experiment,最后大概率会摔得很惨。
真正睿智的领导者应该在相信自己观点正确的同时, 也承认自己有可能是错误的,从而主动寻求不同意见,鼓励别人挑战自己的看法——因为,任何事情都是不辩不明的,任何假设都是要经得起证伪试验的考量的。
资料来源:
[1]DUPLEX-AD https://clinicaltrials.gov/study/NCT06881251
[2]Johnson & Johnson Press Release December 26, 2025 https://www.jnj.com/media-center/press-releases/johnson-johnson-statement-on-the-phase-2b-duplex-ad-study
[3]Sanofi Press Release July 26 2026 https://www.sanofi.com/en/media-room/press-releases/2026/2026-07-24-05-30-00-3332696
[4]Weidiner et al. J Allergy Clin Immunol 2025 155(4):1264-1275.
[5]Simpson et al. N Eng J Med 2016;375: 2335-48.
[6]Sanofi Press Release October 13 2023 https://www.sanofi.com/en/media-room/press-releases/2023/2023-10-13-14-00-00-2760021
[7]NCT05995964 https://clinicaltrials.gov/study/NCT05995964#study-plan
[8]NCT07783425 https://clinicaltrials.gov/study/NCT07783425#study-plan
“马后炮”栏目文章回顾
免疫界新星Abivax:新靶点开发的控风险样本 | 药物研发三角定律(上)
MNC唯快不破,Biotech“四不像” | 药物研发三角定律(下)
知“错”就改的FDA,错了吗?
出师未捷,赛诺菲BTK抑制剂还能翻身吗?
从赛诺菲换帅看临床试验的成功率
Biotech卖的是什么?
从强生刚获批的口服多肽,看适应症选择的策略
Bicycle裁员近半,谁之过?
再谈临床试验的成功率(外一篇)
一家双抗公司的十年沉浮
编辑 | 陈小娟
xiaojuan.chen@PharmaDJ.com
编辑 | 姚嘉
yao.jia@PharmaDJ.com
访问研发客网站,深度报道和每日新闻抢鲜看