2026年4月,Anthropic以约4亿美元收购成立仅八个月的AI制药初创Coefficient Bio;6月,发布Claude Science;9月,又确认自建实体湿实验室投入运营。2026年9月17日,诺和诺德与Orbis Medicines签下最高14亿美元合作,买的是一台“AI设计—自动合成—实验反馈”的闭环机器,以及它产出的、公开世界里根本不存在的实验数据。这两条新闻相隔不到半年,却指向同一个判断:这一轮AI制药,模型是易耗品,数据是燃料,而生产数据的地方——湿实验室,正在从成本中心变成资产负债表上的一项核心资产。
一、瓶颈大挪移:从“谁的模型强”到“谁的数据多”
过去几年,AI制药的叙事主线是模型和算法。AlphaFold把结构预测的边际成本压到几乎为零,生成模型每天能吐出百万个候选分子。但随着模型逐渐开源、算力逐渐普及,真正的壁垒开始向另一个方向转移。
“模型本身并非AI制药面临的最大壁垒。”腾讯健康首席架构师陈睿的判断颇具代表性。腾讯在深科实验室开展了大量蛋白质相关研究,不少模型已经开源。“我们把模型的权重开放,就是因为知道模型本身不是最大的壁垒。”在2026张江药谷大会的论坛上,多位专家将AI制药的壁垒指向了同一个词:数据。更准确地说,是高质量数据,以及让数据持续回流的闭环能力。
国元证券(香港)的研报将竞争要素排序概括为:数据>算法>算力。公开数据同质化下,自有湿实验闭环产生的专有数据——尤其是那些稀缺的失败负样本——才是核心护城河。
当前AI制药正受制于数据采集瓶颈,尤其是高质量、跨模态的配对数据匮乏。上海交通大学教授陈洛南指出,跨模态的配对数据对模型训练至关重要,但目前行业可获取的数据大多为单模态数据。晶泰控股(02228.HK)联合创始人赖力鹏则从另一角度印证了这一判断:当前公开单细胞数据规模已达十亿级,但对比互联网文本语料体量,生物学数据储备仍存在巨大缺口。
数据稀缺并非“量”的问题,而是质的挑战。力场采样创始人彭向达指出,生物分子的工作规律极为复杂,当模型面对未曾学习过的分子时,预测性能便会出现衰减,“而真实药物研发场景中,研究对象大多为全新分子”。这意味着AI制药缺的不是一般意义上的“大数据”,而是贴近真实药物研发过程的高质量、机制性数据。
二、湿实验资产化:不是所有实验室都算资产
这场瓶颈转移带来的最深刻变化,是实验室角色的重估。AI把分子设计的边际成本降到近乎为零,结果不是实验少了,而是进入验证管道的候选分子多了几个数量级。以前一个项目只有三五条分子值得做实验,现在每个项目都带着几百上千条排队等合成、等测活性。设计越便宜,验证越贵。
这正是英伟达和礼来共建实验室时把核心指标定为“两小时一轮迭代”的原因——干湿闭环的转速,而非干实验的单点速度,才是决定竞争力的关键。
在这一逻辑下,实验室的资产化需要满足三个判定标准。其一是通量:手工实验室的数据产量无法喂养模型,只有自动化、标准化的产线才产得出模型能消化的数据。其二是数据归属:替客户做项目,数据归客户,实验室只是产能;自建平台生产自有数据,数据才能沉淀为公司资产。其三是闭环:干实验和湿实验必须在同一个反馈循环里咬合运转。
英矽智能(03696.HK)与墨卓生物的合作是这一逻辑的典型案例。2026年9月7日,双方签署协议,墨卓生物规模化产出的多组学数据将持续汇入英矽智能Pharma.AI平台数据层,为其核心生成生物学平台PandaOmics及多智能体驱动虚拟衰老细胞平台(VAC)提供训练、验证与迭代支持,构建起“数据生产—模型优化—研发提效—新数据需求”的持续迭代闭环。英矽智能联合创始人对此的表述很直接:“AI的能力天花板归根结底由数据的质量与深度决定。”
三、数据资产入表:从制度破冰到价值释放
2026年被国家数据局确立为“数据资产价值释放年”。《数据产权登记工作指引(试行)》(国家数据局2026年7月印发,国数综政策〔2026〕35号)落地,《关于推进行业高质量数据集建设行动的实施方案》对接“人工智能+”战略,“数据二十条”即《中共中央 国务院关于构建数据基础制度更好发挥数据要素作用的意见》和《“数据要素×”三年行动计划(2024—2026年)》(国数政策〔2023〕11号)不断完善制度基础。
在医疗领域,数据资产化的实践已经迈出实质性步伐。江苏苏州张家港落地了全国首单数据知识产权“质押+保险+许可”全链条业务。登记的数据集为“AI驱动罕见病精准诊疗与药物研发决策支持数据集”,整合多模态医疗数据,精准匹配近800个全球病例,可助力罕见病新药研发周期显著缩短15%左右。通过数据知识产权登记确权,企业成功获得银行500万元融资,同时实现数据集授权许可给多家医疗机构使用。
这一模式之所以特别适合生物医药和人工智能领域,是因为它打通了数据知识产权从价值认定到转化运用、风险保障的全流程,构建起数据要素市场化配置的完整生态。
不过,数据资产入表仍处于早期探索阶段。实践中大量争议并非缘于法律制度缺失,而是因合同约定不清、研发成果管理不善或研发人员离职所引发的数据流失。委托研发中技术成果被擅自申请专利,核心研发人员离职后利用原单位数据继续开展研发,都可能导致企业多年积累的数据竞争优势迅速瓦解。
四、商业模式进化:从“卖工具”到“卖数据”再到MaaS
数据资产化正在重塑AI制药的商业模式。国元证券(香港)研报指出,产业链正从“卖工具”向“卖管线”迁移。而更深层的变化是,数据本身正在成为一种可定价、可交易、可授权的新型商品。
礼来TuneLab的联邦学习模式颇具代表性。该平台让生物技术公司使用礼来基于数十年研究数据训练的AI预测模型,作为交换,参与者贡献自己的数据来改进模型性能,同时保持专有数据的私密和安全。这种“模型换数据”的机制,本质上是在构建一个数据飞轮:参与者越多,模型越准;模型越准,吸引的参与者越多。
东阳光药(06887.HK)与晶泰控股(02228.HK)的合作则展示了另一种路径。双方以“算力支撑+数据开发+生态共享”模式共建AI超算平台,将数据资产和AI产品转化为“模型即服务”(MaaS,Model-as-a-Service)的商业模式,目标是实现“新药管线造血”与“技术底座变现”的双飞轮效应。
薛定谔(Schrodinger,Nasdaq:SDGR)则走了一条更为独特的道路。它利用自身技术平台孵化独立公司,一旦产出高质量候选药物,便吸引制药巨头高价收购。从武田以40亿美元收购Nimbus,到礼来以32亿美元收购Morphic,再到礼来以23亿美元收购Ajax——薛定谔连续三次从联合创办的公司获得巨额现金分配,最高一次为来自武田收购Nimbus交易的超过1.472亿美元。这种模式的核心在于,薛定谔输出的不是软件或服务,而是经过平台验证的、可被收购的管线资产。
五、泡沫与底层逻辑:哪些“卡位”是真资产,哪些只是叙事?
在数据资产化的热潮中,一个不容回避的问题是:估值逻辑是否跟上了商业逻辑?
英矽智能(03696.HK)2025年完成超1亿美元E轮融资,投后估值约13.31亿美元;2022至2024年收入累计增长185%。据其2025年度业绩报告,2025年全年收入约为5620万美元,较2024年的8580万美元有所回落,同期亏损由上年的1710万美元扩大至3.52亿美元。对AI制药企业而言,收入确认受合作里程碑影响,年度间存在波动。富瑞金融集团董事总经理崔翠在公开场合指出,“对AI制药企业来说,最难说的就是估值,而医药板块也是唯一一个一二级市场倒挂的板块”。
区分“真资产”与“叙事资产”的关键,在于数据是否满足三个条件:可验证、可复用、可形成闭环增益。一个自建自动化实验室如果只是替客户跑实验,数据归属客户,那它创造的是服务收入,而非资产。只有当数据在自有平台内持续回流、推动模型迭代、且模型迭代能反过来提升数据生产的效率时,飞轮才真正转动。
赖力鹏的判断值得重视:“随着模型预测结果越来越贴近真实生物反应,只有头部高质量数据集,才能够持续推动模型升级。”这意味着数据资产的壁垒不是静态的存量,而是动态的增益能力。拥有高质量数据的企业会持续拉大与追赶者的差距,而依赖公开数据的企业则面临价值递减的困境——公开数据集经反复挖掘后,其边际价值不断降低。
六、终局判断:数据主权与生态竞合
全球数据资源的分布极不均衡。美国国立卫生研究院、欧洲生物信息研究所等机构掌握着全球最大规模的生物医药公共数据资源。但中国正在凭借庞大的临床资源与患者数据基础,成为全球重要的药物临床研发市场,真实世界数据、疾病登记系统和专病队列持续积累。
竞争格局正在分化为三类核心玩家:以英矽智能、Recursion为代表的AI Biotech公司,以诺和诺德、礼来为代表的通过合作或自建融入AI的MNC药企,以及以10x Genomics、Illumina为代表的基础设施供应商。大模型公司如Anthropic和字节跳动的加入,正在改变力量对比——它们不满足于做工具提供方,而是试图直接掌握模型与实验之间的反馈闭环。
未来的竞争将围绕一个核心问题展开:谁能建立数据主权?这不仅是法律意义上的所有权,更是生态意义上的控制力。礼来的TuneLab、英矽智能的Pharma.AI平台、晶泰与东阳光药的合资引擎,本质上都是在构建数据生态的引力场——用平台能力吸引数据汇聚,用数据飞轮反哺平台价值。
据晶泰控股联合创始人赖力鹏在公开论坛上的预测,到2030年至2035年,生物学数据总量极有可能超越互联网训练数据。届时,那些今天就开始布局高质量数据资产的企业,将拥有定义下一代药物研发基础设施的权力。而卡位的窗口期,可能比想象中更短。
