推广 热搜: 采购方式  滤芯  带式称重给煤机  甲带  气动隔膜泵  减速机型号  无级变速机  链式给煤机  履带  减速机 

子瞻生物发布《技术白皮书》——Disease Cellular Data Stack for AI-Native Drug Discovery

   日期:2026-08-12 11:53:32     来源:网络整理    作者:本站编辑    评论:0    
子瞻生物发布《技术白皮书》——Disease Cellular Data Stack for AI-Native Drug Discovery

子瞻生物——Disease Cellular Data Stack

第一章 执行摘要(Executive Summary)

2024年诺贝尔化学奖同时授予AlphaFold与蛋白质设计研究,将AI与生物学的融合推向叙事高点。此后,AIDD(AI Drug Discovery)行业被一套数字点燃了亢奋情绪:AI发现的分子,Phase I临床成功率高达80%至90%,远高于传统药物的40%至65%。但这个真实的数字也构成了一个精心设计的认知陷阱——它证明的只是AI在"化学可成药性"(Chemical Druggability)上的系统性优势,这恰恰是生成式AI在已知化学数据分布内做高维搜索与优化的强项。

一旦进入代表"真实疗效与靶点因果性"的Phase II,AI发现分子的成功率约为40%,与传统药物历史均值(约37%)在统计学上无显著差异。截至2026年初,超过170个进入临床阶段的AI发现分子中,没有一款获得FDA最终上市批准。这就是"令人不安的对称":AI把Phase I的天花板顶上去了,Phase II的地板却丝毫未动。

【图表1.1】数据规模与疾病生物学覆盖的认识论断层

图表1.1|数据规模丰裕 ≠ 疾病生物学覆盖——认识论断层

【图表1.2】AI制药 Phase I / Phase II 成功率与结局对比

图表1.2|AI制药 Phase I / Phase II 成功率与结局对比
维度
AI发现分子
传统药物历史均值
Phase I 成功率
80%–90%
40%–65%
Phase II 成功率
约40%
约37%(无统计学显著差异)
已获批AI原研分子数量
0/170+
—
唯一Phase IIa显效AI设计小分子
Insilico Medicine rentosertib(ISM001-055,特发性肺纤维化)
—

这一诊断指向唯一的病灶:AI解决了问题的化学层面,却对生物学层面无能为力——disease-to-mechanism这一环节,仍然缺乏能够支撑机制判断的Decision-ready细胞数据。真正稀缺的不是"更多数据",而是同时具备明确Biological Context、Metadata & Provenance、Multimodality、Perturbational/Causal Information,并能以Industrial-Grade方式持续生产的细胞生物学数据——本白皮书称之为Disease Cellular Data Stack。

子瞻生物(BIOCAST)的解法是:提出并工业化生产这一Stack,以Drug-seq × Cell Painting × CIVMs为"黄金三角"资产组合,在明确的CoU(Context of Use)与FfP(Fit for Purpose)框架下,构建AI-ready的Human Ground Truth Data Layer。这一数据层同时服务三个场景:为药企内部研发决策提供Go/No-Go的高置信依据,为AI模型训练提供不可替代的"黄金样本",为监管申报提供可追溯、可验证、人类相关的证据底座。药物研发的下一个十年,胜负不取决于算法,而取决于谁掌握了疾病生物学的"真值"。

第二章 行业断点:为什么"更多数据"仍不够?

2.1 数据丰裕时代的悖论:规模膨胀 vs. Disease-to-Mechanism 停滞

过去十五年,单细胞组学、空间转录组学、高内涵成像(Cell Painting)与CRISPR screening等技术平台的普及,使实验室每天产生的数据量早已超出人工逐条审视的规模。Cell Painting技术通过六种荧光染料标记细胞八大细胞器与结构组分,一次成像即可提取约1500个形态学特征;Broad Institute建立的Cell Painting Gallery已成为业界最大的开放形态学图像资源之一,当前最大规模的细胞图谱已覆盖数亿个细胞。

然而这种规模膨胀并未同步转化为临床转化效果。药物发现可以拆解为三个环节:disease-to-mechanism(识别改变疾病进程的生物学机制)、mechanism-to-drug(设计实现该机制的分子)、drug-to-patient(临床开发中筛选合适患者)。过去十年AI投入的绝大部分精力落在了第二个环节——如AlphaFold式的蛋白结构预测与分子设计工具的爆发式发展,但对第一个环节几乎没有实质突破。超过90%进入临床试验的药物最终失败,绝大多数不是分子设计出了问题,而是这个分子瞄准的机制本身就是错的。

更值得警惕的是行业资源配置的扭曲:目前38个靶点各自拥有超过50个在研项目,而每年推进的新靶点数量却从2015年的约100个下降到2024年的约30个——这种collapse反映的正是disease-to-mechanism层面机制发现能力的停滞,而非分子设计能力的不足。

2.2 临床失败的死因解剖:疗效与安全,而非速度

【图表2.1】药物临床失败四大死因分布与决定层级对照

图表2.1|药物临床失败四大死因分布与决定层级对照
死因类别
占比区间
底层逻辑归因
是否与分子生成速度相关
缺乏临床疗效(Lack of Efficacy)
40%–50%
靶点选错,缺乏因果决定性
否——生物学认知问题
不可接受的毒性(Unmanageable Toxicity)
约30%
分子在人体内系统性危害未被预见
否——生物学认知问题
PK/生物利用度问题
10%–15%
化学层面缺陷
部分相关——化学优化问题
战略/商业原因
5%–10%
非科学因素
无关

疗效不足与安全问题合计超过80%的临床失败,其共同逻辑是"靶点选错了,或者分子在人体内的系统性危害没有被预见到"——这两件事与分子生成的速度和数量完全没有因果关系。"18个月、数百万美元交付Pre-IND候选分子"这类叙事,只覆盖了整个研发时间线的20%–25%;临床试验、审评与商业化构成剩余75%以上,而这些阶段的时钟,AI尚无法拨动。速度不是财富,速度是放大器——它放大优势,也放大缺陷。

传统制药工业形成的"福特式流水线"组织逻辑,将研发过程解构为高度专业化的模块(靶点发现→苗头筛选→先导优化→ADMET评估→临床前安全性→临床试验),每个模块外包给专业CRO,通过合同和数据包在机构间单向传递。这套体系的代价是系统性的知识断层:每个CRO只负责自己节点上的数据生产,各节点之间只有静态数据的单向交付,没有跨节点的动态因果反馈。当AI被引入这套体系,它只是把"人工筛选分子"换成了"AI生成分子",整个外包拼接的逻辑、数据孤岛的结构、知识断层的格局一丁点儿都没有改变——最先进的导航系统,装进了车轮已经严重磨损的老爷车。

2.3 因果之梯:AI的两种能力,与它们各自的边界

理解Phase II停滞的关键,需要区分两类本质完全不同的AI能力。生成式AI(Generative AI)——以AlphaFold 3、RFdiffusion、ESM-3为代表——数学本质是高维概率密度的估计与采样,在已知数据分布内插值与外推能力极强,但它只能回答"什么样的分子存在",无法回答"这个分子为什么能治愈这种疾病"。推理AI(Reasoning AI)的核心机制是因果推断,回答"为什么"和"如果-那么"类问题。

Judea Pearl提出的"因果之梯"(Ladder of Causation)为这一区分提供了精确的数学语言:

【图表2.2】因果之梯三层级与AIDD能力匹配关系

图表2.2|因果之梯三层级与AIDD能力匹配关系
因果层级
核心问题
数学表示
对应AIDD任务
当前主导AI类型
第一层:关联(Association)
什么与什么相关联?
P(Y|X)
这个分子能结合靶标吗?
生成式AI(模式匹配)
第二层:干预(Intervention)
如果我做了X,Y会发生什么?
P(Y|do(X))
阻断这个靶标,疾病会被治愈吗?
推理AI(因果图/Causal GNN)
第三层:反事实(Counterfactuals)
如果当时做了不同选择,会怎样?
P(Yₓ | X', Y')
若患者存在代偿通路,药物仍有效吗?
尚无系统性AI解决方案

而后两层,正是Phase II失败的核心原因所在。BenevolentAI的BEN-2293案例是一个简洁的诊断性例证:AI通过知识图谱识别出pan-Trk抑制作为特应性皮炎的潜在治疗靶点,理论上成立,但当它作为局部用pan-Trk抑制剂进入Phase IIa时未能改善湿疹症状——事后分析指向人类免疫疾病中通路冗余性问题,多条并行的促炎信号通路使单一Trk通路阻断的效果被极大稀释,而这种冗余性在简化的体外测试体系中是完全透明的、看不见的。

2.4 串联系统的残酷数学:级联误差如何吞噬管线寿命

将药物开发全链条理解为一个串联决策系统,由五个关键判断层级组成:L1(分子设计准确性)→ L2(靶点生物学验证正确性)→ L3(作用机制推理精度)→ L4(人体相关细胞表型预测准确性)→ L5(临床转化与结局预测准确性)。系统整体的最终临床成功概率由各层级条件概率的乘积决定:

P(Clinical Success) = ∏i=15 P(Li | Prior Layers Correct)

这是串联系统的核心定律:整体性能由最薄弱的环节主导。即使L1的分子生成精度高达99%,整体管线成功率仍会被L3、L4的薄弱拖累至约6%;而若能将资源向L3、L4倾斜,整体成功率可提升至约32%,提高超过五倍。

【图表2.3】五层串联决策系统条件概率敏感度对比

图表2.3|五层串联决策系统条件概率敏感度对比
层级
情景A:当前行业现状(L3/L4薄弱)
情景B:理想AIDD模式(L3/L4强化)
说明
L1 分子设计准确性
99%
99%
已高度商品化(AlphaFold 3等开源)
L2 靶点生物学验证
约60%
约65%
受GWAS相关性陷阱制约:真正因果关系的蛋白-疾病基因对比例约0.5%,非临床研究假发现率约92.6%
L3 作用机制推理精度
薄弱(约35%)
强化(约75%)
全行业最大认知盲点,缺乏系统性因果干预数据
L4 人体表型预测准确性
薄弱(约35%)
强化(约75%)
受限于NAMs数据标准化不足
L5 临床转化预测准确性
约80%
约85%
inClinico类工具已有实践基础
整体成功率(乘积)≈6%≈32%提升超过5倍

(注:L2–L5中间值为满足端值约束(约6%与约32%)的示例性拆解,端值本身为原始论证结论。)

这一数学结论的战略含义极为直白:继续在L1层堆砌资本,是战略上的错配;真正决定管线命运的,是L3(机制推理)与L4(人体相关细胞表型)这两个此前被严重低估的薄弱环节——而这正是Disease Cellular Data Stack试图系统性填补的缺口,也是下一章要展开论证的核心命题。

第三章 什么数据对AI原生药物研发真正重要?——Disease Cellular Data Stack的定义与原则

3.1 核心判断:数据价值不由规模决定,而由覆盖决定

如果数据规模本身不是瓶颈,那么真正值得追问的问题是:我们缺的到底是"更多数据",还是"某一种特定类型的数据"?答案是一个明确的缺口——"The Data Chasm of Human Biology"。即便只考虑细胞生物学这一层级,可能的生物学状态空间已经极其庞大;当进一步考虑到药物本质上是一种"扰动"(perturbation),需要理解的不仅是生物学"如是"的状态,还包括它对干预的响应方式,这个空间会呈指数级膨胀。现有最大规模的细胞图谱,尽管已经覆盖数亿个细胞,相对于这个空间仍然"低了几个数量级"。更关键的是,直到最近,这些图谱几乎不包含因果性、扰动性的数据——而这恰恰是理解一个干预会在活体系统中产生什么效果所必需的测量。

这就引出本章的核心命题:数据的价值不应由其绝对规模(cell count、sample size)衡量,而应由它对特定疾病的Disease Biology Coverage——即对该疾病关键生物学状态、机制转换点与治疗响应模式的覆盖程度——来衡量。真正稀缺、真正具有决策价值的数据,是能够支撑disease-to-mechanism这一环节的Decision-ready Biological Data,系统化拆解后即为Disease Cellular Data Stack。

小分子化学空间理论上可能达到1060量级的化合物数,而当前所有可用数据集加起来也只能覆盖其中极小的一部分,且化学空间具有强烈的局部性——将同一个官能团添加到不同骨架上可能产生完全不同的效果。细胞生物学状态空间面临类似但更复杂的问题:基因(约2万个蛋白编码基因)、细胞类型(数百种)、疾病状态、环境暴露、时间动态、扰动类型、患者个体差异、检测模态等多个维度相互组合,构成的状态空间呈指数级增长的"组合爆炸"(combinatorial explosion),而现有数据采集能力的增长速度是线性甚至亚线性的。这正是数据规模的边际收益会在缺乏针对性设计的情况下迅速递减的根本原因——数据规模持续上升,但Disease Biology Coverage、Mechanistic Coverage与Decision Utility的增长曲线远比想象中平缓。

3.2 五层价值栈:为什么每一层都是AI训练的必要条件

【图表3.1】Disease Cellular Data Stack 五层价值模型架构

图表3.1|Disease Cellular Data Stack 五层价值模型架构

Layer 1|Biological Context——数据首先必须知道"它是谁"。任何一个细胞层面的测量,如果脱离了对其生物学背景的精确定义,其AI价值都会大幅折损。一个经典案例足以说明:同一款BCR-ABL抑制剂伊马替尼(imatinib),对Philadelphia染色体阳性的急性淋巴细胞白血病患者可能有效,而对由不同驱动突变引起的其他急性淋巴细胞白血病患者则完全无效。生物学数据的"高度条件性"(highly conditional)意味着,一个perturbation的结果会因基因背景、环境暴露、给药方式等数十甚至数百个变量的差异而截然不同——这种条件性并非无关紧要的噪声,而是决定数据能否被用于训练可靠模型的先决条件。这种缺乏理论机制将输入与输出连接起来的状态被称为"epistemic opacity"(认识论不透明):如果数据采集时未能系统记录细胞来源(原代细胞、hiPSC来源、细胞系)、基因型背景、疾病亚型、给药剂量与时间点等context信息,后续几乎不可能对其进行有意义的标签化,更遑论用于监督学习。

Layer 2|Metadata & Provenance——Data之外还有Data about Data。即便原始数据本身质量良好,如果缺乏充分的元数据与可追溯的实验来源信息,其可用性依然会大打折扣:是否获得了足够数量的患者样本?样本的尺寸与质量是否达标?临床与治疗史信息是否可用且准确?是否有合适的对照组用于分析?数据在呈现给分析者时往往"看起来"是干净的,但这种干净的外表往往掩盖了一段充满妥协与取舍的采集过程。在实验设计端,细胞系、剂量、时间点等参数的变异,以及生物学测试系统本身作为体内情况的"不完整代理"这一事实,意味着即便使用相同的assay类型,不同实验室、不同批次之间的数据也往往无法直接横向比较——这不是数据"存在与否"的问题,而是数据"是否可信、是否可追溯、是否可复现"的问题。

Layer 3|Multimodality——从"分子状态"走向"细胞表型"。单一模态数据永远无法充分约束生物学系统的条件性。组学数据(转录组、蛋白组)揭示分子层面的状态与机制线索,但无法直接反映这些分子变化在细胞功能与表型层面产生的下游后果;形态学数据(如Cell Painting)恰好填补这个空白——能以相对低成本、单细胞分辨率捕捉细胞对遗传或化学扰动的表型响应。通过对约30000个小分子化合物进行形态学谱分析,研究者可以在不依赖已知靶点信息的情况下,识别化合物的作用机制相似性,并将化合物或基因归类到功能通路中;Cell Painting指纹还能有效检测微管蛋白调节剂,即使这些化合物在结构上彼此完全不同——这类跨模态的关联能力,是单一组学数据无法提供的信息增量。然而现实中,大多数实验室或数据生产平台仍只针对单一读出进行系统性采集:如果多模态数据的采集从设计之初就没有被同步规划,后期试图"拼接"不同来源、不同批次的单模态数据集,几乎不可能还原出真实的生物学关联。

Layer 4|Perturbational/Causal——从Observation走向Intervention,这是Stack中最关键、也最稀缺的一层。现有的大规模细胞图谱"直到最近几乎不包含因果性、扰动性数据"——而药物本质上就是一种干预(intervention),因此理解"给定某个perturbation,细胞会如何响应"才是理解药物机制的核心问题,而不是单纯描述细胞在静息状态下"是什么样子"。近年来部分机构开始尝试构建"Virtual Cell"以弥补这一缺口,但即便是最大规模的努力,也只采样了可能扰动空间中极小的一部分,且几乎都局限在少数细胞系内进行;更重要的是,这类努力尚未解决"将细胞层面的生物学机制与人类临床结局关联起来"这另一半问题,因为大多数人类疾病是涉及多种细胞类型、时序性交互的系统级功能失调,需要难以规模化、往往需要活体系统才能获得的系统层面测量。这一层的本质,是将简单的"State → Observation"升级为"Perturbation → Molecular Response → Morphological Response → Functional Response → Disease-relevant Phenotype"的完整因果链条,其完整性直接决定了数据能否支撑真正意义上的机制假设检验,而非仅仅是相关性描述。

Layer 5|Industrial-Grade——不是"能做一次",而是"能够持续生产"。前四层描述的是单次实验或单个数据集应具备的属性,第五层关注的是生产能力本身的可持续性与可扩展性。一次性、手工调优的高质量实验固然有价值,但如果无法以标准化、可重复、可规模化的方式反复执行,其对AI模型训练的边际价值会迅速衰减——因为模型需要跨越足够数量的条件组合(基因型、扰动类型、时间点、剂量梯度)才能学到真正泛化的模式,而不是过拟合到某一批次的特异性噪声。数据生成本身不是瓶颈,将数据转化为可用于决策的知识才是瓶颈——工业化能力正是连接"生成数据"与"生成知识"之间的桥梁。没有标准化的采集协议、质控流程与批次校正方法论,再多的单次实验也无法沉淀为AI-ready的资产。

3.3 黄金三角:Drug-seq × Cell Painting × CIVMs 的四维覆盖

能够同时覆盖"扰动输入(Perturbation)—表型读出(Phenotypic Readout)—机制读出(Mechanistic Readout)—疾病语境(Disease Context)"四个维度的数据资产,恰好是Drug-seq、Cell Painting和CIVMs的组合——它们构成AIDD训练宇宙的"黄金三角",也是Disease Cellular Data Stack五层框架在具体实验技术层面的落地实现。

【图表3.2】黄金三角四维映射对照

图表3.2|黄金三角四维映射对照
数据类型
核心问题
技术细节
对应Stack维度贡献
Drug-seq(机制之因)
药物在基因层面"做了什么"?
诺华团队开发,384/1536孔板直接裂解细胞+条形码多重混合,单样测序成本约3美元,每样本产出覆盖10,000+基因的完整转录组指纹
机制读出:MoA聚类、脱靶效应识别、早期毒性信号(对应Layer 3/4)
Cell Painting(表型之果)
药物让细胞"长成了什么样"?
Broad Institute开发,5–6种荧光染料标记细胞核/线粒体/内质网/细胞骨架等结构,高内涵成像转化为1000+维形态学特征向量
表型读出:无偏置变异捕获、靶点反褶积、药物重定位(对应Layer 3)
CIVMs(人源之真)
人体语境下"真的如此"吗?
iPSC衍生疾病模型、3D类器官、器官芯片,直接在人类细胞/人源化组织重建疾病生物学
疾病语境:Human-relevant真值,弥合物种鸿沟(对应Layer 1/4)

三者可在同一孔板、同一批细胞上依次完成——表型图像之后直接裂解测序,形成"表型果×转录组因"的严格配对数据;当这套双模态数据运行在CIVMs的人源疾病模型上,因果链条便从细胞层面延伸至组织/器官生理层面,构成"机制→表型→转化生理"的完整闭环。结合CRISPR筛选与Cell Painting的联合分析,比传统方法多识别出2.5倍的功能基因关系,且不依赖任何先验假设——这正是黄金三角组合价值的直接实证。单独使用任何一类数据,都只是"单腿行走"。

这类数据的稀缺,不是技术太难,而是"做对"太难:工程门槛(约12%的数据标签错误就能封顶模型性能上限)、规模门槛(需要工业化自动化产线而非普通科研实验室)、时间门槛(人体细胞扰动-响应数据是真实实验的时间沉淀,资本可以复制设备但无法购买时间)三重叠加,构成了全球AIDD市场最难规模化、最具战略价值的稀缺资产。

3.4 数据为何结构性稀缺:四重根本成因

Disease Cellular Data Stack的稀缺,并非简单的"数据不足",而是四类根本性成因共同造成的结构性供给不足。

第一,历史数据的"目的漂移"(Purpose Drift)。当前生命科学中积累的大量历史数据,其原始生产目的从来不是为了训练AI模型。ICD等疾病分类编码最初为医疗账单管理设计,如今被直接挪用为AI模型的输出标签——这种目的漂移造成的后果是,现有标签体系捕捉的是历史行政或临床记录的便利性,而非真实的疾病生物学机制层级。大量化学与生物数据集是项目导向产生的副产品,普遍存在合成偏差、确认偏差、项目偏差与报告偏差等系统性偏差。一个可解释AI(XAI)案例极具警示意义:某个模型试图识别与"苦味"相关的化学特征,标记出的关键特征竟是糖环结构——这不是因果关系,而是因为天然产物往往同时具有糖基化修饰与苦味特征,数据集本身的偏差导致伪相关被误认为机制性发现。

第二,生物学的"高度条件性"(Biological Conditionality)。细胞色素P450(CYP)酶的表达水平差异会直接影响药物代谢速率,吸烟会诱导特定CYP同工酶表达从而影响其他药物代谢,饮食习惯改变肠道微生物组进而进一步改变药物响应——这些变量并非彼此独立,而是相互耦合、相互调节,即便是在高度受控条件下采集的数据,在经验上也可能表现出显著的不一致性。这种conditionality直接对应机器学习领域中的underspecification问题:现代ML pipeline普遍存在这样一种失效模式——训练流程可以产生多个在held-out测试集上表现同样出色的模型,但这些模型在部署环境中的行为可能截然不同。当生物学数据本身高度条件化、标签边界模糊时,这一问题会被进一步放大——训练流程甚至无法确定"正确"的决策边界应该是什么。量化研究进一步显示,决策工具输出与人类临床结局之间相关系数(predictive validity)每提升0.1个单位,对研发生产力的边际提升可能比将候选物筛选通量提升10倍更为显著——这意味着,如果基础数据的conditionality没有被恰当建模,单纯扩大数据规模或提升算法吞吐量的投资回报会远低于提升数据本身predictive validity的投资回报。

第三,"人类特异性"悖论(Human Specificity Paradox)。生物学过程在物种间的保守程度差异巨大:蛋白质折叠这样的过程接近物理学定律,高度保守,因此可以利用跨越数千个物种收集的序列数据训练模型;但脑功能与脑部疾病涉及数十种高度特化的细胞身份,对人类物种具有高度特异性——啮齿类动物不会得阿尔茨海默病,非人灵长类动物也无法完整复现渐冻症(ALS)的病理特征。这直接指向一个令人不安的悖论:目前进展最缓慢的疾病领域,恰恰是那些人类特异性程度最高的领域,而这些领域的数据也恰恰是最昂贵、最稀缺、伦理约束最强的——AI最需要发挥价值的地方,恰恰是数据基础设施最薄弱的地方。这正是NAMs(New Approach Methodologies)技术路线获得关注的根本原因之一。

第四,组织与激励机制的错配。制药企业、学术实验室与CRO之间的数据孤岛效应,使单一机构很难独立积累起覆盖某一疾病足够多状态、足够多扰动条件的完整数据集。数据生成往往被视为项目执行的副产品而非独立的战略资产,实验设计时鲜少考虑数据未来是否可被复用、是否可与其他模态整合。一个更深层的心理与组织因素是:很难说服科学家投入额外的工作,让自己当前项目的结果"看起来更差"——这种归因偏差进一步扭曲了行业对"什么才是真正稀缺的资源"的判断,大量资源被投入到模型迭代与算法优化上,而真正稀缺的、高质量的疾病特异性多模态数据生产能力却长期得不到与其重要性相匹配的投资。

3.5 从Data Collection到Data Engineering:范式转变的三个操作原则

打破这一结构性供给不足,需要在实验设计范式上做出根本转变。

原则一:End-to-Data,由终而始的实验设计。从"先收集数据,再看能回答什么问题"转向"先明确需要回答的临床决策问题,再倒推设计能够产生对应数据的实验"。这一"doing what should be done, even if this requires substantial data generation"的理念,操作化为一条完整链条:从Drug-development Decision(例如:该靶点在哪类患者亚群中最可能产生临床响应?)出发,逐层向下拆解为具体的Biological Question、适用的Disease Model、需要施加的Perturbation类型、匹配的Multimodal Readouts组合、完整的Metadata规范,以及严格的QC标准,最终产出真正"AI-ready"的数据集,并形成反馈闭环,将模型输出的新假设重新导入实验设计环节。只有当实验设计从一开始就明确了"这个数据要用来预测什么临床结局"这一目标,才有可能系统性地评估并提升数据与真实临床效用之间的相关性——反之,沿用"先做实验、再看数据能告诉我们什么"的传统范式,产出的数据集大概率会重复低预测有效性陷阱。

原则二:以疾病为组织单位,而非以技术平台为组织单位(Start with Disease, Not Technology)。当前行业中普遍存在"技术驱动"而非"科学拉动"现象——因为某项新测量技术变得可用,机构便投入资源大规模生产这类数据,而不是先明确某个特定疾病的关键未解决问题是什么,再选择最适合回答这个问题的技术组合。我们不需要构建一个覆盖所有生物学、所有疾病的universal causal model,而应针对经过审慎筛选的疾病集合,构建能够使该疾病生物学机制空间变得可导航(navigable)的targeted causal model。数据生产策略应从"疾病优先"的视角出发,系统性地识别该疾病在Disease Cellular Data Stack五个层次上各自存在哪些具体缺口,再针对性地设计实验去填补。

原则三:Annotation前置,成为实验设计本身的一部分,而非事后处理。对于复杂的生物学终点,往往缺乏一致同意的标签定义方式,而监督式AI模型的训练恰恰依赖于这些标签。如果annotation策略——"这个实验的输出应该用什么维度、什么粒度来打标签"——不是在实验设计阶段就被明确规定,后续任何试图"打标签"的努力都很可能只是在给一堆本身就模糊不清的数据贴上人为武断的分类,而非真实反映底层生物学机制的差异。这意味着annotation框架的设计应当与Perturbation Layer、Measurement Layer的设计同步进行,成为实验方案本身不可分割的一部分。

这三个原则共同指向一种升级后的生产架构——将疾病特异性多模态数据的生产,从"实验"升级为"工厂"(Disease Data Factory):一个从Disease Question出发,经过Model Layer(选择合适的细胞模型系统)、Perturbation Layer(系统化设计并执行扰动实验矩阵)、Measurement Layer(多模态并行读出),再到Metadata/QC/Annotation环节(将原始数据转化为结构化、可信、可追溯的AI-ready Data Asset),最终输入AI Model进行训练,产出New Biological Hypothesis并重新导入New Experiment的闭环系统。这套架构的关键创新点在于,Annotation与QC不再是数据生成之后的"后处理"步骤,而是被嵌入到整个生产流程的每一个环节中——这正是第四章将要展开的、子瞻生物据以构建其生产体系的核心方法论。

第四章 这些数据该如何生产?——从科学探索到工业化真值生产

4.1 生产范式转变:从"黑科技"到工业化产线

长期以来,NAMs(如器官芯片、3D微生理系统)被视为实验室里的"黑科技",工业化应用进程缓慢,原因是缺乏一套将Disease Data Factory的设计哲学真正落地为可重复生产流程的工程能力。这一局面正在被三方面因素共同改变:底层支持型技术的高度爆发(3D细胞培养、器官芯片、自动化移液工作站、高通量共聚焦成像系统)、传统动物模型在CGT、双特异性抗体、核酸药物、复杂CNS疾病领域的系统性失效,以及监管科学对CoU/FfP这套"翻译语言"的逐步成熟,使得工业化生产的数据能够被直接对接进入研发与合规决策链条。

4.2 干湿结合闭环:The Loop 的具体机制

【图表4.1】干湿实验室结合(Dry/Wet Lab Integration)闭环迭代

图表4.1|干湿实验室结合闭环迭代逻辑

湿实验室产生生物学真值,干实验室通过AI模型对数据进行特征提取和预测,随后预测结果迅速返回湿实验室进行验证和校准。这种"预测-验证-校准"的闭环不是简单的流程叠加,而是深度的逻辑融合——高壁垒来自这种循环的速度:每一次迭代都在校准AI标注精度,提升人类生理系统的拟合度。这种数据并非通过公开数据库抓取,而是通过自主受控的实验平台产生,这种"真值"属性让数据在AI训练中具备了极高的权重和稀缺性。

4.3 双轨工程:AI-Ready 与 ELSA-Ready 元数据规范

数据从原始生物图像到AI可直接吞吐的训练集,需要经过元数据标注、批次矫正、特征提取的工程化处理,最终形成符合行业标准的AI-ready训练资产。这一过程不仅需要满足算法效率的要求,更需要在伦理、法律、社会与审评层面完全合规、可审计、无黑箱——这一双轨标准同时体现为四类元数据的严密记录:

【图表4.2】AI-Ready 与 ELSA-Ready 双轨工程四维元数据记录规范

图表4.2|AI-Ready 与 ELSA-Ready 双轨工程四维元数据记录规范
元数据类型
具体内容
科学与审计价值
语义元数据
每张图像对应的细胞供体编号、批次、暴露时间点、药物剂量、荧光通道配置
支持模型的生物学可解释性与透明度,杜绝算法黑箱
来源元数据
细胞供体临床信息、实验剪切力/物理参数、设备序列号、操作者ID
满足数据处理管线的可追溯要求与合规审计
关系元数据
图像特征与生化流出液数据的时间对齐记录
支持多模态数据融合与多维度证据交叉检验
版本元数据
特征提取管线版本、数据清洗规则变更日志
确保证据的真实无篡改,满足对代码无错性的审查

这套多元数据体系符合国际FAIR原则(Findable, Accessible, Interoperable, Reusable),是整个AI证据链的地基。没有这层地基,后续的AI建模不过是精美的沙堆——数据无法跨项目复用,模型无法在审评时被独立核查。

4.4 质量控制:群体异质性覆盖与动态时空采样

"人体生物学相关性"这一核心维度,要求研究者论证细胞来源的代表性,包括供体数量和遗传背景的多样性。采用数十组不同独立人类供体来源的细胞,而非单一细胞系,能够捕获真实患者群体中的遗传机制异质性与易感性差异,直接增强从体外模型预测结论到临床受试人群的外推可信度。实验设计上,多剂量梯度精确描绘剂量-反应曲线与毒性触发阈值,多时间点动态采样对毒性动力学演进过程进行全程追踪,这对后续AI模型从时序数据中提取毒性轨迹至关重要。多模态数据采集通常覆盖两个维度:生化流出液分析(定量检测细胞损伤与炎症因子等关键生化指标)与高维活细胞成像(多时间点、多荧光通道的实时成像,捕获细胞形态学变化)。

4.5 证据整合方法论:WoE四维框架与七类NAMs平台定位

随着NAMs证据从同质动物实验体系转向多模型、多机制层级、多可信度的异构证据网络,研究者面对的核心问题从"如何获得证据"转变为"如何整合证据"。证据权重(Weight of Evidence, WoE)方法论正是连接NAMs数据与决策判断的核心科学语言——原创性的WoE四维评价框架,涵盖可靠性(Reliability)、相关性(Relevance)、机制深度(Mechanistic Plausibility)、监管适用性(Fitness for Purpose),为刻画不同NAMs平台在证据网络中的差异化定位提供了操作性工具。

【图表4.3】WoE四维评价框架与七类NAMs平台定位评估

图表4.3|WoE四维评价框架与七类NAMs平台定位评估
NAMs平台
可靠性
相关性
机制深度
适用性
定位说明
人源原代细胞
中
高
中
中
"人体相关性层"锚点证据之一
iPSC衍生细胞
中
高
中高
中
提供长时程暴露与代谢成熟度数据
类器官
中
高
高
中
弥合物种差异解释的关键节点
Organ-on-chip/MPS
中(标准化不足)
高
高
受限
相关性与机制深度突出,但跨实验室标准化仍待完善
多组学(转录/蛋白/代谢)
中高
中高
高(独特优势)
中低
唯一能直接连接分子事件与表型异常的证据类型
in silico/QSAR/AI
中高
低
低
中高
承担"先验风险排序"而非"确证性证据"角色
PBPK/QSP
高
高
低
高
连接机制证据与临床决策的"暴露桥接层"

这一框架揭示的关键规律是:NAMs证据在WoE中的价值并非孤立存在,而是通过跨层级协同共同构建证据网络的完整性——这可进一步归纳为三层协同模型:人体相关性层(该效应是否具有人体生物学基础?由iPSC衍生细胞、类器官、器官芯片提供"锚点证据")、机制解释层(该效应通过何种通路发生?由转录组/蛋白组/代谢组学、Cell Painting提供"通路证据")、暴露桥接层(该效应发生的暴露水平是否具有临床相关性?由PBPK/QSP模型提供"翻译证据"),辅以先验排序层(在缺乏实验数据时风险优先级如何排序?由QSAR/AI预测模型提供"先验证据")。这一协同逻辑,正是NAMs必须通过"网络加入"而非"单点替代"进入决策体系的核心命题的具体体现。


第五章 子瞻生物(BIOCAST)的解决方案(Solution)

5.1 战略定位:从NAM服务平台到"人类疾病数据层"生产引擎

子瞻生物(BIOCAST)的商业策略清晰而坚定:不仅是新途径方法学(NAMs)技术平台,更是面向AI原生药物研发的人类数据层(Human Data Layer / Human Ground Truth Data Layer)构建者。核心业务已从单纯的检测服务,转型为通过自动化实验设施大规模产生AI-ready数据的生产引擎——因为AI制药的上限不取决于算法的复杂度,而取决于训练数据的"人类生物学相关性"。

【图表5.1】BIOCAST"人类疾病数据层"生产引擎架构与生态赋能

图表5.1|BIOCAST"人类疾病数据层"生产引擎架构与生态赋能

5.2 核心能力

BIOCAST的所有真值数据产生,均基于针对特定应用场景(CoU)的NAMs生物实验检测方法。通过工业级湿实验室自动化矩阵,将基于人类细胞的3D微生理系统(MPS)、细胞全景成像与高内涵生物成像、多组学技术整合,随后利用经过AI深度改造的数据标注平台,将复杂的湿实验信号转化为结构化、标准化的真值数据资产。

对药企客户,基于具体CoU提供人源化验证方案,帮助解决CGT、ADC、双特异性抗体等人类特异性靶点药物面临的动物模型系统性失效风险;对AI合作伙伴,提供FfP级别的高保真数据,助力突破大模型在生物学领域的泛化瓶颈;对新方法学的推广,通过标准化、规模化的实验证明NAMs的有效性,推动这一评价体系的成熟。

5.3 全生命周期赋能

BIOCAST生产的数据层旨在解决研发全周期的确定性问题:药企内部决策层面,为候选药物(PCC)选择提供"Go/No-Go"的高置信度依据,减少临床阶段的灾难性失败;转化医学研究层面,通过人类真值数据填补从实验室到病人的预测空白;监管申报层面,为提供基于人类生理系统的科学证据,助力药企快速合规。

5.4 差异化优势:DaaS模式 vs. 传统CRO

传统"福特式流水线"组织逻辑下,每个研发模块外包给专业CRO,通过合同和数据包在机构间单向传递,代价是系统性的知识断层。子瞻生物代表的是一种根本不同的模式——Data-as-a-Service(DaaS)式的数据生产范式。

【图表5.2】三方跨界生态价值交换矩阵

图表5.2|三方跨界生态价值交换矩阵
合作对象
核心需求
BIOCAST提供的价值
AI大模型公司
突破"垃圾进、垃圾出"的数据瓶颈
高质量、大规模的人类疾病生物学真值数据,经过生物学标注的AI-ready"黄金样本"
药物研发公司(Pharma/Biotech)
解决动物模型失效带来的系统性研发风险
决策链条中的"外脑",协助完成高质量申报资料,参与内部决策优化管线组合
方法学生态参与方
推动新方法学的标准化与成熟度提升
作为技术平台,提供基于NAMs的标准化科学证据,协助建立评价标准

【图表5.3】传统外包CRO模式 vs. 子瞻DaaS-CRO模式全方位对比

图表5.3|传统外包CRO模式 vs. 子瞻DaaS-CRO模式全方位对比
对比维度
传统CRO模式
子瞻生物 DaaS-CRO 模式
数据来源
单点体外Assay、细胞系测试、动物模型
人源原代细胞/iPSC/器官芯片直接产生的多模态真值数据
交付形态
一次性检测报告,静态单向数据包
持续产出的Human Ground Truth Data Layer,具备产能属性
与AI的关系
数据生产与AI建模割裂,事后拼接
干湿结合闭环(The Loop),数据生产本身即为AI迭代的一部分
元数据标准
缺乏统一CoU/FfP界定,事后补充合规文档
AI-ready + ELSA-ready双轨标准从实验设计第一天内嵌
合规可复用性
格式不统一,跨项目难以复用
符合行业标准数据规范,可直接支撑申报文件撰写
商业本质
服务性收费,一次性交易
数据产能授权/持续性合作,类似"数据基础设施"订阅

正如子瞻生物核心壁垒所言:"这种数据并非通过公开数据库抓取,而是通过自主受控的实验平台产生"——不可复制的Ground Truth属性,让子瞻生物的数据在AI训练中具备了极高的权重和稀缺性,这正是DaaS-CRO模式区别于传统外包CRO的本质所在。


第六章 案例与实证

6.1 标杆案例:肺泡芯片+AI打通ADC药物申报的完整方法论闭环

本案例的价值不在于"拥有先进的肺泡芯片和AI算法",而在于整套方案从第一天起,就严格遵循第四章所述End-to-Data生产哲学——从一个具体的临床决策问题出发,逐层拆解为生物学问题、疾病模型、扰动矩阵、多模态读出与元数据规范,并在全程与监管机构保持同步沟通,最终在干湿实验室的闭环协作中完成从原始信号到合规证据的转化。以下按七个阶段还原这一完整方法论闭环。

阶段0|Drug-development Decision:明确要回答的临床决策问题。

一款在研抗体偶联药物(ADC,研发代号已模糊化处理为ZZXL001)需要推进首次人体临床试验(FIH)申报,团队面临的决策问题是:在人类临床拟用暴露量下,该药物靶向非肿瘤组织(肺泡上皮)的On-target Off-tumor效应,是否会引发免疫介导性间质性肺炎(ILD/Pneumonitis)?安全边际是多少?

阶段1|Biological Question:将决策问题转化为可验证的生物学假设。

团队将上述决策问题拆解为具体的生物学问题——"人类肺泡微环境中,该ADC能否激活T细胞穿越内皮屏障浸润肺泡上皮的免疫损伤路径,其剂量-反应关系与时间动力学特征如何?"这一转化的关键,是明确了需要观测的不是单一的细胞毒性终点,而是多细胞、动态互作过程中的因果链条——这正是Disease Cellular Data Stack Layer 4所要求的Perturbation→Molecular Response→Morphological Response→Functional Response的完整证据链。

阶段2|Disease Model:构建能够还原人类肺部复杂生理的疾病模型。

团队构建了肺泡芯片(Alveolar-on-a-Chip, AoC):通过微流控技术在指甲盖大小的透明芯片上重建多细胞、动态灌流的三维微环境——上皮侧种植人类小气道原代上皮细胞(HSAECs)模拟肺泡气腔,内皮侧通过微流控泵持续灌流含人外周血单核细胞(hPBMCs)的培养基模拟血管腔。模型选择本身即遵循"人体生物学相关性"要求:采用数十组不同独立人类供体来源的原代上皮细胞,而非单一细胞系,捕获真实患者群体中的遗传机制异质性与易感性差异。

阶段3|Perturbation:设计系统化的扰动矩阵。

团队设计了近10个不同的给药剂量梯度,精确描绘剂量-反应曲线和毒性触发阈值;同时采用多时间点的动态采样机制,对芯片上的毒性动力学演进过程进行全程追踪。数十组供体×近10个剂量梯度×多个动态时间点,构成了一个远超传统单点体外实验的条件组合矩阵。

阶段4|Multimodal Readouts:湿实验室执行多模态并行采集。

数据采集覆盖两个并行维度:生化流出液分析——定量检测LDH(细胞损伤)、IL-6、TNF-α、IFN-γ等约10种关键炎症与损伤生化指标;高维活细胞成像——使用双转盘共聚焦显微镜进行多时间点、多荧光通道的实时成像。由于采用了多批次、长时程的动态成像策略,这一实验矩阵最终积累了近百TB(超过80TB)的超大规模生物影像原始数据。经过标准化特征提取管线处理后,这批原始影像数据被压缩、量化为数百GB(超过400GB)的高维生物学特征值数据。原始影像与特征值数据之间约200倍的体量压缩比,本身即反映了"数据"到"AI-ready资产"之间存在的巨大工程化鸿沟。

阶段5|Metadata/QC/Annotation:标注策略在实验设计阶段即被冻结。

团队在肺泡芯片实验启动之前,就已完成两项关键的标注前置工作:第一,确定标注的维度与粒度——T细胞浸润程度分级、上皮屏障完整性指数、内皮活化评分、细胞形态学异常聚类标签;第二,建立标注所需的双轨元数据体系:语义元数据(每一帧图像的供体编号、芯片批次、暴露时间点、药物剂量、荧光通道配置)、来源元数据(供体临床信息、芯片剪切力参数、设备序列号、操作者ID)、关系元数据(图像特征与生化流出液数据的时间对齐记录)、版本元数据(特征提取算法版本、标注规则变更日志)。标注流程采用"自动化特征提取+预注册评分标准+人工复核"的组合模式,跨批次、跨供体的标注一致性通过阳性对照与阴性对照孔位进行校准。

阶段6|干湿实验室闭环建模:从数据到证据的转化。

遵循三层治理要求:第一层,预先冻结模型分析计划(MAP),核心哲学是"预先定义然后执行"而非事后挑选最好看的结果;第二层,模型验证与确认——Verification确保计算流水线100%可重现,Validation引入正则化机制防范过拟合;第三层,严格的盲测外部验证——预留完全未参与AI训练的独立供体芯片数据,在所有模型训练完成后以盲测方式对毒性分类器进行外部确认。

阶段7|全程监管沟通与证据装配。

与前六个阶段并行、贯穿始终的,是与监管机构的持续对齐:在启动大规模湿实验之前,团队即通过Pre-IND会议沟通获得监管机构对采用NAMs策略的前置认可,确保COU在实验设计阶段就被精确定义。研究团队编制了完整的模型分析报告(MAR),将肺泡芯片生物学响应数据与AI深度学习预测结果系统性整合,揭示ZZXL001引发人类肺部间质性肺炎的分子与细胞级机制,结合临床PK预测精确外推安全边际,并对所有预测结论进行不确定性量化。

数据规模概览

ZZXL001案例|数据规模概览
环节
规模/强度指标
供体覆盖
数十组独立人类供体来源原代上皮细胞(非单一细胞系)
剂量梯度
近10个不同给药剂量水平
时间维度
多时间点动态采样,覆盖毒性动力学演进全程
生化指标
约10种关键炎症与损伤生化指标(LDH、IL-6、TNF-α、IFN-γ等)
成像方式
双转盘共聚焦显微镜,多时间点、多荧光通道实时成像
原始影像数据量
近百TB(超过80TB)
处理后特征数据量
数百GB(超过400GB)
原始数据与特征数据压缩比
约200:1(原始影像→结构化AI-ready特征资产)

【图表6.1】六要素评估表——ZZXL001案例

图表6.1|六要素评估表——ZZXL001案例
要素
ZZXL001案例中的答案
关注的问题
ZZXL001在临床拟用暴露量下是否引发人类特异性肺部ILD,安全边际为何?
使用情境(COU)
人源肺泡芯片+AI/ML,用于替代无效动物模型,支持FIH剂量选择
模型影响力
高(在缺乏有效动物数据的情境下,AI模型输出是推导安全边际的主导证据)
错误决策后果
高(间质性肺炎是ADC类药物严重不良事件,后果严重)
模型风险
高(触发最严格的验证要求)
模型影响度
High(用NAMs+AI替代动物试验支持关键安全决策,显著偏离常规路径)
这一完整闭环所展示的核心价值是:这不是一个"先做科学、再补合规"的项目,而是一个"合规逻辑和科学设计从第一天起同步驱动"的项目——COU在实验启动之前就精确定义并与监管机构前置对齐;实验设计从一开始就服务于AI模型的泛化能力需求;标注策略与元数据体系从实验第一天就按双轨标准建设,而非事后补充;MAP在数据生成之前就冻结,确保证据的预设性和可信度;外部验证采用盲测设计,而非事后对比。这套方法论闭环,正是第三章End-to-Data原则与第四章干湿实验室生产体系在真实项目中的完整映射。

6.2 数据资产的市场价值:标杆交易对比

欧美市场已发生的几笔重要交易,直接验证了黄金三角数据资产的商业价值方向。

【图表6.2】欧美市场标杆数据交易与商业特征汇总

图表6.2|欧美市场标杆数据交易与商业特征汇总
交易案例
核心资产
商业条款
商业逻辑特征
insitro × BMS(2020,2025延伸)
iPSC衍生疾病模型(CIVMs)+高通量多组学配对数据
五年合作,$5000万首付,总潜在合同价值超$21亿;2025年延伸至新发现ALS靶点
购买的不是历史数据包,而是未来持续产出的高维人源细胞数据产能——"数据是活的,合同也是活的"
Recursion × 罗氏/基因泰克
超过50PB细胞表型与扰动响应数据
$1.5亿首付启动,可在神经科学/肿瘤学启动多达40个独立项目,每个成功项目触发超$3亿里程碑
独占溢价+里程碑期权,超大规模多模态"生物学数字图谱"联合绘制
JUMP-CP(Broad Institute主导)
约12家药企联合参与,超115TB Cell Painting表型数据集
联盟制、非独占的产业数据共享框架
与前两者的双边授权模式不同,是产业联盟型的"公共基础设施"共建模式
MELLODDY(含GSK等约26家药企)
跨企业专有化合物活性数据的联邦学习框架
参与方在不共享原始专有数据的前提下,通过联邦学习共同训练模型
代表另一种数据价值实现路径——"模型训练权"而非"数据本身"的交换

四类交易共同揭示的规律:数据资产的商业价值正从"一次性数据采购"演进为"持续产能授权+独占溢价+里程碑期权+模型训练权"四种复合特征,这正是子瞻生物Human Ground Truth Data Layer商业模式所对标的方向。


第七章 展望与结论

药物研发的底层"操作系统"正在被重写:证据源头正从动物模型外推转向人类生物学数据的直接生产;建模范式正从"算法中心"转向"数据中心"。The AI-Native Disease Biology Loop为这一转变提供了终局图景——它不是一条流水线(pipeline),而是一个闭环(loop)。

【图表7.1】The AI-Native Disease Biology Loop 研发闭环流程

图表7.1|The AI-Native Disease Biology Loop 研发闭环流程

【图表7.2】数据收集(Data Collection)vs. 由终而始数据工程(Data Engineering)范式对比

图表7.2|Data Collection vs. Data Engineering 范式对比
对比维度
Data Collection(传统范式)
Data Engineering / End-to-Data(新范式)
出发点
从既有数据出发,事后寻找可用信号
从Drug-development Decision逆向设计实验
数据来源
历史文献、公开数据库
主动设计的Disease Data Factory:Disease Question→Model Layer→Perturbation Layer→Measurement Layer
数据偏差风险
存在目的漂移、合成偏差、确认偏差、项目偏差、报告偏差等历史性系统偏差
通过预先冻结的实验设计与Annotation前置环节主动规避偏差
与AI模型的关系
单向静态交付,模型训练与数据生产割裂
closed-loop:AI Model输出New Biological Hypothesis反哺New Experiment
最终产出
数据集(Dataset)
AI-ready Data Asset,可直接支撑Decision

回到最初的问题——数十亿细胞,为什么仍然不够?答案已经清晰:规模从来不是问题的核心,覆盖(coverage)才是。数据丰裕与疾病理解之间没有必然的正相关关系;最需要AI的疾病领域,往往恰恰是数据基础最薄弱的领域;无论模型架构如何演进,如果训练数据本身没有覆盖到某个疾病机制转换的关键状态与因果响应模式,再强大的AI也只能在已知的空间内进行插值,而无法产生真正意义上的机制发现。

子瞻生物的愿景,是构建AI时代的人类数据新基建——用人源真值数据重构药物研发的确定性,弥合两条鸿沟:动物与人类之间的物种鸿沟,以及数据规模与疾病生物学覆盖之间的证据鸿沟。这一定位可以类比为AIDD领域的"Bloomberg Terminal"——正如金融市场需要标准化的市场数据基础设施,AI原生的药物研发平台,也需要一个能持续产出、标准化交付、经过科学与合规双重验证的人体细胞数据供应商。

真正值得从业者、投资人与监管科学家关注的,不是下一代基础模型的参数规模,也不是又一个数亿细胞级别的图谱项目,而是能否建立起一套真正意义上的AI-Native Biology Data Generation System——一套从疾病问题出发、系统性覆盖Disease Cellular Data Stack五个层次、并具备工业化持续生产能力的基础设施。这才是连接"数据丰裕"与"疾病理解"之间那道鸿沟的真正桥梁,也是AI真正开始兑现其在药物研发领域承诺的前提条件。子瞻生物愿与全球合作伙伴一道,迎接这个属于人类生理数据的黄金时代。

术语表(Glossary)

术语表
术语
全称/中文
简要释义
AIDD
AI Drug Discovery
AI驱动的药物发现
Disease Cellular Data Stack
疾病细胞数据栈
本白皮书核心概念,指真正具有AI价值的疾病细胞数据必须具备的五层价值结构
CoU
Context of Use,应用场景
定义一项技术/数据在什么研发阶段、针对什么药物类型、回答什么生物学问题
FfP
Fit for Purpose,特定用途适格性
评估数据质量、临床拟合度与验证水平是否足以支撑其拟定的应用场景
WoE
Weight of Evidence,证据权重
整合多源异构证据以支持科学决策的方法论框架
NAMs
New Approach Methodologies,新途径方法学
器官芯片、类器官、Cell Painting、多组学、AI预测工具等非动物实验方法的统称
CIVMs
Complex In Vitro Models,复杂体外模型
包括iPSC衍生疾病模型、3D类器官、器官芯片
Drug-seq
高通量扰动转录组测序
在多孔板中直接裂解细胞并测序,产出药物处理后的完整转录组指纹
Cell Painting
细胞全景成像
多荧光染料标记亚细胞结构后高内涵成像,产出高维形态学特征向量
MPS
Microphysiological Systems,微生理系统
器官芯片等模拟人体生理微环境的体外系统
Ground Truth
生物学真值
直接来自真实人类细胞实验、而非动物模型或计算推断的数据
Biological Context
生物学语境
Stack Layer 1,指数据的细胞来源、基因型背景、疾病亚型等必要背景信息
Metadata & Provenance
元数据与来源
Stack Layer 2,指数据可追溯性与采集过程完整记录
Multimodality
多模态性
Stack Layer 3,指同一扰动条件下同步采集的多种数据模态
Perturbational/Causal Information
扰动性/因果性信息
Stack Layer 4,指"给定扰动,系统如何响应"的因果干预数据,而非静态观察
Industrial-Grade
工业级
Stack Layer 5,指数据生产的标准化、可重复、可规模化能力
Epistemic Opacity
认识论不透明
缺乏理论机制连接输入与输出的数据状态,阻碍有意义的标签化
Underspecification
欠规范化
机器学习流程中多个测试集表现相同但部署行为迥异的失效模式
Predictive Validity
预测效度
决策工具输出与真实临床结局之间的相关程度
Human Specificity
人类特异性
某些生物学过程/疾病对人类物种具有高度特异性,动物模型无法复现
End-to-Data
由终而始的实验设计
从临床决策问题逆向设计实验,而非从既有数据出发寻找信号
Disease Data Factory
疾病数据工厂
从疾病问题出发、标准化持续生产AI-ready数据的闭环生产架构
Ladder of Causation
因果之梯
Judea Pearl提出的关联/干预/反事实三层因果认知框架
MAP
Model Analysis Plan,模型分析计划
AI训练启动前预先冻结的分析方案,防止事后选择性报告
MAR
Model Analysis Report,模型分析报告
整合模型输出与实验数据的底层技术文件,用于支持申报
Annotation
数据标注
为原始生物数据赋予结构化生物学标签的过程,本白皮书主张应在实验设计阶段前置完成
DaaS
Data-as-a-Service
以持续数据产能授权为商业本质的服务模式

参考资料

  1. 1. Bender, A., et al. Artificial intelligence in drug discovery — what it is, where we stand and the path forward. Nature Reviews Drug Discovery.
  2. 2. Koller, D. Drug Discovery Has No Magic Wands: On AI, human biology, and what it will actually take to discover transformative new medicines. a16z / Deep Phenotype.
  3. 3. Bray, M. A., et al. (2016). Cell Painting, a high-content image-based assay for morphological profiling. Nature Protocols, 11, 1757–1774.
  4. 4. Way, G. P., et al. (2024). Cell Painting Gallery: an open resource for image-based profiling. Nature Methods.
  5. 5. Morphological profiling by means of the Cell Painting assay enables identification of tubulin-targeting compounds. Cell Chemical Biology.
  6. 6. A dataset of images and morphological profiles of 30,000 small-molecule and gene perturbations. PMC.
  7. 7. D'Amour, A., et al. (2022). Underspecification Presents Challenges for Credibility in Modern Machine Learning. JMLR, 23(226), 1–61.
  8. 8. Scannell, J. W., & Bosley, J. (2016). When Quality Beats Quantity: Decision Theory, Drug Discovery, and the Reproducibility Crisis. PLoS ONE, 11(2), e0147215.
  9. 9. Scannell, J. W. (2022). Predictive validity in drug discovery: what it is, why it matters and how to improve it. Nature Reviews Drug Discovery.
  10. 10. Sun, D., et al. (2022). Why 90% of clinical drug development fails and how to improve it. Acta Pharmaceutica Sinica B, 12(7), 3049–3062.
  11. 11. BCG & Wellcome Trust. (2024). Unlocking the Potential of AI in Drug Discovery.
  12. 12. Decade of AI in Drug Discovery: Hype or Reality? (2026). International Journal of Pharmaceutical Sciences and Drug Research.
  13. 13. Analysis-Atlas. (2026). AI in Drug Discovery: A Nobel, a Billion-Dollar Launch, and Zero Approved Drugs.
  14. 14. Insilico Medicine. (2025). Phase IIa results of Rentosertib (ISM001-055) for Idiopathic Pulmonary Fibrosis. Nature Medicine.
  15. 15. BenevolentAI. (2023). BenevolentAI Announces Top-Line Phase IIa Results for BEN-2293.
  16. 16. Abramson, J., et al. (2024). Accurate structure prediction of biomolecular interactions with AlphaFold3. Nature, 630, 493–500.
  17. 17. Krishna, R., et al. (2024). Generalized biomolecular modeling and design with RoseTTAFold All-Atom. Science, 384(6693), eadl2528.
  18. 18. EvolutionaryScale. (2024). ESM-3: A Frontier Language Model for Biology.
  19. 19. Pearl, J., & Mackenzie, D. (2018). The Book of Why: The New Science of Cause and Effect. Basic Books.
  20. 20. Pearl, J. (2009). Causality: Models, Reasoning, and Inference (2nd ed.). Cambridge University Press.
  21. 21. Nelson, M. R., et al. (2015). The support of human genetic evidence for approved drug indications. Nature Genetics, 47, 856–860.
  22. 22. Dixit, A., et al. (2016). Perturb-Seq: Dissecting Molecular Circuits with Scalable Single-Cell RNA Profiling. Cell, 167(7), 1853–1866.
  23. 23. Replogle, J. M., et al. (2022). Mapping information-rich genotype-phenotype landscapes with genome-scale Perturb-seq. Cell, 185(14), 2559–2575.
  24. 24. Aliper, A., et al. (2023). Prediction of Clinical Trials Outcomes Based on Target Choice and Clinical Trial Design with Multi-Modal Artificial Intelligence. Clinical Pharmacology and Therapeutics, 114(4), 972–980.
  25. 25. Björnsson, B., et al. (2020). Digital twins to personalize medicine. Genome Medicine, 12(1), 4.
  26. 26. Wilkinson, M. D., et al. (2016). The FAIR Guiding Principles for scientific data management and stewardship. Scientific Data, 3, 160018.
  27. 27. OECD. Guiding Principles and Key Elements for Establishing a Weight of Evidence for Chemical Assessment.
  28. 28. EFSA Scientific Committee. Guidance on the Use of the Weight of Evidence Approach in Scientific Assessments. EFSA Journal, 15(8), 4971.
  29. 29. ICH/FDA. S11 Nonclinical Safety Testing in Support of Development of Paediatric Pharmaceuticals.
  30. 30. insitro & BMS 合作协议公告;Recursion & 罗氏/基因泰克战略合作公告;Recursion & Exscientia 合并公告。
  31. 31. FDA Draft Guidance: Considerations for the Use of Artificial Intelligence to Support Regulatory Decision-Making for Drug and Biological Products.
  32. 32. FDA General Considerations for the Use of New Approach Methodologies to Support Regulatory Decision-Making for Drug and Biological Products (Draft Guidance).
  33. 33. ICH M15: General Principles for Model-Informed Drug Development (MIDD).

子瞻生物(BIOCAST)

Disease Cellular Data Stack for AI-Native Drug Discovery

Drug-seq × Cell Painting × CIVMs | 黄金三角 | Human Ground Truth Data Layer

 
打赏
 
更多>同类资讯
0 条相关评论

推荐图文
推荐资讯
点击排行
网站首页  |  关于我们  |  联系方式  |  使用协议  |  版权隐私  |  网站地图  |  排名推广  |  广告服务  |  积分换礼  |  网站留言  |  RSS订阅  |  违规举报  |  皖ICP备20008329号-18
Powered By DESTOON