Brandon: 先别急着讲 Omni 的基准。什么是基因组语言模型,它能做什么?

Eric: 基因组语言模型(genome language model,GLM)是在 DNA 字母上训练的大模型,不是在单词上训练。Radical Numerics 这支团队被知道,是因为他们做了第一批能生成 DNA、而不只是阅读 DNA 的模型。Eric Nguyen 是联合创始人兼 CEO,斯坦福 Chris Ré 组博士,Evo 的主要作者,也参与了 Arc Institute 的 Evo 2。主持人是 Atomic AI 的 Brandon Anderson 和 Mirror Omics 的 RJ Honicky。

Eric: 最早的 HyenaDNA 用卷积式 Hyena 算子代替注意力,是为了吃下很长的序列。当时它把上下文推到大约一百万碱基,用来从原始序列预测调控功能和长程作用。人其实不太懂自己的基因组:字母如何组合、如何编码性状和疾病,规则并不完整。第一代模型要证明的是,AI 可以读出一部分这种长程语法。

RJ: 实验室做不到、模型能解锁的是什么?

Eric: 真正把生成式基因组学推开的是 Evo。当时的 DNA 模型又小、上下文又短,而且几乎只读不写。自然语言里,生成能力改变了人操纵语言的方式;Eric 的问题是,同一件事能不能发生在 DNA 上。Evo 展示的一个方向是跨尺度、跨模态的生成:CRISPR-Cas 同时涉及 RNA 和蛋白质,以前通常要分开建模。后来另一个 Arc/Stanford 小组用 Evo 一类模型设计出噬菌体基因组,并合成出有功能的病毒。Eric 把这件事同时看成能力信号和风险信号:如果模型开始操纵生命底物本身,防御就不能只停在聊天机器人的关键词过滤上。

## 从 Evo 到 Omni

RJ: Evo 和 Evo 2 在很多任务上打不过专用小模型。博客里 Omni 为什么开始超过它们?

Eric: Evo 证明预训练能跨模态,但在人类遗传学上仍落后。Omni 的重点不是再讲一遍预训练,而是中训练和后训练,也就是把科学家真正会问的问题做成模型能回答的格式。例如给定野生型和突变,标出可能的致病变异。特殊 token 用来告诉模型当前要做预测还是设计。具体配方他没有讲,算作还在发展的部分。

Eric: 公开可说的用法,是比较突变序列和参考序列的似然,把差异当成惊讶度,再用来给疾病风险打分。零样本对应 Evo 2 那一列;Goodfire 等合作方会在 Evo 2 的分数上再微调。Omni 进一步把问答格式写进中训练,科学家不必每次取出嵌入、外接一个回归头。基准来自 ClinVar、TraitGym 一类变异集合。编码区只占基因组大约 1.5% 到 2%,大量疾病相关变异在非编码调控区,传统方法主要覆盖编码区。Eric 说 Omni 的相对优势在这些更难、更长程的非编码变异上。

RJ: 表里的 Borzoi 是什么?

Eric: Borzoi 也是 DNA 模型,但不是语言模型。它做监督学习,从序列直接预测染色质可及性、基因表达等功能轨道,依赖大量人工标注。语言模型的预训练吃的是未标注序列;对准某个任务时,才用较小的标注集。未标注数据远多于标注数据,所以这条路线值得单独比。

Brandon: 以前监督方法的数字还在误差棒里,现在你们明显超过了。

Eric: 他们把集成方法 CAD 当成必须超过的横杆。CAD 会把当时最好的模型和传统分类器拼在一起,所以天然强。目标不是挑一个弱基线,而是超过现有最强组合。

## 用序列轨迹做生物思维链

Eric: 后半段的实验是一种生物思维链(chain-of-thought)。公开博客的描述是:把一批 RNA 适配体(aptamer)按适应度从低到高排成轨迹,扣住最好的一部分,看模型能否顺着轨迹写出更高分、训练时没见过的候选。湿实验验证还在做,所以这期没有报实验室结果。Eric 认为这种结构可以迁移,因为很多生物数据本来就是“一条序列,加一个想要的分数”。

Brandon: RNA 上出现这种能力让我意外。哺乳动物 RNA 往往没有强共进化约束,主要压力是携带编码信息。

Eric: 他自己也不确定能力从哪来。模型预训练在 DNA 上,RNA 只在这项任务的中训练里少量出现,而且只用了这个数据集。他认为这支持先在基因组上预训练,再把其他模态当成额外上下文。公司说的 general biological intelligence,是把 DNA、代谢组、表观组、蛋白质组看成同一系统的传感器。虚拟细胞如果只看转录本,离一个细胞还很远。他不保证这会得到理解全部生物细节的超级智能,只问它能不能比现在有用得多。

Brandon: 范围是人类、真核生物,还是也包括病毒?

Eric: 所有生命域都在范围内。这期聚焦人类,是因为医院和非营利组织已经拿着大量意义不明变异(VUS)来问:病人有症状,但不知道基因组哪一段在起作用。另一个高影响方向是抗菌。全球每年仍有大约两百万人死于细菌感染,用噬菌体针对特定细菌是东欧用了很久的思路。他没有展开怎么设计,只说公司会朝能救人的基因组走,不停在一种基因组上。

## 上下文、竞争点和公司是怎么来的

RJ: 稀土提取这种任务,你们未必有优势。优势应该在整个生物体的大尺度设计,而不是单个蛋白质的结构。模型到底懂不懂结构?

Eric: 纯结构的蛋白质设计不是他们自称有优势的地方。稀土这个例子吸引他们,是因为上下文可能重要:在目标基因或蛋白质周围喂入非编码区,告诉模型要在哪一类微生物的邻域里找可变异体。Evo 模型曾被别人用类似办法,从目标蛋白上游提示,生成毒素—抗毒素一类候选。这里的假设是,DNA 是物理世界留在序列上的印记,目标片段周围的调控元件也携带它从哪里来、怎么起作用。

RJ: 你们现在公开的上下文大约两百万。人类基因组大约三十亿碱基,长出约一千倍。细菌基因组也往往更长。有限上下文怎么做合成生物学?

Eric: Evo 相关的噬菌体工作是另一个小组做的。他们从噬菌体开始,正因为那是最短的基因组之一,Eric 回忆大约六千碱基对。怎么用更小的窗口处理更长的基因组,是整个 AI 社区还在解的问题,也是 Radical Numerics 坚持自己做研究、而不是只拿开源模型的原因。公司名字就来自长上下文:2022 到 2023 年这还不是大实验室的常规能力。

Eric: 博士阶段他和 Michael Poli 先做通用语言模型,发现自己的模型擅长长序列,再去找自然界最长的序列,落到 DNA。当时生物模型常见上下文只有一两千 token。Hyena 出乎意料地能读 DNA。周围人接着问:读可以,能不能生成?Eric 在斯坦福生物工程圈子里问了大约六个月,多数人认为生成 DNA 要么没用,要么不可能:人类自己都不懂规则,DNA 又吵、重复又多,模型也无法被简单判定对错。Arc 还是给了第一批 GPU。第一个让他们起鸡皮疙瘩的结果是,没人告诉模型什么是蛋白质,checkpoint 丢到 ProteinGym 上却能和蛋白质专用模型竞争,随后在 RNA 和 DNA 任务上也出现类似现象。NVIDIA 后来支持把 Evo 2 做大,Greg Brockman 曾从 OpenAI 休假数月,凌晨一起排错。

RJ: 噬菌体那个例子已经很刺眼,为什么还不足以说服人?

Eric: 对一部分人够了。批评也可以成立:生成物可能只是贴近自然序列的小变体,不能外推成已经可用的技术。Eric 认为公司现在更该回答的是,模型能不能真正改善对疾病的理解、改善治疗,或者解决一个具体工业问题,而不是把科学演示留在思想实验里。

## 模型压缩了哪些生物模式

RJ: 博客末尾有机械可解释性,也有生物安全。先讲前者。

Eric: 他们还在早期,团队正在建。目前做的是看嵌入和激活:模型为了压缩数据,会把关键模式写进权重。从较简单的 GC 含量、重复次数,到转录因子模体,再到疾病表征。转录因子结合 DNA、改变表达,而不改写 DNA 本身,和衰老、疾病状态都有关。哪些因子在哪里结合、造成什么效果,组合空间大到不适合手工枚举。

Eric: 他们想做的是疾病流形:模型眼中不同疾病的表征结构。这只是 DNA 单模态的预览。下一代要融合蛋白质、RNA、ATAC、甲基化等分子表型。自然语言也会加进来,图像和视频里已有融合语言的先例,他们的早期实验让 Eric 觉得这件事相对直接;更难的是生物模态之间怎么融合。语言一旦接上,思维链和工具编排会更容易被科学家使用。

## 双重使命

Eric: 公司把使命叫成双重使命(dual mandate)。如果模型能把功能设计进序列,同一类模型也最适合做判别:生成好的模型,往往也能判断一条序列像不像病原体。他刚参加过一场 AI scientist 面板,被问到科学模型的极端风险时,在座的人几乎都提到生物武器;再看这些实验室,并没有相应规模的生物防御投入。

Eric: 生物防御大致有四根支柱:检测与监测、归因、对策,以及政府层面的威慑。公司做前三项。检测回答环境样本里有没有致病序列,例如机场拭子或污水。归因回答它更像自然出现、来自某处,还是人工改造。对策是在检测和归因之后,能不能做出抗病毒或抗菌手段。他认为现有社区缺的不只是“是不是病原体”的二分类,而是把危险落到哪些基因、签名从哪来。主流做法仍是和已知病原体清单做序列比对。清单覆盖不了新东西,也覆盖不了字母不同、功能相近的情况。Microsoft 的 Paraphrase 工作被他当作公开例证:保持结构、改写序列之后,既有检测可能失效。DNA 合成公司已经有检测,但 Eric 猜测大多仍是模式匹配。

Brandon: 科学家做正当的合成生物学时,过滤很容易误伤。几十亿条序列里,很高的 F1 仍然会挡住大量合法研究。

Eric: 百分之百拦住危险设计是更难的问题,也不是他们现在的问题。设计侧已经有很多人在推前沿,防御侧没有同等的前沿技术,所以先把防御拉到能对打的位置。工具不完美也有用:聊天机器人的安全层挡不住的东西,会进入环境;监测、归因和对策这套系统需要比序列比对更强的工具。标准是能不能移动指针,而不是第一次就完美。他也承认,现在政策圈讨论很多、动手较少,所以他们选择把工具做出来给人用。

RJ: 网络安全的类比有限。足够强的模型原则上可能补上非社会性漏洞,系统可以打补丁;人类基因组不能打补丁。反过来,把一段 DNA 变成一个不会先伤到设计者的有效病毒,门槛仍然很高,进攻激励也未必和网络攻击一样强。什么是真正让你睡不着的威胁?

Eric: 他不替恶意行为者做情景推演。他担心的是门槛和速度:需要的专业知识下降以后,可尝试的体积会上去。国家级生物武器计划是历史事实,公司顾问见过并参与过拆除;和平时期故意使用没那么迫近,战时更危险。近期更可能的是研究中想控制某种功能、结果没有封住。这不使他失眠。他是乐观派,认为收益大于伤害,防御只是不该继续落后。研究者和政策圈有能力动员到威胁前面。

## 不必在前沿模型和生物学之间二选一

Brandon: 如果能凭空去掉一个瓶颈,你去哪个?

Eric: 第一个答案是 GPU,每个实验室都会这么说。第二个更要紧:一个领域越懂,人往往越悲观,生物学尤其如此。新东西一出来,专家会举出一串它没处理的例外,而且常常是对的。Radical Numerics 要找的是既懂疾病或模态、又还愿意改工作方式的人。

RJ: 希望听众带走的一句话是什么?

Eric: 做前沿 AI 不必只能做聊天机器人和企业应用。关心人类健康、想推动生物学理解的人,也可以同时做最难的模型。这是 Radical Numerics 想证明的事。

Brandon: 架构和机械可解释性的帖子里已经有不少新东西。生物学不是 AI 的边缘应用,它就在前沿上。