前两课,我们都在做同一件事——从序列出发,理解生命:让 AI 读懂 DNA/RNA 序列的规律,让 AI 从氨基酸序列中看出结构、功能与进化。
这一课,方向反了过来。
如果我们已经知道想要什么样的结构,能不能反过来找到一条能折成它的序列?
这就是 RNA 逆折叠(Inverse Folding)——一个从”读”走向”写”的问题。
9 月 3 日晚,《AI4S 实战派》Hello Life 生命科学专题第三场直播,上海科学智能研究院研究员斯奇老师带来《反过来设计 RNA:结构预测与逆折叠》。他用四篇代表性论文,串起了从监督学习、自回归、扩散模型到强化学习的完整技术演进,并通过实操,直观展示了”物理约束”与”AI 代理”如何大幅提升设计效率。
RNA 由 A、U、C、G 四种碱基组成,与 DNA 的一个关键区别在于:DNA 通常是双链、结构稳定,而 RNA 多为单链——柔性更强,也更容易折叠成复杂形状。
也正因如此,RNA 不只是遗传信息的载体,它还广泛参与调控、催化与分子识别,在 mRNA 疫苗、RNA 适配体、核糖开关、先导 RNA 设计与合成生物学中都有重要应用。
斯奇老师梳理了 RNA 结构的三个层次:
一级结构是序列本身,每个位置四选一,长度为 N 的序列组合空间高达 4^N;二级结构是碱基互补配对(A-U、C-G)形成的平面拓扑,通常用点括号对表示;三级结构则是真实物理空间中的三维构象,能反映一维、二维都无法表达的空间关系——比如序列上相距很远的两个碱基,在空间中可能紧紧靠在一起。
而逆折叠要做的,正是给定二级或三级结构,反推出能折成它的序列。
一条长度为 N 的 RNA,序列空间是 4^N——指数级爆炸。靠枚举做湿实验,代价高到不可承受。
斯奇老师给出了三个理由,说明为什么这件事天然适合 AI:
其一,AI 本质是模式识别。 给定大量”结构—序列”配对数据,模型就能学到从结构到序列的映射分布。
其二,这是一个”一对多、强约束”的问题。 同一个结构可能对应多条可行序列,同时又有碱基配对规则、自由能等诸多约束——这恰好是 AI 擅长处理的场景。
其三,昂贵的科学工具可以被”学习”。 计算自由能、预测结构这类原生工具往往非常耗时,而 AI 可以学习”从序列到评分”的映射,充当一个更廉价的代理。
那么,怎么判断一次设计成功与否?斯奇老师强调,评价必须同时看三个层次:一维看序列恢复率(Sequence Recovery),二维看点括号对匹配度与自由能(MFE),三维看构象偏差(RMSD、LDDT)。
这是本期最核心的部分。斯奇老师用四篇代表作,清晰勾勒出 RNA 逆折叠的方法演进。
RDesign(ICLR 2024):把三维结构用起来
这是用 3D 结构做 RNA 逆折叠的开创性工作。它把碱基的骨架原子坐标提取出来,构建图神经网络,通过多层级表征学习,再结合两种对比学习损失与监督损失共同训练。
一个巧妙的设计在推理阶段:如果已知位点 i 和 j 需要配对,而模型给出的最高概率碱基组合(比如 C 与 A)并不满足配对规则,就保留概率更高的那个、改写另一个——把 A 修正为 G,得到合法的 C-G 配对。这是把物理规则直接注入生成过程的典型做法。
gRNAde(ICLR 2025):引入自回归与多构象
它带来两个关键改进:一是支持输入多个构象——同一条 RNA 序列可能对应多种结构,这更贴合 RNA 柔性的本质;二是改用自回归解码,逐位生成碱基,而非一次性输出整条序列的概率分布。
效果差异显著:在同等条件下,RDesign 的 recovery 为 0.385,而 gRNAde 达到 0.481——仅生成方式的改变,就带来了明显提升。
RiboDiffusion(Bioinformatics 2025):把扩散模型引进来
它首次将 Diffusion 引入 RNA 逆折叠:在序列空间加噪去噪,同时把加噪后的序列特征与三维结构的图特征拼接,共同输入模型,再用 DiT 结构做条件扩散解码。
斯奇老师在这里做了一个很精彩的对比:自回归是”逐个位置确定,已生成的不再改动”;而扩散是”每一步对所有位置做全局修正”。 前者更接近文本生成的逻辑,后者更接近图像生成——而 RNA 的有趣之处正在于,它表面上是在生成序列,本质上却是在生成符合客观规律的结构。
实验也印证了这一点:RiboDiffusion 与 gRNAde 的序列 recovery 相近,但在二级、三级结构指标上明显更优。
SOLD(AAAI 2026):用强化学习优化”不可导”的指标
这是斯奇老师团队的工作,也是第一个显式优化结构指标的逆折叠方法。
它有两个关键创新:一是不在序列空间、而在 RNA 大模型的隐空间做扩散——因为大模型见过海量序列,其表征包含了丰富的共进化与上下文信息;二是把原本只能”事后评测”的二级、三级结构指标,通过 PPO 强化学习引入训练过程。
这个思路可以类比大语言模型:前面的扩散训练相当于 pre-train,而这一步用结构指标做奖励的强化学习,相当于 post-train——让模型在一维、二维、三维指标上被同时优化。
理论之后,斯奇老师用一个精心设计的小实验,直观展示了”科学先验”的价值。
任务是:给定一个目标二级结构,找到能折成它的 RNA 序列。他设置了三个指标构成奖励——碱基配对的 F1、自由能差距、以及 GC 含量,然后对比三种策略:
随机搜索——直接随机采样 600 条序列,奖励最高仅约 0.5,F1 值几乎都聚集在 0 附近。
物理约束引导——先用栈算法解析出哪些位置需要配对,配对位点只从合法碱基对中取值。同样 600 条,奖励迅速提升到 0.32 以上,且优质序列明显增多。
AI 代理搜索——训练一个随机森林模型来学习”序列→奖励”的映射,用它替代昂贵的科学工具做预筛。结果是在极少的调用次数下就逼近最优奖励 1.0。
斯奇老师还展示了一张很有启发的图:当横轴是 F1、纵轴是 GC 含量时,样本点并没有都聚在右上角——很多时候 F1 高的序列,GC 含量反而不理想。 这说明了为什么评价 RNA 设计不能只看单一指标。
🔗 完整代码已上传魔搭社区,搜索 RNA inverse folding 即可获取。
课程最后,斯奇老师提出了一个值得深思的方向。
回看这四篇工作,本质上都是把通用领域的 AI 方法(监督学习、自回归、扩散、强化学习)迁移到 RNA 逆折叠上。三维结构信息大多是被”构造成特征塞进去”,作为一种条件输入——这意味着约束其实并不算强。
那么下一步呢?
能不能把几何先验、物理约束、生物机制,真正做进模型内部,让它们直接参与到生成过程之中?
这也呼应了直播问答里的一个提问:为什么 NLP 模型直接套用在生物序列上,干实验指标好看、湿实验却不理想?斯奇老师的回答很明确——因为生命分子不只是一维序列,还有二维拓扑和三维结构。AlphaFold 中的 MSA 之所以关键,正是因为它引入了同源与共进化信息。把更多结构与生物学信息融入学习过程,效果才会更好。
关于如何入门,他也给了一个务实的建议:不必先把知识全部学完再动手,而是在复现论文的过程中发现问题、带着问题去学——这样搭起来的知识框架,会扎实得多。
第一课,我们让 AI 读懂 DNA/RNA 序列;第二课,我们走进蛋白质序列,看到 Embedding 中的进化信息;这一课,我们第一次反过来,从结构出发去设计序列。
但无论正向还是逆向,一个根本问题始终绕不开:
一条序列,究竟如何决定它的三维结构?
下一期,Hello Life 将正面回答这个问题——回到那个改变了整个生命科学的范式:AlphaFold。
9 月 10 日晚 19:30,南开大学统计与数据科学学院郑伟老师将带来 Hello Life 第四讲:
《从序列到三维结构:AlphaFold 范式与后 AlphaFold 时代》
将完整梳理这条路线:蛋白质结构预测问题的发展历程、AlphaFold 算法与其置信度的含义,以及后 AlphaFold 时代——生物分子结构预测及其互作结构预测。
实操环节则更进一步:现场演示 AlphaFold3 本地版的安装,以及服务器版与本地版的实际使用,并以蛋白质复合物为例,讲解预测的输入、输出与结果文件分析。
从读懂序列,到逆向设计,再到理解结构——AI 对生命的探索,正在一层层深入。
👇 点击「阅读原文」预约 Hello Life 第四期直播,继续加入 AI4S 生命科学探索之旅。
👇点击关注ModelScope公众号获取 更多技术信息~