就在DeepSeek发布“外挂记忆”技术Engram仅仅16天后,一支低调的中国团队迅速将其思想“移植”到了生命科学领域,推出了名为Gengram的创新模块,为AI读懂DNA这本“天书”打开了一扇新门。这支来自杭州的Genos团队,结合了之江实验室与华大生命科学研究院的力量,不仅让基因组模型性能大幅提升,甚至让AI“自己悟出”了DNA双螺旋的物理规律——这一切,都源于一个轻量级却极具智慧的设计。
从“逐字阅读”到“成语速查”:给AI一本基因字典
传统的基因组基础模型(如AlphaGenome)普遍采用“单碱基分词”方式处理DNA序列,也就是把A、T、C、G一个个拆开来看。这种方式虽然精细,但效率极低,就像我们读成语时不是整体理解“刻舟求剑”,而是先分析每个字的笔画和含义,再拼凑意思,既费力又容易出错。面对长达30亿碱基的人类基因组,模型很容易“只见树木,不见森林”。
Gengram的突破在于将静态的生物学知识显式地做成“外挂字典”。它构建了一个可微分的哈希表,存储长度为1到6的所有k - mer(如“ATG”、“CGTA”),这些正是已知的功能性DNA片段(如启动子、转录因子结合位点)。当模型遇到这些关键序列时,不再靠层层注意力机制去“猜”,而是直接查表获取语义信息,省下大量算力用于更高层次的推理。
更聪明的是,Gengram引入了动态门控机制,让模型学会“什么时候该查字典,什么时候该独立思考”。在功能区域(如外显子)激活检索,在无功能背景区域则关闭,避免干扰。这种“看人下菜碟”的智能策略,极大提升了计算效率与准确性。
神奇的21bp:AI自己“发现”DNA双螺旋规律
最令人惊叹的发现是,Gengram在训练中自发表现出对DNA三维结构的敏感性。研究团队测试不同局部聚合窗口大小时发现,当窗口设为21bp时,模型性能达到峰值。而这个数字并非巧合——DNA双螺旋每10.5个碱基旋转一圈,21bp正好对应两个完整周期。这意味着相隔21bp的碱基在空间上处于同一侧,面临相似的生化环境。
换句话说,Gengram在没有输入任何结构生物学知识的前提下,通过数据训练“悟出”了DNA的空间相位规律,仿佛AI在处理一维序列的同时,也隐约看见了它的三维构象。这一现象不仅是技术上的成功,更是AI具备“科学直觉”的一次生动体现。
小插件撬动大变革:轻量设计带来高效能跃迁
Gengram本身仅约2000万参数,对于百亿级的大模型来说几乎可以忽略不计,但它带来的提升却是飞跃性的:
- 剪接位点预测AUC提升16.1%(从0.776到0.901)
- 表观遗传预测任务H3K36me3 AUC提升22.6%(从0.656到0.804)
更重要的是,集成Gengram的模型展现出惊人的数据能效比——仅用极小规模训练数据,就能媲美甚至超越那些依赖数十倍数据量的主流模型。它还具备强大的通用性,能无缝适配Dense与MoE等不同架构,并显著改善MoE中的专家负载失衡问题,实现性能与效率的双重优化。
杭州“特种部队”:AI for Science的新范式样本
Gengram的背后,是“Genos Team”这支融合了华大生命科学研究院的组学大数据能力与之江实验室的AI算力优势的交叉团队。他们去年发布的百亿级人类基因组模型Genos,已成为GeneT等临床级遗传病分析模型的基础。这次Gengram的推出,不仅是一次技术创新,更验证了一种新的科研范式:将领域先验知识转化为可计算的架构设计,让AI真正“懂科学”。
未来,我们或许会看到更多类似“外挂字典”的专用插件,应用于蛋白质、代谢通路乃至细胞系统建模中。而Gengram已经证明:真正的智能,不在于记住一切,而在于知道哪里该查,哪里该想。
本文作者可以追加内容哦 !