研究

研究方向

本团队主要从事基因组学相关的生物信息学算法研究,目前尤其关注基因组组装、序列比对、图泛基因组、基因组大语言模型等关键性计算问题和计算模型。

🧬

01

基因组组装

端粒到端粒(T2T)组装、缺口填补与串联重复序列组装算法。

围绕长读长测序数据(PacBio HiFi、Oxford Nanopore)开发高效准确的组装算法:

  • T2T 组装:面向复杂真核基因组的端粒到端粒完整组装
  • 缺口填补:低覆盖度 HiFi 数据下的染色体级别组装与补洞
  • 串联重复序列:协同利用 HiFi 与 Hi-C 数据实现串联重复区的精确组装
  • 组装器评测:系统性评估主流 de novo 组装器在复杂基因组上的表现
🔗

02

序列比对

面向海量长读长与宏基因组数据的高通量、高精度比对算法。

研究序列比对中的核心计算问题,在保证准确率的前提下大幅提升速度:

  • 长读长序列的高效索引与种子链化策略
  • 面向结构变异的比对偏好性校正
  • 宏基因组数据的快速分类与丰度估计
🕸️

03

图泛基因组

基于图结构的泛基因组构建与结构变异检测。

以图结构替代单一线性参考基因组,更完整地表达物种内的遗传多样性:

  • 图泛基因组的构建、压缩与索引
  • 基于图泛基因组的结构变异(SV)检测与基因分型
  • 面向育种的泛基因组分析(如玫瑰泛基因组研究)
🤖

04

基因组大语言模型

将大语言模型方法应用于基因组序列建模与功能注释。

探索大语言模型在基因组学中的建模能力与应用边界:

  • 基因组序列的预训练表示学习
  • 基于序列模型的功能元件识别与注释
  • 模型可解释性与下游任务迁移