
单细胞测序中,少量“序列看起来相似、但整体结构异常”的分子会混入正常细胞,生成伪条形码,混淆真实细胞信号,干扰后续细胞识别与基因定量工作。
近日,深圳理工大学合成生物学院杰出教授连祺周团队在Genome Research发表研究成果,开发出一款名为Pattern-Filter的单细胞测序预处理工具。该工具在数据分析最前端增设结构校验关卡,仅过滤2%-18%的测序读段,最高可降低约80%伪条形码,以极小的数据损耗,得到更加干净可靠的测序原始数据。

论文上线截图
Pattern-Filter属于序列比对、基因表达定量之前的前置质控工具,可与CellRanger、STARsolo等主流分析流程无缝兼容,并不会替代原有分析步骤,专门补齐传统质控手段缺失的序列结构完整性校验能力。
行业痛点
传统质控存在“结构盲区”
如今单细胞测序已经广泛用于基础科研、精准医学、新药研发以及细胞治疗等众多领域,测序数据质量的好坏,直接决定细胞分群、标志物筛选、临床结果解读是否可信。
但目前主流分析工具(CellRanger、STARsolo等),大多只聚焦碱基纠错,只能修正随机产生的测序碱基错误,却普遍忽略一个核心问题:只查“碱基对不对”,不查“结构对不对”。
真实文库中始终存在一类结构异常但局部碱基正常的分子——单碱基无误、可被常规流程识别,但整体结构残缺、锚定序列缺失或组装异常。这类读段进入分析流程后,就会产生大量伪条形码,造成条形码多样性异常膨胀、细胞定量结果失真、细胞亚群识别出现偏差。
这类由结构缺陷带来的系统噪声,长期游离在传统质控的检测范围之外,也成为深度解析珍贵样本的一大阻碍。
问题量级
少量结构异常,引发大规模数据失真
团队通过多套标准化数据集开展验证,证实这类噪声并不是随机产生,而是由一小部分结构异常的分子集中造成。
常规细胞核测序数据中,实际检测得到的条形码数量会数倍高于理论真实值——相当于每有一条真实信号,就伴随多条伪造信号,根源来自文库构建、扩增、连接过程中产生的系统性异常。
Spike-in合成RNA对照实验进一步证实:异常序列不是随机分布,具备明显的位置偏好。大量伪条形码来源于非特异性扩增、不完全连接、脱靶结合,还可以绕过传统质控,直接混入最终的基因表达矩阵,掩盖细胞真实信号。
简单来说:传统质控只能筛选“字写错的序列”,无法剔除“字都对、但格式完全错误的假序列”。
技术创新
双层“结构安检”,搭建前置过滤体系
针对传统质控的结构盲区,团队构建了双层结构完整性校验体系Pattern-Filter:

第一层为模式结构过滤:依据不同测序平台文库设计规则,严格校验poly(T)、TSO、连接子等必备锚定结构,支持自定义汉明(Hamming Distance)距离阈值,可以灵活平衡数据保留率与过滤强度。

第二层为碱基规范过滤:检查条形码、分子标签(UMI)区域碱基质量,剔除包含模糊碱基的读段。

平台结构锚点、条形码组成与过滤流程
该工具兼容10xGenomics、Drop-seq、Seq-Well、BDRhapsody、SPLiT-seq等绝大多数单细胞测序平台,适配R1/R2多种条形码排布方式,直接嵌入现有标准流程即可,无需额外改造。
核心成效
极小数据代价,极大净化数据质量
大量标准数据集验证表明:Pattern-Filter仅过滤2%-18%的少量异常读段,即可最高降低80%伪条形码多样性,实现“低成本、高净化”的极致质控效果。几组代表性验证结果如下:
Spike-in对照数据:完美匹配的序列占比从63.4%提升至85.7%,伪条形码噪声降低近三分之二,数据纯净度显著提高。
小鼠脑组织大规模单细胞数据:仅过滤18.4%读段,就消除77.1%的伪条形码,大幅校正细胞定量偏差。
SPLiT-seq多标签测序体系:依靠连接子结构校验,保留70%有效数据的同时,清除68.2%结构伪影噪声。
经过Pattern-Filter处理后,不同技术重复样本之间一致性明显提升,原始数据自带的批次干扰被削弱,条形码丰度分布趋于一致。
研究进一步揭示异常分子的两种入侵路径:完美匹配入侵、单碱基纠错吸附。单个细胞内可存在数千条噪声序列,会严重干扰稀有细胞、低丰度信号的识别。
应用价值
适配基础研究、精准医学、细胞治疗多场景
Pattern-Filter为行业填补了单细胞测序领域缺失的结构质控方案:
面向基础科研:校正细胞分群、细胞轨迹推断的结果偏差;
面向药企、测序服务商:嵌入标准化分析流程SOP,提升多批次、多平台产出数据之间的可比性;
面向精准医学研究:穿刺样本、脑脊液等珍贵样本对噪声高度敏感,结构噪声很容易掩盖肿瘤稀有细胞等关键信号,前置净化可以更好地保留微弱的真实生物学信号。
Pattern-Filter为单细胞测序前置质控分析工具,用于优化序列结构、降低背景噪声、提升分析准确度,不直接用于临床诊断,也不能直接指导用药。文中提到的临床相关价值,均来自大数据验证后的科学推演与应用展望,未来走向临床转化,还需要开展前瞻性队列研究以及完善伦理评估。
深圳理工大学合成生物学院科研助理教授苏强为论文第一作者,深圳理工大学合成生物学院杰出教授连祺周为通讯作者,深圳湾实验室龙轶博士、华南师范大学生命科学学院周小明博士、深圳理工大学合成生物学院科研助理教授段福宇为共同作者。该研究获得国家重点研发计划、“合成生物学伦理框架与政策体系构建”项目、深港联合资助计划等项目的联合资助。
来源:合成生物学院责编:余彬审校:张梦霞、李韵、王之康
为SUAT点个赞和在看吧
高招云直播