ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

NCBI 16S rDNA数据上传实用手册:SRA/BioSample完整流程

NCBI 16S rDNA数据上传实用手册:SRA/BioSample完整流程 几个月前帮实验室整理一批16S rDNA的测序数据准备投文章时才发现——NCBI上传这事儿远比想象中琐碎。很多人以为就是把FASTQ文件拖上去点个submit结果不是文件格式报错就是BioSample属性填不全再不然就是审阅意见下来要求补充引物信息一来一回能磨掉一周。这篇东西我就把自己踩过的坑、对照官方文档核对过的细节完整梳理一遍给准备向NCBI上传16S rDNA数据的同行做一个直接能照着操作的手册。先说明白这篇文的适用对象你是做微生物多样性、菌群结构分析、环境微生物或者临床样本菌群研究的手里有16S rDNA测序的原始数据双端FASTQ为主准备投期刊期刊要求数据上传NCBI SRA并给出登录号或者你想在公共数据库里公开一批自己的测序数据。那么这篇内容对你有用。如果你拿到的是已经拼接好的完整16S基因序列想提交到GenBank做系统发育分析这篇文章也会覆盖因为通道和界面是相通的只是选的数据库入口不同。1. 上传前先搞清楚NCBI对16S rDNA数据有哪些要求有一说一NCBI的文档写得并不算难懂但它是给懂数据库逻辑的人看的不是给第一次提交数据的人看的。我建议你先不要急着去界面里乱点先花半小时把下面这些概念理顺后面能少走很多弯路。1.1 16S rDNA数据类型与NCBI对应归档库NCBI的数据库体系里和16S rDNA数据直接相关的主要有三个归档库BioProject、BioSample、SRASequence Read Archive以及GenBank的16S rRNA数据库一般通过BankIt提交。它们的分工是数据库存什么登录号示例BioProject整个研究项目的描述包含研究目标、测序策略、项目归属PRJNA123456BioSample每个样本的物理描述比如来源环境、宿主、采集地、样本类型SAMN12345678SRA测序仪直接产出的原始序列数据FASTQ/BAM格式SRX1234567GenBankBankIt拼接好的16S序列带注释的FASTA或GenBank flatfile格式PP123456很多人第一次看到这堆编号就懵了其实可以用一个生活化的类比来理解BioProject是项目计划书BioSample是实验记录本里的样本登记表SRA是原始实验数据的仓库。绝大多数期刊要求的上传指的是把数据存到SRA因为SRA存的是最原始的测序信号其他人拿到后可以自己重新跑分析流程。如果你的研究重点是新物种鉴定、全长16S序列的系统发育分析那还需要把拼接后的序列单独提交到GenBank。这两个通道不是二选一的关系而是原始数据进SRA代表序列进GenBank的并行关系。1.2 元数据整理样本信息表怎么填才不会被退回NCBI对核数据的态度是宁可要多余的描述也不能缺关键项。我在第一次提交时就是吃了信息不足的亏——BioSample审阅意见直接要求补充采样地坐标和宿主详细信息。16S rDNA数据必须提交的核心元数据包括样本名唯一、简明、不包含空格和特殊符号。建议用项目简称样本编号的组合比如GUTSS001太随意的话会在后面映射环节出问题。采集信息采样日期ISO格式YYYY-MM-DD、地理位置经纬度最好给NCBI支持度很高。样本来源环境样本就写环境类型soil_freshwater, gut_host等宿主样本就写宿主物种学名、宿主健康状况、取样部位。测序信息测序平台Illumina MiSeq/NextSeq/NovaSeq、目标区域16S V3-V4等、引物序列非常重要NCBI的SRA提交表单里专门有assay type和target gene的信息必须写明引物名称和序列否则部分审稿人直接拒。文库信息单端还是双端、插入片段长度。这里有个关键认知NCBI的工作人员不会帮你推断数据你给什么他们能看到的就只有什么。元数据不完整最常见的结果就是审阅打回让你补材料。与其对着退回邮件猜不如提交前对照SRA的metadata模板把每一项过一遍。1.3 序列文件的三种形态原始FASTQ、拼接FASTA与GenBank格式NCBI的实际上传支持三种数据形态各自的适用场景需要你先想明白原始FASTQ文件这是SRA收的标准文件包含测序读长和质量分数。如果你提交的是双端测序结果会得到两个文件R1和R2需要成对上传。拼接后的FASTA文件如果你做了序列拼接、且通过QC想提交一致性序列consensus sequence可以用FASTA格式提交到GenBank。但要注意GenBank的16S提交更推荐带注释的GenBank flatfile格式因为它能记录编码区域、rRNA特征等。GenBank格式flatfile带feature表注释的格式是BankIt实际生成的目标格式。特征表里有source、rRNA、gene等条目。我的建议是如果投期刊优先完整提交原始FASTQ到SRA。如果还要给物种鉴定文章补充代表序列再额外用BankIt提一条或一批拼接序列。这两个操作是独立的别混淆。2. 通道选型SRA、BioSample和GenBank到底走哪条路NCBI的上传入口多确实容易让人不知道从哪里进入。表面上看都是提交数据但其实入口背后的逻辑完全不同。我梳理出两条最常用的路径你照着判断就行。2.1 三个数据库的分工与协作关系提交的先后顺序其实非常固定先建BioProject再建BioSample之后根据需求走SRA通道或GenBank通道。这个顺序是NCBI的系统逻辑决定的因为SRA和GenBank的提交表单里都需要关联BioSample和BioProject登录号。BioProject在整个体系里的角色像个筐把所有关联的数据组织起来。一篇论文的数据应该只有一个BioProject下面可以挂很多BioSample每个BioSample下又可以挂多次SRA实验。从这个角度看NCBI不是在收数据是在按项目和样本组织数据。理解这一层你就明白为什么所有界面都在问你要BioProject ID和BioSample ID——它们是把数据锚定的两个钩子。2.2 两类场景原始测序数据 vs 组装/注释产物判断走哪条路的标准只有一条你的数据形态是原始的还是加工后的。如果你手上是测序仪下机的FASTQ并且在后续分析中还要做OTU聚类、多样性指数计算——请提交SRA。如果你已经获得了16S全长序列或近全长序列做了至少99%准确率的拼接想在GenBank里获得一个有注释的登录号并且这个序列在文章里作为代表序列出现——请走BankIt/GenBank通道。这两条通道的用途可以同时存在。最典型的做法是一篇土壤微生物多样性文章既要把所有样本的原始FASTQ上传SRA获得SRP登录号也要把其中新发现的菌株16S序列上传GenBank获得单独的序列号。两个登录号都会出现在论文里评审也都认。2.3 我的选型建议什么时候用SRA什么时候完整提交从我自己的项目经验出发选型建议是这样单纯为了满足期刊数据可用性要求只提交SRA即可。已经足够不需要额外做GenBank的BankIt。研究对象包括潜在的未培养新物种或者涉及新分类单元的描述一定要走BankIt提交16S代表序列同时把原始数据放SRA。做了全基因组测序同时包含16S信息走SRA上传整个WGS原始数据单独把16S序列刨出来走BankIt。只想公开拼接好的16S序列不想公开原始数据只走BankIt但要注意有些期刊会要求原始数据可能需要事先确认。这里想提醒一句SRA的数据在release日期之前是保密的评审可以凭登录号和审阅人token访问不影响盲审。BankIt的GenBank序列默认公开发布但可以设定hold until date在指定日前不公开。两者的可见性控制机制不同别搞混。3. 提交流程逐步拆解从创建BioProject到上传序列文件这一节是整个操作的核心。我会按点击顺序走一遍并告诉你每一步要准备什么、填什么、以及常见错误怎么避。3.1 注册与登录NCBI账号体系使用要点上传数据必须有一个NCBI账号。注册很简单用邮箱就能创建。有一点要注意NCBI账号密码忘了之后的找回流程比较绕而且如果你在提交过程中会话超时系统会在约30分钟无操作后登出填了一半的表格可能丢失。所以我强烈建议提交前把所有要填的信息准备到一个文本文件里正式填表时直接复制粘贴。注册完成后进入Submission Portal你会看到SRA、BioProject、BioSample这几个入口。这里建议的顺序是BioProject - BioSample - SRA。3.2 创建BioProject元数据的写法进入BioProject提交界面后有几个关键项需要认真填写Project title建议直接写成论文标题的简化版例如Influence of fertilizer regime on rhizosphere bacterial communities of maize (16S rRNA gene amplicon sequencing)。这个标题会显示在SRA登录页面上以后别人检索时能看到。Project description写清楚研究背景和目的一两段话即可不需要复制论文摘要。Project type选择Research Study即可。如果你的16S数据是某个大型项目比如地球微生物组计划的一部分可以关联umbrella project否则不用管。Relevance选Medical或Environmental或Agricultural取决于实际研究背景。BioProject创建成功后页面会显示PRJNA开头的登录号。我习惯直接把所有登录号记在自己本地的提交日志里方便后续对应。3.3 创建BioSample16S样本属性怎么填BioSample提交是整个流程中最容易出错的地方因为它的表单是动态的会根据你选的包类型变化。16S rDNA测序通常选Microbe、Metagenome或Environmental包类型具体看样本性质纯培养菌株选Microbe动物/人体肠道样本选Host-associated需要填写宿主物种、宿主年龄、性别、取样部位等土壤/水体/空气样本选Environmental需要填写经纬度、环境特征biome、feature等这里有一个特别实用的操作BioSample提交页面支持上传Excel表批量创建样本尤其是样本数多的时候几千个样本不可能一个个手填。Excel模板可以从NCBI的BioSample submission页面下载里面有标准的列名定义。填的时候注意每个样本的sample_name必须唯一不能有空格不能用中文不要用/、\、:等字符。经纬度格式建议使用十进制例如42.36 -71.05NCBI支持度很好不要写成度分秒。时间标准格式YYYY-MM-DDISO 8601其他格式会被回退。一次性创建多个样本时Excel模板的列很多看起来很吓人。我的方法是先下载模板删掉不用的列千万别动列头保留必填列和我的样本相关列然后填好上传。如果上传报错NCBI会给一个可下载的报错文件里面有具体是哪一行、哪一列、什么值不合格照着改就行。3.4 提交SRA实际操作细节BioSample创建完后进入SRA提交界面会要求你选择数据来源、测序平台、数据文件形式。SRA提交有几个核心选项Illumina双端测序Choose platform里选IlluminaLibrary strategy选AMPLICONLibrary source按要求Library selection选PCR。这一点很关键因为16S文库通常经过PCR扩增不能选成GENOMIC或RANDOM。File format原始FASTQ文件直接用.gz压缩格式上传NCBI接受FASTQ.fastq.gz、FASTA.fasta.gz、BAM等。注意文件名里最好别带特殊符号。Assay type选择AMPLICON然后在Target gene里填写16S rRNA并附上引物序列信息。文件上传本身有三个通道网页直接拖拽、FTPAspera命令行/FileZilla、以及SRA的远程上传工具。我个人最推荐网页上传但需要注意浏览器限制——文件太大容易断断续续我用过的方案是单个文件小于10GB直接网页上传。大量文件或超大文件用NCBI推荐的Aspera命令行ascp可以断点续传速度也稳定。不过Aspera需要在本地安装客户端且必须从NCBI的SRA提交界面获取identity文件通常是名为asp-ora-priv.ora的凭证文件或者直接使用SRA提交邮件里下发的key。SRA提交完成后系统会给你一个SRR或者SRX的运行号随后进入审阅队列。到此整个提交的动作已经完成剩下的就是等待和检查。4. 容易被忽略的序列文件检查项格式、命名与质量控制规格上NCBI官方文档说得很清楚但真正常见的上传退回原因恰恰是在那些看起来很简单的地方。我在这里列几个我在实验室里反复帮人排查了几轮的问题。4.1 文件名与样本名对应关系NCBI的SRA回传信息是基于文件名映射到样本名的。如果你的FASTQ文件名和BioSample里的sample_name对不上NCBI的自动QC会直接报错。比如你的BioSample里叫GUTSS001提交的FASTQ文件名却是Sample1_R1.fastq.gz系统可以在网页表单里做手动映射但这是人为因素最高发的一个环节。我的习惯是在交付上机前就把所有样本的文件名统一成sample_name_platform_lane_read的格式例如GUTSS001_R1.fastq.gz、GUTSS001_R2.fastq.gz。这个习惯帮我省了非常多的映射麻烦强烈建议你在实验设计阶段就定下命名规则。4.2 FASTQ格式检查读头和质量的坑FASTQ格式本身不复杂但继续往下挖就有讲究NCBI的SRA接受PHRED33编码的主流格式Illumina平台现在基本都是这个编码方案。如果你用的是旧平台产生的数据要注意质量值编码是PHRED64还是33。格式不一致虽然在NCBI的校验中不一定被拒但会在后续别人下载跑分析时出错。更实际的问题是提交前你自己要先跑一遍FastQC确认质量值分布、接头残留、碱基组成是否正常。NCBI不会替你质控但它会记录你提交文件里统计到的平均质量值。如果你的文件里包含大量低质量片段即便通过审核下载方也可能在做质控时产生困惑。4.3 双端序列的提交方式16S测序绝大多数都是双端reads。SRA提交时你可以把两个文件分开传然后在SRA表单中把它们配对。配对的一个关键是NCBI要求R1和R2的文件名必须高度一致仅末尾不同一般是一个_1一个_2或_R1/_R2。否则自动配对会失败。如果你已经做了paired-end合并如用VSEARCH、PEAR、FLASH合并成一条长序列想让合并后的序列提交那一般就不送去SRA了而是拼接汇总后走GenBank的BankIt。偶尔也有研究者把合并后的FASTQ放到SRA这在技术上是允许的但NCBI官方建议保留原始未合并的FASTQ这样信息不丢失。4.4 原始数据是否要去接头和引物这是个在Bioinformatics社区都讨论过很多遍的问题。我的建议是提交原始数据时保留测序仪直接下机的FASTQ不要去接头、不要去引物、不要做任何长度修剪。原因有三条审稿人和数据复用者希望看到最原始的状态。NCBI的SRA下载后别人会根据自己的流程处理你提前裁剪反而破坏了数据的可复用性。你去引物后读长会变如果去引物过程出错再想恢复原始数据就没机会了。如果你实在需要干净的数据可以同时提交原始FASTQ和处理后数据但要在SRA表单的processing information里说明。不做特殊处理时直接标明Raw reads, no trimming即可。5. 提交后的事状态追踪、release日期设置与常见退回原因到了这一步数据已经在NCB队列里跑流程了。但仍不能掉以轻心。我经历过一次提交后什么都不管结果过了两周看邮件才发现被退回了原因只是Sample属性里的一个日期格式错误这本来一分钟就能改好。5.1 提交后的审阅流程提交完成后你会在注册邮箱收到一封确认邮件里面有一个Submission ID同时登录NCBI后可以在Submissions页面看到状态。状态会有这几个阶段ProcessingNCBI收到数据开始自动校验包括文件格式、元数据完整性、FASTQ校验等一般几小时到一两天。In QC人工审阅阶段检查你填写的元数据是否合理有时候会自动给你发来需要补充的信息必须回复。Action needed你的提交有问题需要登录NCBI后台修改或者通过邮件回复Explain。Released/Public数据公开可以获得最终的登录号SRR号或者hold状态hold until date。整个过程如果一切顺利一般3-5个工作日内就能拿到登录号。如果卡在Action needed不要慌点进去看具体的报错信息大部分都是属性写错或格式不对。5.2 常见的驳回/警告原因以及如何应对我把平时实验室成员踩过的坑汇总成一个表方便你自查驳回/警告原因具体情形解决办法BioSample与SRA样本数不一致某个样本在BioSample里漏建或重复核实两边样本名确保要上传的数据都能映射到BioSample日期格式错误采样日期写成2024/3/1或2024年3月1日统一改成2024-03-01格式引物信息缺失只写16S V3-V4未提供具体序列在SRA表单的PCR primer region中填写正向和反向引物序列如338F: ACTCCTACGGGAGGCAGCAG806R: GGACTACHVGGGTWTCTAAT定位信息缺失Environmental包里没填经纬度按采样记录补填允许精确到四舍五入的小数点后几位FASTQ文件名映射失败文件列表与BioSample sample_name对不上在SRA提交表中手动拖拽匹配或者重新命名后覆盖上传测序平台信息错误NovaSeq写成MiSeq对照测序报告填入准确平台信息质控数据异常平均质量过低NCBI自动标记回看实验室质控结合FastQC报告评估后再决定是否继续提交其中引物序列这一项是期刊审稿人必然关注的内容NCBI退回的可能性反而没那么大但如果你自己提交时留空了审稿人看SRA元数据时大概率会质疑。建议无论NCBI是否强制都把引物序列写上。5.3 release日期与数据发布策略SRA提交时有两个时间点很关键Submission date和Release date。前者是你提交的日期后者是数据何时公之于众的日期。NCBI默认release date是提交完成审阅后的一个固定日期但你可以手动设置一个未来的日子——在论文正式上线前保持数据保密论文见刊后自动公开。具体操作在SRA提交后台的对应项目下选择set release date填写日期。要注意hold状态最长可以设置到提交后三年到期必须公开。审稿人可以看到数据但无法被普通公众访问。论文正式published前确保release日期已设为论文见刊当天或之后否则数据会提前泄露给公众。我自己的习惯是在submit时就设置release date为计划投稿日期加四个月的一个宽裕值等论文真正接收后再调整到见刊日。这种策略平衡了文章盲审和提前公开风险。6. 再说点实际操作中积累的经验文件传输、备份和后续引用这一节不是NCBI官方文档里会告诉你的但我认为对顺利完成整个上传最有帮助。6.1 大文件传输网页上传之外的备选方案当你手里的样本量上百个、FASTQ总量上T的时候网页上传基本没法用。这时候我推荐两个方案Aspera命令行ascpNCBI官方支持速度快支持断点续传。使用ascp时需要下载SRA提交页面的私钥文件然后执行类似ascp -i /path/to/aspera_private_key -QTr -l 300M -k 1 usersubmit.ncbi.nlm.nih.gov:/path/to/folder /local/data/directory参数的作用是-l 300M限制带宽避免占满实验室的网络-k 1开启断点续传。这个命令我实测下来比网页稳定太多尤其适合批量提交。SRA Toolkit中的辅助工具老版本里有一些FTP上传插件现在纯FTP已经越来越边缘化但如果你们实验室网络对某些端口有限制FTP仍然可以作为一个后备方案。提醒一句上传大的文件前先确认本地磁盘有足够空间文件上传过程中不要手动删源最好准备一份MD5校验值方便判断上传的压缩包是否有损坏。6.2 上传数据的本地备份NCB的SRA是一个数据归档系统但它不会主动催你保留原始数据。我的习惯是FASTQ原始文件在本地集群和外部硬盘上放双份且专门建一个文件夹保存已提交到SRA的数据清单里面记录每个文件对应的SRR登录号、提交日期、格式以及BioSample登录号。这样以后无论什么时候需要追溯都能在一分钟内找到对应关系。有人说NCBI已经帮我存数据了本地可以删这种想法非常危险。数据显示NCBI的存储是可靠但一旦你自己的数据有后续分析需求比如重新质控、改变参数重新比对本地没有原始文件就寸步难行。6.3 后续引用与论文中的数据可用性声明数据上传完成拿到登录号后记得在论文的方法学和Data Availability Statement里写明以下内容SRA访问号一般是SRP/PRJNA开头BioProject访问号个别样本的BioSample访问号标准的写法类似The raw sequencing data have been deposited in the NCBI Sequence Read Archive under the BioProject accession number PRJNA123456对应SRA accession: SRP123456。在这里我还想强调NCBI每个登录号都可以配合一个简单的reviewer token让审稿人在数据保密期访问。在提交SRA后界面上会生成一个令牌字符串一定要附在给审稿人的投稿信或数据可用性声明里。很多人在这一步忘了复制审稿人会发邮件来催白白耽误时间。6.4 一个容易被忽略的小技巧使用提交日志如果你经常要上传多个项目的数据强烈建议在本地维护一个提交日志。表中的列可以是提交日期、项目名称、BioProject ID、BioSample ID、SRA ID、文件数量、总大小、release日期、对应论文、状态备注。有了这个日志月底写总结、和编辑沟通数据问题时都能省很多事。它本质上就是给数据库提交这件事建立一个项目管理表。另外NCBI的Portal账号体系其实还内置了API接口如果你们实验室有编程能力的成员可以探索用Python/Perl脚本调用SRA的API来查询上传状态。不过对多数人来说网页后台的可见状态已经够了脚本属于高级玩法这里不展开。写在最后的个体经验上传一次16S rDNA数据到NCBI最花时间的地方从来不是网络的传输而是把实验记录里的信息转换成NCBI能识别的元数据。用一句话概括我的体会数据上传不是传文件这个动作而是一次针对实验完整性的自我审阅。很多人会忽略这个环节但恰恰是元数据写得好不好决定了一批数据几年之后还有没有被人重用的价值。借这篇分享的机会也推荐大家在拿到登录号之后去NCBI的SRA页面再自己搜一下自己提交的项目确保检索结果里的所有信息是可读的、准确的。这是最简单也最踏实的一次最终确认。等你看到自己的数据在全球公共数据库中安安稳稳地躺着那份数据真的可用了的感觉是发文章那一刻给不了的。
返回列表