STAR:转录组数据分析中的高效比对工具介绍

作者：陈宏儒64721 | 来源：互联网 | 2024-11-02 10:26

欢迎关注“生信修炼手册”！STAR是一款专为RNA-seq数据设计的高效比对工具，以其卓越的速度和高灵敏度著称。该软件在处理大规模转录组数据时表现出色，能够显著提高比对效率和准确性。此外，GATK推荐使用STAR进行预处理步骤，以确保后续分析的可靠性。

欢迎关注”生信修炼手册”!

STAR是一款RNA_seq数据专用的比对软件，比对速度非常快，最大的优势是灵敏度高，GATK推荐采用STAR比对，然后进行下游的SNP分析。软件的源代码保存在github上，地址如下

https://github.com/alexdobin/STAR

安装过程如下

wget https://github.com/alexdobin/STAR/archive/2.6.1b.tar.gz tar xzvf 2.6.1b.tar.gz

解压缩之后，在bin/Linux_x86_64_static目录下，提供了编译好的可执行文件STAR。和hisat等软件不同，STAR将所有的功能整合在了同一个程序中，通过切换runMode来执行不同的任务。

1. 构建基因组索引

运行比对前，首先需要对基因组建立索引，建立索引对应的runMode为genomeGenerate, 基本用法如下

STAR --runMode genomeGenerate \ --runThreadN 20 \ --genomeFastaFiles hg19.fasta \ --genomeDir hg19_STAR_db \ --sjdbGTFfile hg19.gtf \ --sjdbOverhang 149

建立索引需要基因组的fasta和gtf文件，通过genomeFastaFiles和sjdbGTFfile这两个参数分别指定；STAR构建索引需要指定一个输出目录，这个目录必须事先创建好，在该目录下，会生成许多文件，所以必须有写权限；runThreadN指定线程数；sjdbOverhang的值默认为100，在实际设置时，最佳取值为max(read_length) - 1。

在构建索引时，还支持加入intron的区间信息，通过sjdbFileChrStartEnd指定对应的文件，多个文件用逗号分隔，这种格式的文件是由STAR比对产生的，通常用于2-pass比对模式。

官方推荐基因组的fasta采用primary_assembly版本, 不应该包含alt_scaffold和patches。对于human而言，NCBI的链接如下

ftp://ftp.ncbi.nlm.nih.gov/genomes/refseq/vertebrate_mammalian/Homo_sapiens/latest_assembly_versions/GCF_000001405.38_GRCh38.p12/GCF_000001405.38_GRCh38.p12_assembly_structure/Primary_Assembly/

Ensembl链接如下

ftp://ftp.ensembl.org/pub/release-93/fasta/homo_sapiens/dna/Homo_sapiens.GRCh38.dna.primary_assembly.fa.gz

2. 运行比对

STAR支持fasta/fastq格式的输入文件，如果序列文件是压缩之后的，需要用readFilesCommand参数指定文件解压缩的方法，对于gzip压缩的文件而言，有以下两种下写法

--readFilesCommand zcat --readFilesCommand gzip -c

比对完成后，会输出许多文件，包含4个类别

log文件
sam文件
bam文件
剪切位点文件

每个文件都有事先定义好的名字，当多个样本同时运行时，为了加以区分，可以通过outFileNamePrefix指定输出文件的前缀。前3种类型的文件都比较容易理解，剪切位点文件实际上是根据mapping情况，估算出来的intron区间的信息，默认的文件名称为SJ.out.tab。

默认输出的比对文件为SAM格式，为了节省磁盘空间，方便下游分析，可以通过outSAMtype参数指定输出bam文件，该参数有两个字段值，第一个值指定文件类型，取值有SAM和BAM两种，第二个值指定是否排序，取值范围包括Unsorted, SortedByCoordinate, 写法如下

--outSAMtype BAM SortedByCoordinate

上述写法输出排序之后的bam文件。

单端数据比对的基本用法如下

STAR \ --runThreadN 20 \ --genomeDir hg19_STAR_db \ --readFilesIn reads.fq \ --sjdbGTFfile hg19.gtf \ --sjdbOverhang 149 \ --outFileNamePrefix sampleA \ --outSAMtype BAM SortedByCoordinate

双端数据比对的基本用法如下

STAR \ --runThreadN 20 \ --genomeDir hg19_STAR_db \ --readFilesIn r1.fq.gz r2.fq.gz \ --readFilesCommand zcat \ --sjdbGTFfile hg19.gtf \ --sjdbOverhang 149 \ --outFileNamePrefix sampleA \ --outSAMtype BAM SortedByCoordinate

以上只是基本的比对，STAR官方更推荐使用2-pass比对模式，即比对两次，有以下两种方式

multi-sample 2-pass
第一次比对和上述的用法一致，比对完之后，每个样本会产生一个intron的区间文件SJ.out.tab; 在第二次比对之前，重新构建一次基因组的索引，添加所有样本的SJ.out.tab文件，然后利用新的基因组索引重新比对。这种做法综合了多个样本的intron信息，比对的灵敏度会更高，缺点是操作比较繁琐。
per-sample 2-pass
对于单个样本，在比对时直接添加--twopassMode Basic参数，软件会自动进行两次比对，将第一次比对的SJ.out.tab加入到索引，然后重新比对。这种方法操作简单，适用于单个样本的2-pass 比对。

更多参数和用法请参考官方文档。

·end·

—如果喜欢，快分享给你的朋友们吧—

扫描关注微信号，更多精彩内容等着你！

推荐阅读

js
资源推荐 | TensorFlow官方中文教程助力英语非母语者学习

来源：机器之心。本文详细介绍了TensorFlow官方提供的中文版教程和指南，帮助开发者更好地理解和应用这一强大的开源机器学习平台。 ... [详细]

蜡笔小新 2024-12-28 09:00:51
ip
使用Python在SAE上开发新浪微博应用的初步探索

最近重新审视了新浪云平台（SAE）提供的服务，发现其已支持Python开发。本文将详细介绍如何利用Django框架构建一个简单的新浪微博应用，并分享开发过程中的关键步骤。 ... [详细]

蜡笔小新 2024-12-26 13:36:52
get
Transforming the Future of Virtual Worlds

Explore how Matterverse is redefining the metaverse experience, creating immersive and meaningful virtual environments that foster genuine connections and economic opportunities. ... [详细]

蜡笔小新 2024-12-28 09:44:49
get
技术分享：从动态网站提取站点密钥的解决方案

本文探讨了如何从动态网站中提取站点密钥，特别是针对验证码（reCAPTCHA）的处理方法。通过结合Selenium和requests库，提供了详细的代码示例和优化建议。 ... [详细]

蜡笔小新 2024-12-28 04:11:47
get
Java 中的 BigDecimal pow()方法，示例

Java 中的 BigDecimal pow()方法，示例 ... [详细]

蜡笔小新 2024-12-27 20:54:03
blob
构建基于BERT的中文NL2SQL模型：一个简明的基准

本文探讨了将自然语言转换为SQL语句（NL2SQL）的任务，这是人工智能领域中一项非常实用的研究方向。文章介绍了笔者在公司举办的首届中文NL2SQL挑战赛中的实践，该比赛提供了金融和通用领域的表格数据，并标注了对应的自然语言与SQL语句对，旨在训练准确的NL2SQL模型。 ... [详细]

蜡笔小新 2024-12-27 17:36:19
include
扫描线三巨头 hdu1928hdu 1255 hdu 1542 [POJ 1151]

学习链接：http:blog.csdn.netlwt36articledetails48908031学习扫描线主要学习的是一种扫描的思想，后期可以求解很 ... [详细]

蜡笔小新 2024-12-26 20:04:36
include
HTML Attribute Naming Conventions for Fast Components

This document outlines the recommended naming conventions for HTML attributes in Fast Components, focusing on readability and consistency with existing standards. ... [详细]

蜡笔小新 2024-12-26 19:13:45
ip
告别传统文件传输，迎接新一代高效工具Croc

在现代网络环境中，两台计算机之间的文件传输需求日益增长。传统的FTP和SSH方式虽然有效，但其配置复杂、步骤繁琐，难以满足快速且安全的传输需求。本文将介绍一种基于Go语言开发的新一代文件传输工具——Croc，它不仅简化了操作流程，还提供了强大的加密和跨平台支持。 ... [详细]

蜡笔小新 2024-12-26 16:16:06
ip
2011年12月13日：人生的转折点

在即将迎来26岁生日之际，作者的人生陷入了低谷。经过近三年的硕士学习后，最终决定退学，并且面临没有工作经验的困境。尽管如此，作者依然坚定地选择为自己的人生负责。 ... [详细]

蜡笔小新 2024-12-26 13:51:06
ip
Hadoop入门与核心组件详解

本文详细介绍了Hadoop的基础知识及其核心组件，包括HDFS、MapReduce和YARN。通过本文，读者可以全面了解Hadoop的生态系统及应用场景。 ... [详细]

蜡笔小新 2024-12-26 13:12:48
ip
libsodium 1.0.15 发布：引入重大不兼容更新

最新发布的 libsodium 1.0.15 版本带来了若干不兼容的变更，其中包括默认密码散列算法的更改和其他重要调整。 ... [详细]

蜡笔小新 2024-12-26 11:03:58
bash
VSCode与Gitee集成：项目提交的高效实践

本文介绍如何利用VSCode内置的Git工具将项目提交到Gitee，简化Git命令的使用，提升代码管理效率。同时分享一些常见的踩坑经验和解决方案。 ... [详细]

蜡笔小新 2024-12-26 10:16:21
bash
Composer Registry Manager：PHP的源切换管理工具

本文介绍了一个用于Composer的源切换管理工具——Composer Registry Manager。该项目旨在简化Composer包源的管理和切换，避免与常见的CRM系统混淆，并提供了详细的安装和使用指南。 ... [详细]

蜡笔小新 2024-12-25 19:34:14
ip
基于KVM的SRIOV直通配置及性能测试

SRIOV介绍、VF直通配置，以及包转发率性能测试小慢哥的原创文章，欢迎转载目录?1.SRIOV介绍?2.环境说明?3.开启SRIOV?4.生成VF?5.VF ... [详细]

蜡笔小新 2024-12-25 19:26:39

陈宏儒64721

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章