前言
单细胞RNA测序(scRNA-seq)是近年来生物信息学最火热的技术之一。本文将带你从零开始,用 R 和 Seurat 完成一次完整的聚类分析流程。
环境准备
首先安装并加载必要的 R 包:
# 安装 Seurat
install.packages("Seurat")
library(Seurat)
library(dplyr)
library(ggplot2)
数据加载
我们使用 10X Genomics 的公开数据集作为示例:
pbmc_data <- Read10X(data.dir = "data/pbmc/")
pbmc <- CreateSeuratObject(counts = pbmc_data, project = "pbmc", min.cells = 3, min.features = 200)
质量控制
过滤低质量细胞和双细胞:
pbmc[["percent.mt"]] <- PercentageFeatureSet(pbmc, pattern = "^MT-")
pbmc <- subset(pbmc, subset = nFeature_RNA > 200 & nFeature_RNA < 2500 & percent.mt < 5)
归一化与降维
pbmc <- NormalizeData(pbmc)
pbmc <- FindVariableFeatures(pbmc, selection.method = "vst", nfeatures = 2000)
pbmc <- ScaleData(pbmc)
pbmc <- RunPCA(pbmc, features = VariableFeatures(object = pbmc))
聚类与可视化
pbmc <- FindNeighbors(pbmc, dims = 1:10)
pbmc <- FindClusters(pbmc, resolution = 0.5)
pbmc <- RunUMAP(pbmc, dims = 1:10)
DimPlot(pbmc, reduction = "umap")
总结
通过以上步骤,我们完成了从原始矩阵到聚类可视化的全流程。后续可以结合 marker 基因进行细胞类型注释。